更多>>关于我们
西安鲲之鹏网络信息技术有限公司从2010年开始专注于Web(网站)数据抓取领域。致力于为广大中国客户提供准确、快捷的数据采集相关服务。我们采用分布式系统架构,日采集网页数千万。我们拥有海量稳定高匿HTTP代理IP地址池,可以有效获取互联网任何公开可见信息。
您只需告诉我们您想抓取的网站是什么,您感兴趣的字段有哪些,你需要的数据是哪种格式,我们将为您做所有的工作,最后把数据(或程序)交付给你。
数据的格式可以是CSV、JSON、XML、ACCESS、SQLITE、MSSQL、MYSQL等等。
更多>>技术文章
-
西安鲲之鹏
发布时间:2019-03-27 17:37:23
【经验分享】Ubuntu下如何快速定位一个服务对应的启动文件?
方法:
systemctl status <service>
或者
systemctl show <service>
例如,我们要查看x11vnc服务对应的启动文件路径(想增加一个启动参数)
systemctl status x11vnc
返回信息如下:
● x11vnc.service - Start x11vnc at startup.
Loaded: loaded (/lib/systemd/system/x11vnc.service; enabled; vendor preset: enabled)
Active: active (running) since 二 2019-03-26 17:11:24 CST; 24h ago
Main PID: 23307 (x11vnc)
CGroup: /system.slice/x11vnc.service
├─23307 /usr/bin/x11vnc -auth guess -forever -loop -noxdamage -repeat -rfbauth /etc/x
我们从中可以得知x11vnc服务启动文件位于: /lib/systemd/system/x11vnc.service
-
西安鲲之鹏
发布时间:2019-03-25 16:42:04
-
西安鲲之鹏
发布时间:2019-03-21 12:57:06
【经验分享】Ubuntu server下google-chrome启动出现"[5430:5430:0321/124708.367027:ERROR:browser_dm_token_storage_linux.cc(101)] Error: /etc/machine-id contains 0 characters (32 were expected)."问题的解决:
sudo cp /var/lib/dbus/machine-id /etc/machine-id
参考:http://t.cn/ExQt3an -
西安鲲之鹏
发布时间:2019-03-20 13:11:35
【经验分享】requests库使用py2exe打包之后出现"Could not find a suitable TLS CA certificate bundle"问题的解决:
原因是打包之后按默认路径无法找到cacert.pem文件。将cacert.pem复制到exe同目录下,然后在程序里设置REQUESTS_CA_BUNDLE环境变量,如下:
os.environ['REQUESTS_CA_BUNDLE'] = os.path.join(os.path.dirname(sys.argv[0]), 'cacert.pem')
重新打包,问题消失。
参考:http://t.cn/Rr8WYVR
-
西安鲲之鹏
发布时间:2019-03-18 11:03:48
【经验分享】Ubuntu上添加可信任根证书
1. 如果是pem格式的根证书,先重命名为 .crt格式,例如( mitmproxy-ca-cert.crt)。
2. sudo cp mitmproxy-ca-cert.crt /usr/local/share/ca-certificates。
3. sudo update-ca-certificates
update-ca-certificates命令将PEM格式的根证书内容附加到/etc/ssl/certs/ca-certificates.crt ,而/etc/ssl/certs/ca-certificates.crt 包含了系统自带的各种可信根证书. -
西安鲲之鹏
发布时间:2019-03-14 15:41:19
【经验分享】Python urllib2连接HTTPS网站出现“SSL routines:SSL23_GET_SERVER_HELLO:sslv3 alert handshake failure”问题(如图1所示)的解决。从这里github.com/pytorch/pytorch/issues/3193得知,Python2.7.9之前的版本连接某些HTTPS网站会有这个问题,之后的版本没有问题。于是测了下别的服务器上的Python2.7.12版本,果然没有问题(如图2所示)。
似乎也是跟SNI有关,去年我们曾写过一篇文章《SNI导致Python 2.7建立TLS连接出现104错误问题的解决》 ,也是升级到最新版本的Python之后问题解决,详细过程见这里 :http://t.cn/EZSeTBn
附:测试连接 http://t.cn/EMn51Uz
-
西安鲲之鹏
发布时间:2019-03-14 15:26:50
【经验分享】远程GeckoDriver的使用 - 鲲之鹏的技术人员在本文向您介绍如何远程使用GeckoDriver调用多台服务器上的Firefox浏览器进行数据抓取。 >>> http://t.cn/EMnLGuL
-
西安鲲之鹏
发布时间:2019-02-20 12:00:43
【经验分享】PDF表格抽取Python库 Camelot - http://t.cn/E7ao8cR
Camelot is a Python library that makes it easy for anyone to extract tables from PDF files!
依赖的库有点多,不过效果超赞!
实测效果:
图1为PDF原始文件截图;
图2为抽取为CSV后截图;