更多>>关于我们
西安鲲之鹏网络信息技术有限公司从2010年开始专注于Web(网站)数据抓取领域。致力于为广大中国客户提供准确、快捷的数据采集相关服务。我们采用分布式系统架构,日采集网页数千万。我们拥有海量稳定高匿HTTP代理IP地址池,可以有效获取互联网任何公开可见信息。
您只需告诉我们您想抓取的网站是什么,您感兴趣的字段有哪些,你需要的数据是哪种格式,我们将为您做所有的工作,最后把数据(或程序)交付给你。
数据的格式可以是CSV、JSON、XML、ACCESS、SQLITE、MSSQL、MYSQL等等。
更多>>技术文章
-
西安鲲之鹏
发布时间:2019-03-21 12:57:06
【经验分享】Ubuntu server下google-chrome启动出现"[5430:5430:0321/124708.367027:ERROR:browser_dm_token_storage_linux.cc(101)] Error: /etc/machine-id contains 0 characters (32 were expected)."问题的解决:
sudo cp /var/lib/dbus/machine-id /etc/machine-id
参考:http://t.cn/ExQt3an -
西安鲲之鹏
发布时间:2019-03-20 13:11:35
【经验分享】requests库使用py2exe打包之后出现"Could not find a suitable TLS CA certificate bundle"问题的解决:
原因是打包之后按默认路径无法找到cacert.pem文件。将cacert.pem复制到exe同目录下,然后在程序里设置REQUESTS_CA_BUNDLE环境变量,如下:
os.environ['REQUESTS_CA_BUNDLE'] = os.path.join(os.path.dirname(sys.argv[0]), 'cacert.pem')
重新打包,问题消失。
参考:http://t.cn/Rr8WYVR
-
西安鲲之鹏
发布时间:2019-03-18 11:03:48
【经验分享】Ubuntu上添加可信任根证书
1. 如果是pem格式的根证书,先重命名为 .crt格式,例如( mitmproxy-ca-cert.crt)。
2. sudo cp mitmproxy-ca-cert.crt /usr/local/share/ca-certificates。
3. sudo update-ca-certificates
update-ca-certificates命令将PEM格式的根证书内容附加到/etc/ssl/certs/ca-certificates.crt ,而/etc/ssl/certs/ca-certificates.crt 包含了系统自带的各种可信根证书. -
西安鲲之鹏
发布时间:2019-03-14 15:41:19
【经验分享】Python urllib2连接HTTPS网站出现“SSL routines:SSL23_GET_SERVER_HELLO:sslv3 alert handshake failure”问题(如图1所示)的解决。从这里github.com/pytorch/pytorch/issues/3193得知,Python2.7.9之前的版本连接某些HTTPS网站会有这个问题,之后的版本没有问题。于是测了下别的服务器上的Python2.7.12版本,果然没有问题(如图2所示)。
似乎也是跟SNI有关,去年我们曾写过一篇文章《SNI导致Python 2.7建立TLS连接出现104错误问题的解决》 ,也是升级到最新版本的Python之后问题解决,详细过程见这里 :http://t.cn/EZSeTBn
附:测试连接 http://t.cn/EMn51Uz
-
西安鲲之鹏
发布时间:2019-03-14 15:26:50
【经验分享】远程GeckoDriver的使用 - 鲲之鹏的技术人员在本文向您介绍如何远程使用GeckoDriver调用多台服务器上的Firefox浏览器进行数据抓取。 >>> http://t.cn/EMnLGuL
-
西安鲲之鹏
发布时间:2019-02-20 12:00:43
【经验分享】PDF表格抽取Python库 Camelot - http://t.cn/E7ao8cR
Camelot is a Python library that makes it easy for anyone to extract tables from PDF files!
依赖的库有点多,不过效果超赞!
实测效果:
图1为PDF原始文件截图;
图2为抽取为CSV后截图;
-
西安鲲之鹏
发布时间:2019-01-21 10:51:44
18年12月下旬淘宝升级了反爬虫策略,其中一项最重要的改变就是商品搜索必须要登录才能进行,登录之后访问频繁就会出现验证码。鲲之鹏的技术人员通过技术攻关,目前已有了突破性的进展。目前可以实现:
(1)自动登录,绕过淘宝对Selenium的屏蔽。
(2)自动搜索。
(3)验证码自动解决。
下面是我们测试过程的一段视频截屏。 西安鲲之鹏的微博视频 -
西安鲲之鹏
发布时间:2019-01-16 12:01:25
【经验分享】SSH本地端口映射。场景如下:
某Linux母机下有多台KVM虚拟机,虚拟机的VNC只开放了127.0.0.1的访问权限。如何远程连接这些VNC端口呢?
可以使用SSH本地端口映射实现,在本地机执行如下命令:
ssh -L 127.0.0.1:5901:127.0.0.1:5901 user@ip-of-linux-host
解释一下:监听本地5901端口,将5901端口的连接重定向到ip-of-linux-host主机的127.0.0.1:5901端口。
-
西安鲲之鹏
发布时间:2019-01-16 11:37:01
【经验分享】KVM调整磁盘大小:
1. 查看原磁盘大小。
qemu-img info win7.img
如图是80G。
2. 增加10G。
sudo qemu-img resize win7.img +10G
3. 查看增加后的磁盘大小。
qemu-img info win7.img
如果是90G。
4. 重启虚拟机,进入虚拟机磁盘管理再确认下。
如图2所示,多了一个10GB的空闲分区。可以新建一个分区,也可以使用磁盘扩展将其合并到C盘。
如果想要扩展指的分区的大小,可以使用virt-resize,具体请参考该文章:http://t.cn/EqnDSLx