更多>>关于我们
西安鲲之鹏网络信息技术有限公司从2010年开始专注于Web(网站)数据抓取领域。致力于为广大中国客户提供准确、快捷的数据采集相关服务。我们采用分布式系统架构,日采集网页数千万。我们拥有海量稳定高匿HTTP代理IP地址池,可以有效获取互联网任何公开可见信息。
您只需告诉我们您想抓取的网站是什么,您感兴趣的字段有哪些,你需要的数据是哪种格式,我们将为您做所有的工作,最后把数据(或程序)交付给你。
数据的格式可以是CSV、JSON、XML、ACCESS、SQLITE、MSSQL、MYSQL等等。
更多>>技术文章
-
西安鲲之鹏
发布时间:2016-08-08 19:05:23
-
西安鲲之鹏
发布时间:2016-08-04 08:48:55
更改当前用户的Shell。e.g. 修改为zsh: chsh -s /bin/zsh 根据提示输入密码即可。More details > http://t.cn/Rt6kAZY
-
西安鲲之鹏
发布时间:2016-08-03 11:35:32
"Selenium + Chrome Diver"使用带用户名密码认证(HTTP Basic Authentication)的代理方法 >>> http://t.cn/RtigU0J
-
西安鲲之鹏
发布时间:2016-08-02 16:56:47
-
西安鲲之鹏
发布时间:2016-07-31 11:54:59
-
西安鲲之鹏
发布时间:2016-07-29 15:18:58
【折腾几个小时的结果】py2exe打包"selenium + Firefox"应用,运行出现找不到"webdriver.xpi"或"webdriver_prefs.json"问题的原因及解决。
原因:C:\Python27\Lib\site-packages\selenium\webdriver\firefox\firefox_profile.py中os.path.dirname(__file__)获取到的路径是在exe文件(假设为test.exe)的下级目录,例如 "dist\\test.exe\\selenium\\webdriver\\firefox\\",这当然不存在。
解决:
1)复制webdriver.xpi和webdriver_prefs.json到test.exe目录下;
2)编辑firefox_profile.py文件,修改两处"os.path.join(os.path.dirname(file)," 为 "os.path.join(os.path.dirname(file), '..\..\..\..\'";
3)重新打包,问题解决。 -
西安鲲之鹏
发布时间:2016-07-27 14:54:11
-
西安鲲之鹏
发布时间:2016-07-27 12:11:26
Selenium + Firefox 使用Socks5代理 >>> http://t.cn/Rtq33wL
e.g. network.proxy.socks;10.10.10.1
network.proxy.socks_port;8999
network.proxy.socks_remote_dns;true
network.proxy.socks_version;5 -
西安鲲之鹏
发布时间:2016-07-26 10:13:19
Instagram的动态翻页(e.g. http://t.cn/Rtbd09M)最多可以加载多少条数据?经过鲲之鹏技术人员实测,最多可以加载到前~1780条数据。PS:改变每页条数后能看到的页数就减少了,总共可见的数据条数没有增加。
-
西安鲲之鹏
发布时间:2016-07-25 17:38:54