更多>>关于我们
西安鲲之鹏网络信息技术有限公司从2010年开始专注于Web(网站)数据抓取领域。致力于为广大中国客户提供准确、快捷的数据采集相关服务。我们采用分布式系统架构,日采集网页数千万。我们拥有海量稳定高匿HTTP代理IP地址池,可以有效获取互联网任何公开可见信息。
您只需告诉我们您想抓取的网站是什么,您感兴趣的字段有哪些,你需要的数据是哪种格式,我们将为您做所有的工作,最后把数据(或程序)交付给你。
数据的格式可以是CSV、JSON、XML、ACCESS、SQLITE、MSSQL、MYSQL等等。
更多>>技术文章
-
西安鲲之鹏
发布时间:2016-07-29 15:18:58
【折腾几个小时的结果】py2exe打包"selenium + Firefox"应用,运行出现找不到"webdriver.xpi"或"webdriver_prefs.json"问题的原因及解决。
原因:C:\Python27\Lib\site-packages\selenium\webdriver\firefox\firefox_profile.py中os.path.dirname(__file__)获取到的路径是在exe文件(假设为test.exe)的下级目录,例如 "dist\\test.exe\\selenium\\webdriver\\firefox\\",这当然不存在。
解决:
1)复制webdriver.xpi和webdriver_prefs.json到test.exe目录下;
2)编辑firefox_profile.py文件,修改两处"os.path.join(os.path.dirname(file)," 为 "os.path.join(os.path.dirname(file), '..\..\..\..\'";
3)重新打包,问题解决。 -
西安鲲之鹏
发布时间:2016-07-27 14:54:11
-
西安鲲之鹏
发布时间:2016-07-27 12:11:26
Selenium + Firefox 使用Socks5代理 >>> http://t.cn/Rtq33wL
e.g. network.proxy.socks;10.10.10.1
network.proxy.socks_port;8999
network.proxy.socks_remote_dns;true
network.proxy.socks_version;5 -
西安鲲之鹏
发布时间:2016-07-26 10:13:19
Instagram的动态翻页(e.g. http://t.cn/Rtbd09M)最多可以加载多少条数据?经过鲲之鹏技术人员实测,最多可以加载到前~1780条数据。PS:改变每页条数后能看到的页数就减少了,总共可见的数据条数没有增加。
-
西安鲲之鹏
发布时间:2016-07-25 17:38:54
-
西安鲲之鹏
发布时间:2016-07-13 11:11:51
【CURL如何指定出口IP】
curl --interface 104.243.141.116 http://t.cn/R5km3Id
{
"origin": "104.243.141.116"
}
-
西安鲲之鹏
发布时间:2016-07-11 09:25:44