更多>>关于我们
西安鲲之鹏网络信息技术有限公司从2010年开始专注于Web(网站)数据抓取领域。致力于为广大中国客户提供准确、快捷的数据采集相关服务。我们采用分布式系统架构,日采集网页数千万。我们拥有海量稳定高匿HTTP代理IP地址池,可以有效获取互联网任何公开可见信息。
您只需告诉我们您想抓取的网站是什么,您感兴趣的字段有哪些,你需要的数据是哪种格式,我们将为您做所有的工作,最后把数据(或程序)交付给你。
数据的格式可以是CSV、JSON、XML、ACCESS、SQLITE、MSSQL、MYSQL等等。
更多>>技术文章
-
西安鲲之鹏
发布时间:2016-09-26 08:47:18
-
西安鲲之鹏
发布时间:2016-09-22 12:16:47
-
西安鲲之鹏
发布时间:2016-09-18 14:19:14
最新预定抢购苹果很火,那么各位施主你们知道如何测试代理IP是否被苹果给封了吗?
且听我说:用代理访问网址:http://t.cn/R7Z1Grj。如果返回正常页面那么这个代理就是OK的(没有被封),如果跳转到了一个不存在的页面(http://t.cn/Rc9WXLa),那么说明这个代理已经被封了。下图是用curl做的实验(图1是正常的
,图2的代理被封了
)。
-
西安鲲之鹏
发布时间:2016-09-18 13:02:28
【小试mitmproxy】按照官方说明安装mitmproxy(http://t.cn/Rc9KrEN),结果还少了一堆Python依赖库,费了不少时间终于搞定了。
PS1:mitmproxy是一款命令行下的HTTP抓包分析工具,工作原理和Fiddler2类似。
PS2:现在扫代理IP的人真是多啊!!!刚启动没多久就被人扫描到了(被拿来注册QQ号用)。
-
西安鲲之鹏
发布时间:2016-09-10 11:13:09
-
西安鲲之鹏
发布时间:2016-09-05 16:13:28
Windows上使用rdp协议连接Ubuntu的远程桌面:
sudo apt-get install xrdp
sudo apt-get install vnc4server
sudo apt-get install xubuntu-desktop
echo "xfce4-session" > ~/.xsession
sudo service xrdp restart
然后Windows上用mstsc连接即可。
xrdp: An open source remote desktop protocol(rdp) server. >>> http://t.cn/Rcy02TQ
-
西安鲲之鹏
发布时间:2016-09-05 14:50:45
NppFTP使用SFTP连接Ubuntu 16.04错误提示“[SFTP] Connection failed : kex error : did not find one of algos ”。解决方法:升级NppFTP到最新版本即可(解压覆盖NppFTP.dll文件即可,我使用的是0.26.3)>>> http://t.cn/RcyXShb
-
西安鲲之鹏
发布时间:2016-09-03 09:38:59
Chrome webdirver自定义用户配置文件时(--user-data-dir)参数不能加引号,否则会出错:“cannot create default profile directory”。一个正确的示例:options.add_argument('--user-data-dir=C:/Temp/ChromeProfile')。窗口启动后可以查看“chrome://version”是否生效。 >>> Stackoverflow上有个类似的问题 http://t.cn/RcAJsmt
-
西安鲲之鹏
发布时间:2016-08-31 20:06:15
淘宝分类知多少?鲲之鹏今日统计结果12919个。 >>> http://t.cn/Rc7VoeO 你想知道怎么获取商品源码中"categoryId"对应的分类名称吗 >>> http://t.cn/Rc7Voe0?
-
西安鲲之鹏
发布时间:2016-08-26 16:52:19
rp-pppoe-3.12中的pppoe-status有Bug,经常出现拨号获取到IP了(查看syslog可知),但pppoe-status判断拨号失败了(“Link is attached to ppp20, but ppp20 is down”)。我们写了一个Python版本的pppoe-status.py,它结合pppoe-status(原始的)和“ifconfig iface”的结果判断拨号是否成功了。源码在这里 >>> http://t.cn/RtDZRb9。 PS:还需要修改/usr/sbin/pppoe-start将“${exec_prefix}/sbin/pppoe-status $CONFIG > /dev/null 2>&1”修改为“/usr/bin/python /home/qi/pppoe-status.py $CONFIG > /dev/null 2>&1”(根据实际路径修改)
-
西安鲲之鹏
发布时间:2016-08-26 12:57:50
"Warning: Incorrect string value: '\xF0\x9F\x98\x83 @...' for column"导致字符串被截断问题的解决:将字段的编码从utf8修改为utf8mb4,程序连接MySQL的时候也要修改charset为utf8mb4。>>> http://t.cn/8sI0SNw