更多>>关于我们

西安鲲之鹏网络信息技术有限公司从2010年开始专注于Web(网站)数据抓取领域。致力于为广大中国客户提供准确、快捷的数据采集相关服务。我们采用分布式系统架构,日采集网页数千万。我们拥有海量稳定高匿HTTP代理IP地址池,可以有效获取互联网任何公开可见信息。

您只需告诉我们您想抓取的网站是什么,您感兴趣的字段有哪些,你需要的数据是哪种格式,我们将为您做所有的工作,最后把数据(或程序)交付给你。

数据的格式可以是CSV、JSON、XML、ACCESS、SQLITE、MSSQL、MYSQL等等。

更多>>官方微博

西安鲲之鹏
陕西 西安

加关注

  • 【经验分享】未解锁BL的手机进9008模式(Mi6X为例)

    对于未解锁BL的手机,需要拆机,通过短接特定触点的方式进入9008模式。
    以小米Mi6X为例:
    第一步,拧掉充电口旁边的两颗螺丝。
    第二步,扣开后盖,可能不太好扣,可以借助美工刀在边缘撬一下。拧掉保护条上的3个螺丝。
    第三步,拔掉电池排线。看图,记着两个短接触点的位置。
    第四步,用镊子短接两个触点,同时插入TypeC线,2秒左右设备管理器"端口COM"里会出现9008接口,此时松开镊子。
    发布时间:2024-11-27 10:13:20
  • 【经验分享】已解锁BL的手机进9008模式

    高通9008模式全称"Qualcomm HS-USB QDLoader 9008",它相对于recovery、fastboot和Android系统是独立的。即深刷模式,也叫EDL,号称"救砖神奇"。

    对于已解锁BL的手机,进入9008相对比较简单,以小米Mi6X为例:
    1. 先确定手机是否解锁BL了。已解锁BL的手机,刚开机的时候会有"Unlocked"字样,如附图1所示。
    2. 长按“音量减键 + 开机键”进入fastboot。
    3. 执行fastboot oem edl,即可进入9008模式,进入成功后设备管理器COM端口里可以看到"Qualcomm HS-USB QDLoader 9008"。如附图2、3所示。
    发布时间:2024-11-26 12:53:03
  • 【经验分享】com.android.org.conscrypt.TrustManagerImpl证书固定检测绕过示例

    某APP使用通用的sslunpinning脚本后仍然抓不到包:
    (1)分析logcat日志,发现com.android.org.conscrypt.TrustManagerImpl类相关代码抛出java.security.cert.CertificateException异常,如图1所示。
    (2)hook 类com.android.org.conscrypt.TrustManagerImpl的checkTrusted和checkServerTrusted方法,返回空列表,成功抓到包。

    日志线索寻找关键词:CertificateException、CertificateExpiredExceptio、SSLHandshakeException
    发布时间:2024-10-24 15:36:45
  • 【经验分享】如何获取安卓手机上已安装APP的安装包(.apk)文件?

    1. 先查看已安装APP列表,确定对应APP的包名。
    adb shell pm list packages
    2. 假设包名为org.gushiwen.gushiwen。再根据包名查看APP的详细信息:
    adb shell dumpsys package org.gushiwen.gushiwen
    返回信息中的path属性,以base.apk结尾的,即就是这个APP的安装文件,如附图1所示。另外返回的信息中还有当前APP的版本(versionName属性),如附图2所示。
    3. pull下来这个文件,就可以在其它设备上安装了。
    发布时间:2024-10-22 11:27:51
  • 【经验分享】Dell R720意外断电重启之后丢失硬盘(硬盘状态变为Foreign)问题解决?

    本来有10块盘,启动的时候显示只有9块Virtual Disk。“Ctrl + R”进入RAID设置,在“VD Mgmt”标签页下也只看到了9块Virtual Disk。在“PD Mgmt”标签页下看到是有10块物理盘,不过第5块状态变成“Foreign”了(如附图1所示)。

    解决方法:在“VD Mgmt”标签页下,焦点切换到"PERC H710 Mini"上按F2,然后"Foreign Config",再然后"Import",操作完成(要等待几秒)之后就能看到全部盘了,如图2所示。

    PS:用Ctrl + N快捷键切换菜单标签。
    发布时间:2024-10-18 16:35:44
  • 【经验分享】一个游戏闯关模式学习CSS Selector的网站"CSS Diner":https://flukeout.github.io/
    Python使用BeautifulSoup实现CSS Selector解析HTML文档的示例:

    import requests
    from bs4 import BeautifulSoup

    r = requests.get('http://www.site-digger.com/html/articles/')
    r.encoding = 'UTF-8'
    html = r.text
    soup = BeautifulSoup(html)
    for a in soup.select('ul[class="arclist"] li a'):
    print(a['href'], a.text)
    发布时间:2024-09-02 19:43:03
  • 【经验分享】qemu-system-x86运行tiny11
    (1) 安装qemu-system-x86,安装完成后无需重启。
    sudo apt-get update
    sudo apt-get install qemu qemu-utils qemu-system-x86
    (2) 创建硬盘。
    qemu-img create -f qcow2 tiny11.img 50G
    (3) 创建虚拟机。
    sudo qemu-system-x86_64 --enable-kvm -m 2G -smp 4 -boot order=dc -hda /home/qi/kvm/tiny11-1/tiny11.img -cdrom /home/qi/kvm/tiny11_23H2_x64.iso -vnc :1
    (4) vnc连接 "服务器ip:5901",完成系统安装过程。设置vnc密码的方法:https://qemu-project.gitlab.io/qemu/system/vnc-security.html#with-passwords
    (5) 映射主机端口给虚拟机,使用-redir参数。如下示例,将主机的TCP/UDP4001端口映射到虚拟机的4000端口。
    -redir tcp:4001::4000 -redir udp:4001::4000
    发布时间:2024-08-10 12:13:46
  • 【经验分享】Playwright过geo.captcha-delivery.com检测

    page.add_init_script('''Object.defineProperties(navigator, {webdriver:{get:()=>undefined}}); delete navigator.__proto__.webdriver;''') ​​​
    发布时间:2024-07-31 10:41:18
  • 【经验分享】scrcpy在网络质量欠佳环境下可以通过降低码率来提高流畅度
    e.g.
    scrcpy --bit-rate 1M --max-fps 5
    注意:在新版本中--bit-rate参数更名为--video-bit-rate ​​​
    发布时间:2024-07-03 10:11:54
  • 【经验分享】scrcpy在小米手机上鼠标不起作用问题的解决

    在“开发者选项”中需要打开"USB调试(安全设置) - 允许通过USB调试修改权限或模拟点击"。要打开这个选项,手机需要先登录小米账号,另外手机必须要插有SIM卡。 ​​​
    发布时间:2024-07-03 10:09:29
当前位置: 首页 > 公司微博 >
  • 西安鲲之鹏

    发布时间:2016-12-17 23:12:51
    【pip指定代理】
    pip install --proxy=https://proxy_user:proxy_password@proxy_url:proxy_port package
    PS: 从国内服务器用pip安装一个库老是timeout,指定一个香港代理后瞬间完成。 ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-12-15 16:56:15
    一块4TB的硬盘,在Ubuntu Server下使用fdisk只分一个区挂载后发现只有2TB大小。
    原来“fdisk创建的传统MBR分区最大只支持2TB的分区,要想支持4TB的分区,得用GPT格式的分区”。
    使用parted命令可以创建GPT格式的分区,如下:

    分区:
    sudo parted /dev/sdb
    (parted) mklabel gpt
    (parted) unit TB
    (parted) mkpart primary 0.00TB 4.00TB
    (parted) print
    (parted) quit

    格式化:
    sudo mkfs.ext4 /dev/sdb1

    挂载:
    1)自动挂载:
    编辑/etc/fstab加入:
    /dev/sdb1       /home/qi/data   ext4    defaults        1       1

    2)或临时挂载:
    sudo mount /dev/sdb1 /home/qi/data

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-12-15 16:42:32
    Ubuntu Server下如何查看磁盘的品牌和型号?例如,我想查看/dev/sdb这块硬盘的信息,命令如下:
    sudo apt-get install smartmontools
    sudo smartctl --all /dev/sdb
    输出信息如下:
    === START OF INFORMATION SECTION ===
    Model Family:     Seagate Constellation ES.3
    Device Model:     ST4000NM0033-9ZM170
    Serial Number:    S1Z2NARX
    LU WWN Device Id: 5 000c50 08ceeca07
    Firmware Version: SN06
    User Capacity:    4,000,787,030,016 bytes [4.00 TB]
    Sector Size:      512 bytes logical/physical
    Rotation Rate:    7200 rpm
    ...

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-12-13 11:47:08
    VMWare Workstation 10 & Win 7,如何移动部分vmdk文件到其它分区?
    场景:vmdk快把D盘空间耗尽了,所以想迁移部分vmdk文件到其它空间较多的分区下(C盘)。
    网上有人说可以通过修改vmdk描述文件中的路径来实现,测试发现修改后无法启动。
    最后还是符号链接解决的问题,Win7下用mklink(注意mklink的目标和源的位置刚好和linux下的ln命令是反的)。详见stackoverflow,自问自答 >>> http://t.cn/RIUzH9Q

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-12-11 19:48:15
    Ubuntu server如何列出机器的所有网卡?
    sudo lshw -C network
    如下图所示,我测试的机器有两块网卡em1和em2,其中em2没有插网线。 ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-12-06 08:56:03
    【吐槽下阿里云】 系统强制要求迁移到香港B区,自动迁移后系统无法启动... ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-12-05 10:06:39
    Linux CPU温度监测命令:watch sensors ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-12-02 11:01:58
    【EOF occurred in violation of protocol问题解决】Python2.7环境下用urllib2访问一个URL:”
    http://t.cn/aopOIt
    会抛出异常:“urllib2.URLError: <urlopen error [Errno 8] _ssl.c:510: EOF occurred in violation of protocol>”(如下附图)
    原因:“http://t.cn/a81ks4”这个网站使用了TLS 1.0(如下附图),而Python 2.6, 2.7的urllib2默认不支持TLS1.0。
    解决方法:在urllib2建立SSL连接时强制使用PROTOCOL_TLSv1,示例代码 >>> http://t.cn/RfmxGUS

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-11-18 21:08:51
    【tor测试】(1)速度还可以,在可接受范围内。
    (2)“选择最快”原则导致实际能切换到的IP量很少,测了3天,最多640多个IP。 ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-11-16 10:23:29
    【如何避免使用MySQL缓存?】SELECT的时候加入SQL_NO_CACHE选项即可,例如: SELECT SQL_NO_CACHE id, name FROM customer;
    [1]The MySQL Query Cache:http://t.cn/RftBuFm
    [2]Query Cache SELECT Options: http://t.cn/RftBuFu ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-11-15 14:48:31
    【经验分享】爬虫模拟某系统Ajax请求,Accept头使用爬虫框架默认的“text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8”网站返回数据乱码(如下图示),修改为“application/json, text/javascript, */*; q=0.01”后返回数据正常(如下图示)。 ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-11-13 19:10:15
    【实测】JuiceSSH是安卓平台上远程SSH管理的一个超赞的工具!秒杀我之前试过的ConnectBot。是运维人员居家旅行不可或缺的神器!!!
    PS:本来还考虑买个Win10平板,出门的时候可以用SecureCRT管理服务器,现在完全没必要了。
    附下载地址:http://t.cn/RfbEoeK ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-11-11 08:10:51
    【数据超市】安居客(anjuke.com)全国数据(新房楼盘+二手房小区)2016年11月份数据更新 >>> http://t.cn/RfLDYzj

    二手房小区:
    “城市”,”小区名”,”本月均价”,”价格变动”,”所在版块”,”地址”,”总户数”,”建造年代”,”物业类型”,”物业费用”,”开发商”,”总建面”,”容积率”,”出租率”,”停车位”,”绿化率”,”经度”,”纬度”,”简介”,”URL”

    新房楼盘:
    “城市”,”楼盘名称”,”楼盘单价”,”特色”,”区域位置”,”楼盘地址”,”规划总数”,”工程进度”,”开盘时间”,”交房时间”,”经度”,”纬度”,”URL”

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-11-07 12:07:38
    企查查是什么时间开始限制列表页最多500也可见的?如图所示。 ​​​​

    阅读全文 + 去微博评论 +

  • 西安鲲之鹏

    发布时间:2016-11-03 21:15:13
    webscraping的Download类默认只支持根据代理IP进行限速,但对于有些需要登录采集的网站,它们除了根据IP限速外往往还会根据会话(Cookie)进行限速,这时使用Download类就很容易被封账号或出验证码。鉴于此,我们增加了throttle_by参数,它有如下三种取值:
    0 - 默认值,根据代理IP限速;
    1 - 根据会话(Cookie)限速;
    2 - 同时根据IP和会话(Cookie)限速;
    PS:webscraping库的原始作者是Richard Penmen,是鲲之鹏的重要合作伙伴,2010年开始鲲之鹏加入维护。

    阅读全文 + 去微博评论 +