找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 6|回复: 0

AI 爬虫与数据采集工具合集

[复制链接]
发表于 3 小时前 | 显示全部楼层 |阅读模式
🕷 🔁 AI 爬虫与数据采集工具合集

📦 网页抓取 | AI Agent | 反爬工具 | 数据处理框架



🤖 browser-use
➤ AI浏览器代理,可点击/登录/填表/操作网页  
➤ 像真人一样执行复杂网页任务  
➤ ETH团队开发  
🔗 https://github.com/browser-use/browser-use  

———

🧱 Crawlee
➤ 生产级爬虫框架(Apify)  
➤ 支持代理轮换 / 自动重试 / 队列管理  
➤ 反封禁能力完善  
🔗 https://github.com/apify/crawlee  

———

🐍 Scrapy
➤ 工业级爬虫框架  
➤ 支持百万级网页抓取  
➤ 数据采集稳定成熟  
🔗 https://github.com/scrapy/scrapy  

———

📄 MarkItDown
➤ 多格式转 Markdown(网页/PDF/Office/图片)  
➤ AI数据处理标准化工具  
🔗 https://github.com/microsoft/markitdown  

———

🧠 Scrapling
➤ 自适应反爬框架  
➤ 自动适配网站结构变化  
➤ 提升稳定性  
🔗 https://github.com/D4Vinci/Scrapling  

———

📱 scrcpy
➤ 安卓远程控制工具  
➤ 用于移动端数据采集/自动化  
🔗 https://github.com/Genymobile/scrcpy  

———

🔍 AutoScraper
➤ 自动规则爬虫(无需写选择器)  
➤ 输入样本自动学习规则  
🔗 https://github.com/alirezamika/autoscraper  

———

🌐 curl_cffi
➤ 浏览器级HTTP请求库  
➤ 模拟真实Chrome指纹(TLS/JA3)  
➤ 反检测能力强  
🔗 https://github.com/lexiforest/curl_cffi  



📌 简单说:
👉 这是一整套从“AI自动操作网页”到“工业级爬虫与反反爬”的完整数据采集工具链。

回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

QQ|Archiver|手机版|小黑屋|腾飞在线 ( 冀ICP备05002530号 )

GMT+8, 2026-7-25 04:47 , Processed in 0.050446 second(s), 15 queries .

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表