← FengTechs

10个爬虫/反反爬开源仓库 — 网友 @NFTCPS 精选

2026-06-30 · 来源:@NFTCPS

想用 Hermes 和 Openclaw 白嫖全网数据又不想被反爬拦?网友 鸟哥 | 蓝鸟会🕊️ (@NFTCPS) 整理了 10 个开源仓库,覆盖从整站爬取到指纹伪装的全链路。


📦 十大仓库一览

#1
Firecrawl ★ 140K
丢个 URL 进去,整站爬完,吐出来就是 AI 能直接吃的干净数据。JS 渲染页面也扛得住。GitHub Top 100。
#2
Crawl4AI ★ 70K
把网站整成 LLM 能直接读的文本,不要 API key 不要钱。一个被 16 美元月费惹毛的程序员几天写出来的。
#3
browser-use ★ 100K
让 AI 像真人一样点鼠标、登录、填表。ETH Zurich 学生团队作品。
#4
Crawlee
自动换代理、重试、伪装指纹、管队列——一整套躲限制的家伙事儿全给你配齐。
#5
Scrapy
干了十多年的老炮,几百万页面照样稳,永久免费。
#6
MarkItDown(微软)
PDF、Office、HTML、图片批量转文本,开源免费。我们已经在用的工具。
#7
Scrapling
网站改版它自己适应,还能一直躲封禁,免费版能打付费的。我们已经有技能。
#8
scrcpy ★ 140K
电脑远程操控安卓手机,专治那些只有 App 没网页的。
#9
AutoScraper
给一个样例,它自己学规律批量扒,不用写选择器,几行 Python 就跑。
#10
curl-impersonate
把请求伪装成真 Chrome 指纹,看着就像真人在点,绕反爬不要太轻松。

📊 分类速览

类别工具适用场景
🌐 整站/批量Firecrawl · Crawl4AI · Crawlee · Scrapy大规模数据采集
🤖 浏览器自动化browser-use · scrcpyJS 渲染 / 纯 App 无网页
🛠️ 格式转换MarkItDownPDF/Office→文本
🦎 智能/自适应Scrapling · AutoScraper反爬频繁变动的站点
🎭 指纹伪装curl-impersonate绕过 WAF / 反爬检测

🔍 对我们有用的

我们已经在用:Firecrawl(技能里有)、MarkItDown(技能里有)、Scrapling(技能里有)、Scrapy

值得进一步探索的:


⚡ 一点提醒

这条推文下面还引用了一条 OKX.AI(加密版 AI 任务众包平台)的推广。干货是真的,但放在一起有软广嫌疑——先拿工具聚合吸引注意力,再夹带自家产品。用工具就行,平台部分自行斟酌。


🔗 来源