80% 的商业爬虫/数据采集服务,底层就靠这份名单。不是你不知道,是没人敢这么汇总。
公司收费 \$2,000/月、\$20,000/年的数据管道,秘密武器其实就是这 10 个 GitHub 仓库。每一行代码都在开源社区眼皮底下,每一行都比大多数付费产品更稳定。
全文收藏。按星数排。全是硬货。
━━━ ━━━ ━━━
🔟 第 10 名(⭐6,265)——curl-impersonate
让 curl 长得像 Chrome
github.com/lwthiker/curl-impersonate
curl 的魔改版。普通 curl 一出手就被反爬识别,它发出的 HTTP 请求跟真实的 Chrome 浏览器完全一样------TLS 指纹、HTTP/2 帧、头顺序,全对。
你花几千块钱买的爬虫 API,底层就是这个。致敬。
━━━ ━━━ ━━━
9️⃣ 第 9 名(⭐7,353)——AutoScraper
给一个例子,自己去爬一整个网站
github.com/alirezamika/autoscraper
给它一个网页 URL 和一个你想要的样例数据,它自己分析 DOM 结构,自动推演出怎么爬剩下所有页面。不需要选 CSS 选择器,不需要维护爬取规则,网站改版它自己适应。
「给我数据,别烦我」——就这个态度。
━━━ ━━━ ━━━
8️⃣ 第 8 名(⭐24,180)——Crawlee
防封全家桶,TypeScript/Node.js 专业级爬虫框架
github.com/apify/crawlee
轮换代理、自动重试、浏览器指纹随机化、请求队列管理、会话持久化......反爬虫对抗需要的每一件武器,这都配齐了。
做爬虫公司的时候,这是个你的技术栈。现在开源了,当礼物收起就行。
━━━ ━━━ ━━━
7️⃣ 第 7 名(⭐62,647)——Scrapy
工业级爬虫,十年不锈
github.com/scrapy/scrapy
爬百万页面、提取任何结构、导出到任意格式。在 Python 爬虫界的地位相当于 HTTP 协议。从 startup 到 FAANG 内部数据管道都在跑。始终免费。
「几千页就去买服务?你用 Scrapy 半小时写个 spider 就够了。」
━━━ ━━━ ━━━
6️⃣ 第 6 名(⭐66,764)——Scrapling
反反爬最聪明的那一个
github.com/D4Vinci/Scrapling
它不需要手写什么选择器。它能自动适应网站改版——今天的 class 名跟昨天不一样,无所谓。它能嗅探反爬模式,自动绕过。这不是爬虫,这是博弈引擎。
防爬供应商卖 \$5,000/年的「高级反检测」功能,它免费写在这里了。
━━━ ━━━ ━━━
5️⃣ 第 5 名(⭐70,050)——Crawl4AI
GitHub 爬虫排行榜第一
github.com/unclecode/crawl4ai
把任意网站变成 LLM-ready 的干净 Markdown,比付费服务还快。不需要 API 密钥,不需要注册,不需要按页付费。
原作者因为被某个 \$16 的付费爬虫坑了,几天就写出来这个。现在 70,000 星,社区推上了 GitHub 爬虫分类榜首。
━━━ ━━━ ━━━
4️⃣ 第 4 名(⭐101,157)——Browser Use
AI 代理像真人一样操控浏览器
github.com/browser-use/browser-use
不是普通的爬虫。它是一个 AI agent,会操作浏览器——点击按钮、滚动页面、填写表单、登录网站、下载文件。这能让它访问到那些「必须用户交互才能显示数据」的页面。
两位苏黎世联邦理工学院(ETH)研究员开发。一年破 10 万星,冲进 GitHub 增长最快的项目。
━━━ ━━━ ━━━
3️⃣ 第 3 名(⭐140,727)——FireCrawl
指向一个网站,AI-ready 数据就出来了
github.com/firecrawl/firecrawl
给一个 URL,它帮你把整个网站爬完:多页面抓取、JavaScript 渲染、结构提取,最后返回 AI 能直接读取的干净数据。
14 万星,GitHub 百大仓库。有一半 AI startup 明面上做自己的产品,悄悄跑的是这个爬虫骨架。
━━━ ━━━ ━━━
2️⃣ 第 2 名(⭐144,570)——scrcpy
从电脑控制你的安卓手机,然后提取数据
github.com/Genymobile/scrcpy
USB 或 Wi-Fi 连接,电脑上显示和控制安卓手机屏幕。延迟低、画质高、不需要 root。
为什么这个能排进爬虫合集?因为 90% 的 App 数据,手机端才有。 普通爬虫只能抓到网页,但有手机,就什么都能抓。
14.5 万星,GitHub 全站最硬核的工具之一。
━━━ ━━━ ━━━
🥇 第 1 名(⭐160,601)——MarkItDown
微软官方出的格式转换器,把一切变成 AI 能吃的东西
github.com/microsoft/markitdown
微软开源。输入可以是 PDF、网页、Word 文档、Excel 表格、PPT 演示文稿、甚至图片(OCR)——输出清一色干净的 Markdown。
很多数据管道公司直接拿它当核心引擎,封装成 SaaS 卖 \$29,000/年。微软 MIT 协议开源,随便用。
━━━ ━━━ ━━━
整理一下
| 排名 | 仓库 | ⭐ | 一句话定位 |
|---|---|---|---|
| 🥇 | MarkItDown | 160,601 | 一切文件→AI就绪Markdown |
| 🥈 | scrcpy | 144,570 | 远程操控安卓手机的无底洞 |
| 🥉 | FireCrawl | 140,727 | 整站→结构化数据 |
| 4 | Browser Use | 101,157 | AI代理像人一样操作浏览器 |
| 5 | Crawl4AI | 70,050 | GitHub爬虫榜榜首 |
| 6 | Scrapling | 66,764 | 自我进化的反反爬利器 |
| 7 | Scrapy | 62,647 | 工业级爬虫,十年不锈 |
| 8 | Crawlee | 24,180 | 防封号全家桶 |
| 9 | AutoScraper | 7,353 | 给个例子自己爬 |
| 10 | curl-impersonate | 6,265 | 让 curl 长得跟 Chrome 一样 |
⭐ 总数 761,950。全开源。MIT / Apache 2.0。
后记: 这不是什么「你应该试试」的收藏帖。我说更直接一点:如果你在做任何跟数据相关的产品,这里面至少有三个是你的依赖。 赶紧确认一下自己用的是不是免费版。别等付费账单到了才想起来。
━━━ ━━━ ━━━
━━━ ━━━ ━━━
*欢迎关注 LeisureLinux 以及同名 B 站频道,每天一篇深度技术解读。*
10 个能够助你从Claude Code新手进阶为专家的 GitHub 核心仓库
从瑞芯微 GitHub 仓库被封,看 Linux 驱动开发中的开源合规"红线"
Bash 武林秘籍:Awesome Bash 到底有多「Awesome」?