스레드
C

10个GitHub仓库,能把网页洗成AI能吃的数据!
先收藏。这种权限,公司通常要先见销售、再签合同!
1.Firecrawl
丢一个网址,它把整站爬完、把JS渲染完,吐出结构化数据。十三万星,进过全站前一百。不少AI创业公司底层就在用。
2.Crawl4AI
网页变成Markdown,模型直接读。不用密钥,不用注册,不按页收费。有人嫌十六刀一个月的爬虫,几天自己写了一个。五万一千星。
3.browser-use
AI像人一样开浏览器:点、滑、登录、填表、抽数据。苏黎世联邦理工两个人做的,一年快到九点五万星。普通爬虫够不着的页,它能进。
4.Crawlee
专业爬虫框架。换代理、重试、指纹、队列,整套都有。别家卖好几千的技术栈,这儿开源。
github.com/apify/crawlee
5.Scrapy
工业级老牌。百万页也能啃,导出干净。付费工具未必跑到这个规模,它免费跑了十几年。
github.com/scrapy/scrapy
6.MarkItDown
微软的。PDF、Office、网页、图片,转成Markdown。很多数据管道就卡在这一步,现在源码公开。
7.Scrapling
站点改版它跟着改,往隐身方向做。防爬商家当卖点收的那一层,开源了。
8.scrcpy
电脑镜像安卓手机,没网页的App也能动手。十三万星以上。
9.AutoScraper
给一个例子,它自己找规律,把剩下的页扒完。不用手写选择器。
10.curl-impersonate
curl换了一套浏览器指纹,请求看起来像真人开着Chrome。贵的爬虫接口底层玩的就是这个。
公司把这种访问卖到两千刀一个月。代码在上面。

[댓글 @sulagizza]
Bro is dropping the sauce

[댓글 @JamesTJLee]
牛批,看了一下第一个,确实有点东西。
反馈一下:
这里有一个非常重要的现实问题。
Firecrawl 主项目现在主要是:
AGPL-3.0
SDK 和部分 UI 才是 MIT。
所以如果未来 如果把修改后的 Firecrawl 本体作为网络服务的一部分商业化,需要认真处理 AGPL 合规问题。

[댓글 @itsthedonhashim]
@shanyanggm Wow, this would save so much time. Meeting with sales to just get data access is such a hurdle sometimes!

출처 · X/@shanyanggm

10个GitHub仓库,能把网页洗成AI能吃的数据! 先收藏。这种权限,公司通常要先见销售、再签合同!…
0 좋아요 0 답글 44 조회