Tech
[程序员] 开源了一个"录一次、永久跑"的浏览器采集平台 AegisCrawler(Go + TS, GPL)
搞过采集的都知道,写爬虫不难,难的是维护:页面一改版,选择器全废;人一离职,脚本没人敢动。我们团队被这个折磨久了,就做了个思路不一样的东西—— 录制即规则,规则即任务 :
装个 Chrome 扩展,在目标网站上像平时一样操作(点、输、翻页),它把你的操作录下来
录完自动生成一份可读的 DSL 规则( YAML ),向导里能看步骤、看 YAML ,还会 真实浏览器完整回放一遍 验证,逐步人工确认后存为不可变版本
服务端( Go + SQLite ,单二进制)把规则当任务调度:租约认领、心跳、重试、死信队列、分级限流、熔断
浏览器端的 ScriptCat worker 认领任务,真实标签页里执行,结果实时回传
30 秒演示 GIF (在 books.toscrape.com 演示站录制):
https://github.com/singhand-labs/AegisCrawler/raw/main/.github/assets/demo.gif
仓库: https://github.com/singhand-labs/AegisCrawler
(...
Read the full discussion on V2EX
This article was aggregated from V2EX. Click to join the conversation.
View on V2EX