做采集的注意啦,Playwright只能做小弟了,这个工具有点强……

同一个网站,同一种代码,Playwright跑完分数0.1,CloakBrowser跑完0.9。区别在哪儿?一个是在浏览器外面化妆,一个是在浏览器里面换血。这篇聊聊那个让AI Agent终于能进门的项目。

兄弟们,当我把CloakBrowser跑起来的那一刻,我突然觉得之前熬的夜、掉的头发、烧的token,全特么白费了。

说起来都是泪。上个月我让ClaudeCode帮我盯几个竞品店铺的数据,心想这AI Agent都这么聪明了,干点脏活累活总没问题吧?结果呢?Token烧了十几刀,数据没捞回半条。

最折磨人的不是报错——报错你起码知道死在哪了。最折磨人的是它不报错,日志里漂漂亮亮,输出也有模有样,但AI分析完给你的结论,你往实际数据上一对,离谱到姥姥家了。后来我才反应过来,反爬系统全程给喂的是假数据。

我当时就一个感觉:这帮网站是把AI当贼防啊。

问题出在哪儿

说白了,不管是Playwright还是Puppeteer,它们默认的浏览器都带“胎记”。就像你脸上刻着“我是机器人”,反爬系统看一眼就直接拉黑。

以前大家怎么解决?给浏览器“化妆”。往页面里注入JS,把navigator.webdriver改成false,再塞几个假插件。这套路我熟,就跟化个妆混进夜店似的——骗骗门口刚来的保安还行,碰上老油子一眼就穿帮。Chrome一更新,化妆技巧全作废。

CloakBrowser这哥们怎么干的

这个项目在GitHub上狂揽19000+ Star,路子跟别人完全不一样。

它不化妆,它直接换脸

CloakBrowser直接在Chromium的C++源码层打了71个补丁,从Canvas、WebGL、音频、字体到GPU、屏幕属性、WebRTC——几乎所有能被反爬嗅探到的指纹点,全在编译阶段就改好了。它编译出来的浏览器二进制文件,反爬系统看着就是个正常人

怎么理解?之前那些方案是“伪装成人类”,CloakBrowser是出生就是人类

更狠的是它那个humanize=True的开关。开了之后,鼠标走贝塞尔曲线带过冲,键盘输入带思考停顿,滚动从加速到匀速再到减速——机器操作是直线瞬移,人类操作是弯弯绕绕还带抖。

我把这开关打开,谷歌reCAPTCHA v3评分直接从0.1飙到0.9。0.9什么概念?比大多数真人还像真人。

就一行代码的事儿

安装也简单到离谱:

pip install cloakbrowser

然后你之前用Playwright的代码,改一行import就能切过去:

- from playwright.sync_api import sync_playwright
+ from cloakbrowser import launch

老项目基本无缝迁移。首次运行自动下载200MB的浏览器二进制,之后就再也不用管了。

我的真实感受

作为一个被反爬折磨了好几年的人,CloakBrowser给我的冲击不在于技术多牛逼,而在于它把问题从根源上解决了

以前我花大量时间研究怎么绕过这个验证、怎么模拟那个行为,现在想想都是治标不治本。CloakBrowser的思路是——让验证根本不出现

它不解验证码,它让你压根看不见验证码。这事儿细品一下,境界不一样。

最后一个问题

我一直在想一个问题:当AI Agent有了一个完全不被察觉的浏览器,这个世界会变成什么样?

往好了想,自动订票、比价、信息聚合会更顺畅。往坏了想……

你猜,那些靠反爬活着的公司,现在慌不慌?

评论区聊聊,你被反爬坑得最惨的一次是什么?


图片

💡 插个题外话:你项目要上生产,建议掏钱,毕竟反爬系统每周都在进化。

官网地址:https://cloakbrowser.dev
GitHub地址给你放这了:https://github.com/CloakHQ/CloakBrowser

评论

发表评论

登录后可发表评论并对评论点赞。

去登录
暂无评论,快来发表第一条评论吧!