Playwright爬虫绕过Cloudflare人机验证
1. 问题描述
有些网关接入了Cloudflare的人机验证组件,当使用Playwright等自动化工具爬取的时候,会被人机验证阻拦。阻断的效果如下:
2. 问题原因
Selenium、Puppeteer、Playwright等自动化控制工具的实现都会遵循一个规范,就是使用这些工具的时候,获取 navigator 的 webdriver 属性时,会返回 true,而普通浏览器会返回 undefined
3. 解决方案
方案1:通过CDP修改属性
cdp为Chrome Devtools-Protocol(Chrome 开发工具协议)。
代码如下:
const js = `Object.defineProperty(navigator, 'webdriver', {
get: () => undefined
})`;
await page.addInitScript(js);
执行后, navigator.webdriver, 其值变成了 undefined 了。
【无效】方案2:增加启动参数
在浏览器启动参数中增加 --disable-blink-features=AutomationControlled
参数。
代码如下:
// 初始化浏览器实例
const context = await chromium.launchPersistentContext(userDataDir, {
headless: false,
args: [
"--disable-gpu",
"--disable-software-rasterize",
"--disable-blink-features=AutomationControlled",
],
});
这个方案可以修改值,但只是修改为 false ,而不是移除该参数,依然无法解决。
【推荐】国内首个AI IDE,深度理解中文开发场景,立即下载体验Trae
【推荐】编程新体验,更懂你的AI,立即体验豆包MarsCode编程助手
【推荐】抖音旗下AI助手豆包,你的智能百科全书,全免费不限次数
【推荐】轻量又高性能的 SSH 工具 IShell:AI 加持,快人一步
· 【自荐】一款简洁、开源的在线白板工具 Drawnix
· 没有Manus邀请码?试试免邀请码的MGX或者开源的OpenManus吧
· 无需6万激活码!GitHub神秘组织3小时极速复刻Manus,手把手教你使用OpenManus搭建本
· C#/.NET/.NET Core优秀项目和框架2025年2月简报
· DeepSeek在M芯片Mac上本地化部署