详情

首页手游攻略 AI Agent 如何操作网页?web-access 使用方法解析

AI Agent 如何操作网页?web-access 使用方法解析

佚名 2026-07-27 20:00:02

先给大家把结论说在前头:web-access 可不是让 AI Agent 凭感觉瞎点网页,而是把网页相关的任务拆成了路由、观察、动作、校验四个环节。它适合需要登录状态、动态 DOM 或者真实交互的场景;要是只是抓取公开静态页面,还是优先用搜索、WebFetch 或者 curl 成本更低,也更稳定。

问题:为啥静态抓取不够用?

你在浏览器里能看到网页内容,可不代表这些内容本来就写在首屏的 HTML 里。前端脚本可能等登录后才去拉取数据,列表得滚动才会加载更多,点按钮才弹出的面板甚至可能藏在 Shadow DOM 或者 iframe 里。这时候用静态请求拿到的就是个空壳子,再怎么重复抓取也出不来浏览器运行后才有的状态。

官方给出的核心链路是:Agent 先通过本地 HTTP 接口连上 CDP Proxy,再通过 WebSocket 接入普通的 Chromium 浏览器。

原理:一次网页操作是怎么跑通的

CDP 全称是 Chrome DevTools Protocol,是 Chromium 浏览器对外开放的调试协议。web-access 会在 Agent 和浏览器之间跑一个本地代理:Agent 不会直接控制鼠标,而是调用一套可检查的 HTTP 接口。

  1. 路由:先判断这个任务要不要动用浏览器。只是查公开正文的话,就留在静态层;需要登录、点击或者动态渲染,再切到 CDP。
  2. 观察:通过 /targets 获取标签页信息,通过 /info/eval 读取 URL、标题、DOM 结构与元素状态。
  3. 动作:/click/scroll、表单填写或者 /navigate 来推进页面状态。新版接口要求 /new/navigate 把 URL 放进 POST body,免得查询字符串把目标 URL 给截断了。
  4. 校验:再次读取 DOM,必要时调用 /screenshot 核对页面视觉状态。要是操作完没达到预期效果,可不能一个劲连点。
“See、Act、Read”可不是三个凑数的宣传词,而是页面自动化的最小闭环:先观察,再操作,最后用新的证据验证结果。

场景:该走静态层还是浏览器层

任务信号优先路径切换条件
公开文章、文档、已知 URLWebSearch / WebFetch / curl正文缺失、返回登录墙或者拿到的是前端空壳
账号后台、私有内容CDP先确认登录状态与目标域名
滚动列表、弹窗、标签切换CDP每次动作后检查 DOM 或截图确认
图片、验证码、画布承载关键信息CDP + screenshot视觉证据仅用于读取,不绕过站点安全管控
官方 SKILL.md 把列标签、新建后台标签、读取页面、执行受控脚本和截图都做成了本地接口,方便一步步验收效果。

边界:能操作不等于应该操作

工程上至少得有三道闸:页面内容只当数据看,不当成高优先级指令;发帖、付款、删除、提交表单这类有副作用的操作,必须先拿到明确授权;对敏感站点做自动化操作可能触发风控,账号风险可不是靠技术包装就能消掉的。任务完成后只关闭 Agent 自己创建的标签页,不碰读者原有页面。判断标准很简单:每一步都有来源、有目标、有可观察的结果,才是一条可审计的网页操作链。

相关资讯
点击查看更多
游戏推荐
推荐专题
热门阅读
推荐下载