侧边栏壁纸
博主头像
西瓜码农

成功需要脚踏实地,一步一个脚印

  • 累计撰写 373 篇文章
  • 累计创建 1 个标签
  • 累计收到 0 条评论

目 录CONTENT

文章目录

腾讯开源BrowserSkill:让AI智能体独立操作浏览器

腾讯开源BrowserSkill:让AI智能体独立操作浏览器

今天腾讯开源了一个有意思的工具——BrowserSkill。简单说,它让AI智能体能够像人类一样操作浏览器:点击按钮、填写表单、滚动页面、截图识别,甚至处理弹窗和验证码。

为什么需要它?

现有的AI智能体大多只能调用API,遇到没有API的网站就傻眼了。比如你想让AI帮你订酒店、查快递、抢票,这些网站往往没有开放接口。

BrowserSkill的思路是:既然人类能操作浏览器完成任务,那AI也可以。它通过Playwright控制浏览器,结合大模型的视觉理解能力,实现"看见-思考-操作"的闭环。

能干什么?

  • 自动化测试:AI自己理解页面逻辑,生成测试用例
  • 数据采集:处理需要登录、有反爬的网站
  • 表单填写:自动识别表单字段,智能填充内容
  • 流程自动化:订票、预约、提交报告等重复性工作
  • 跨站操作:在多个网站之间跳转完成复杂任务

和RPA有什么区别?

传统RPA(如UiPath)需要预先录制操作流程,页面一变就失效。BrowserSkill是实时理解页面,遇到变化能自动调整策略。

举个例子:按钮从"提交"改成"确认提交",RPA会找不到元素报错,BrowserSkill能理解语义变化继续执行。

技术架构

核心是Skill框架:每个浏览器操作封装成一个Skill,AI根据任务描述自动选择和组合Skill。目前已支持的操作包括:

  • navigate(导航到URL)
  • click(点击元素)
  • fill(填写输入框)
  • screenshot(截图分析)
  • scroll(滚动页面)
  • wait(等待元素出现)

开源地址

项目已在GitHub开源:github.com/Tencent/BrowserSkill。支持Python和TypeScript两种语言接入,文档比较完善,有多个示例场景。

我的看法

Agent化是不可逆的趋势。大模型越来越强,但"手"不够用——只能输出文本。BrowserSkill给了AI一双"手",让它能真正干活。

不过目前还处于早期阶段,复杂场景的成功率有待验证。建议先从一个具体场景用起来,比如自动化测试或数据采集,跑通了再扩展。

来源:AIBase、腾讯开源

发布时间:2026年8月11日

0
  1. 支付宝打赏

    qrcode alipay
  2. 微信打赏

    qrcode weixin

评论区