腾讯开源BrowserSkill:让AI智能体独立操作浏览器
今天腾讯开源了一个有意思的工具——BrowserSkill。简单说,它让AI智能体能够像人类一样操作浏览器:点击按钮、填写表单、滚动页面、截图识别,甚至处理弹窗和验证码。
为什么需要它?
现有的AI智能体大多只能调用API,遇到没有API的网站就傻眼了。比如你想让AI帮你订酒店、查快递、抢票,这些网站往往没有开放接口。
BrowserSkill的思路是:既然人类能操作浏览器完成任务,那AI也可以。它通过Playwright控制浏览器,结合大模型的视觉理解能力,实现"看见-思考-操作"的闭环。
能干什么?
- 自动化测试:AI自己理解页面逻辑,生成测试用例
- 数据采集:处理需要登录、有反爬的网站
- 表单填写:自动识别表单字段,智能填充内容
- 流程自动化:订票、预约、提交报告等重复性工作
- 跨站操作:在多个网站之间跳转完成复杂任务
和RPA有什么区别?
传统RPA(如UiPath)需要预先录制操作流程,页面一变就失效。BrowserSkill是实时理解页面,遇到变化能自动调整策略。
举个例子:按钮从"提交"改成"确认提交",RPA会找不到元素报错,BrowserSkill能理解语义变化继续执行。
技术架构
核心是Skill框架:每个浏览器操作封装成一个Skill,AI根据任务描述自动选择和组合Skill。目前已支持的操作包括:
- navigate(导航到URL)
- click(点击元素)
- fill(填写输入框)
- screenshot(截图分析)
- scroll(滚动页面)
- wait(等待元素出现)
开源地址
项目已在GitHub开源:github.com/Tencent/BrowserSkill。支持Python和TypeScript两种语言接入,文档比较完善,有多个示例场景。
我的看法
Agent化是不可逆的趋势。大模型越来越强,但"手"不够用——只能输出文本。BrowserSkill给了AI一双"手",让它能真正干活。
不过目前还处于早期阶段,复杂场景的成功率有待验证。建议先从一个具体场景用起来,比如自动化测试或数据采集,跑通了再扩展。
来源:AIBase、腾讯开源
发布时间:2026年8月11日
评论区