AI消息速览

BrowserForge:通过并行浏览器沙箱规模化生成网页操作轨迹

事件日期 2026-08-25 · 学术前沿 · 已接受

事件日期2026-08-25
信息日期2026-08-25
入库日期2026-08-26
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:BrowserForge:通过并行浏览器沙箱规模化生成网页操作轨迹

说明:本卡片基于 arXiv 条目元数据与候选摘要整理;原始正文未能抓取,因此所有细节均以“摘要声称”为限,无法从材料确认的部分已标注“待核实”。

一句话结论

据候选摘要,BrowserForge 通过并行运行大量浏览器沙箱,在开放网络上生成包含 203,238 条网页操作轨迹的数据集,微调小型多模态模型后,可将其在 Online-Mind2Web 上的成功率从 25.66% 提升到 33.33%。

事件概述或研究问题

  • 直接从渲染后的像素画面行动的网页智能体,可以避免解析 HTML 或 accessibility tree 的脆弱性,也能降低 token 消耗。
  • 但训练这类智能体需要大量高质量交互轨迹;公开数据集通常只有几千条轨迹,且来源网站固定、范围狭窄。
  • 近期的自动化数据合成流程仍受限于预定义网站列表或教程来源,导致智能体见过的不同网站数量难以增长。
  • BrowserForge 试图解决的问题是:如何规模化地为网页智能体生产高质量、多样化的交互轨迹数据。

方法/产品要点

据候选摘要,BrowserForge 包含三个核心组件:

  • 开放网络数据来源:让智能体接触数十万个真实可访问的开放网站。
  • 沙箱集群管理器:调度数百个并发浏览器,保持高利用率。
  • Proposer-Solver 双智能体循环:将原始网页转化为可执行任务,并收集经过验证的操作轨迹。

后续处理还包括:

  • 规则加模型的清洗流程,用于过滤失败运行。
  • 将保留的推理过程改写为统一的 chain-of-thought 风格。
  • 页面结构信息(如 accessibility tree)仅在数据合成阶段作为信号使用;训练和发布的智能体只依据截图行动。

主要结果或产业意义

  • 生成语料包含 203,238 条轨迹,且每条轨迹来自不同网站,规模和多样性高于此前轨迹数据集。
  • 在该语料上微调一个小型多模态模型后,Online-Mind2Web 成功率从 25.66% 提升到 33.33%。
  • 在静态 Multimodal-Mind2Web 上,步骤准确率持续提升,且增益随语料规模扩大而增加。
  • 对照分析表明,开放网络来源和广泛网站覆盖是效果提升的关键因素。
  • 产业意义:为截图型网页智能体提供一条可扩展的数据生产路径,可能降低对人工轨迹采集和特定网站适配的依赖。

为什么重要

  • 这是一个训练数据侧的规模化方法,而不是模型参数或推理时计算的扩展,与已有相关卡片形成互补。
  • 它把网页智能体的数据来源从“固定网站列表”扩展到开放网络,并用并行沙箱机制解决数据收集效率问题。
  • 如果结果可复现,对 GUI/网页智能体的数据飞轮、评测基准和实际部署都有潜在影响。

与既有脉络的关系

已有相关卡片分别涉及扩散模型推理时缩放、多模态大模型并行缩放和 3D 场景理解;本条是 foundation-model 领域中关于“交互轨迹数据规模化”的增量,重点不在推理策略或模型架构,而在训练数据的生产与覆盖度。

局限与不确定性

由于原始正文未能抓取,以下内容待核实:

  • BrowserForge 的工程实现细节,以及与现有数据合成管线的具体对比基准。
  • 模型参数量、微调设置、评测集划分等实验细节。
  • 数据清洗、失败过滤和“统一 chain-of-thought”重写的具体实现方式。
  • 数据安全性、隐私、网站合规性、爬虫策略和沙箱运行边界。
  • 203,238 条轨迹是否全部可公开获取,以及许可证、去重和站点分布情况。
  • 所有具体数字均来自候选摘要,尚未与原文逐项核对。

可用于图书/PPT/简报的角度

  • “智能体能力的数据杠杆”:说明数据规模与网页智能体表现之间的关系。
  • “合成数据 + 并行沙箱”作为数据基础设施的案例。
  • “从像素输入的网页智能体”与“依赖 HTML/无障碍树”的路线对比。
  • “开放网络 vs 固定网站列表”对数据多样性的影响。

原始材料

  • 英文标题:BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes
  • 英文关键词:web agents; trajectory synthesis; parallel browser sandboxes; screenshot-based agents; open-web data scaling; foundation models
  • 原始来源:https://arxiv.org/abs/2608.24848v1
  • Track / Topics:academic; foundation-model
  • 正文状态:未能抓取正文,仅基于已知元数据生成;无法从材料确认的部分均标注为“待核实”。