知识卡片:搜索超越可教边界——智能体视觉生成中的知识边界演化
英文标题: Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
英文关键词: Agentic Visual Generation; Knowledge Boundary; Co-training; World-Knowledge Bottleneck; SearchGen-Bench; Teach-then-Search
一句话结论: 现有视觉生成模型在面对开放世界中的长尾知识(如新角色、后截止事件)时会自信地产生幻觉;通过“先教授、后搜索”的协同训练框架可以动态发现并扩展模型的知识边界,实现单调提升,为工具增强的视觉生成奠定基础。
事件概述或研究问题: 用户需求是无限的、演化的且具有深度的长尾性,而视觉生成器只能基于固定训练语料工作,导致对训练语料之外的世界知识产生虚构(幻觉)。研究将这一问题定义为“世界知识瓶颈”,并认为其结构性的根源在于生成器内部化(通过训练掌握)的知识与需依赖外部上下文的知识之间的边界(即“知识边界”)是动态且难以预先指定的。该工作构建了SearchGen-20K数据集和SearchGen-Bench基准(含20,839条提示,覆盖12类失败模式、22个领域)以及预执行的多模态SearchGen-Corpus-1M语料库,以支持可复现的研究。
方法/产品要点:
- 构建大规模评测基准SearchGen-Bench,包括20,839条提示,覆盖12类失败模式和22个领域,以及配套的1M多模态语料库。
- 测试发现当前顶尖开放视觉生成器在SearchGen-Bench上仅获得21-28分(满分100),相比现有基准存在约40分的性能坍缩。
- 提出**“先教授、后搜索”(teach-then-search)协同训练框架**:先让生成器通过训练内化知识,再结合搜索工具补充外部知识;该框架可以发现模型特定的、演化的知识边界,即使最简版本也能实现单调改进。
- 开源完整数据集、协同训练语料和搜索语料,作为可重放的工具增强工具集。
主要结果或产业意义:
- 现有基准无法暴露的“40分坍缩”在SearchGen-Bench上被清晰揭示,说明现有评测对长尾知识能力的评估严重不足。
- 最简单的“先教授、后搜索”协同训练已能产生单调提升,为递归式自我改进提供了基础,能应对世界知识驱动的视觉生成需求。
- 产业应用:可用于生成新角色、热点实体、后截止事件等需要持续更新知识的场景,减少幻觉,提升生成结果的可靠性和时效性。
为什么重要: 视觉生成模型在渲染能力上已很出色,但世界知识瓶颈是其实际部署的核心障碍。该工作首次系统性地定义、评测并提出解决方案,揭示了“知识边界”的演化特性,打破了传统“训练固定、检索万能”的简单假设,为未来智能体视觉生成系统指出了关键方向。
局限与不确定性:
- 知识边界虽然可通过协同训练“发现”,但其理论表征(如具体算法如何精确划分内部化知识与外部上下文)仍在初步阶段。
- 当前实验仅验证了最小版本的协同训练,更大规模的递归自改进效果有待进一步验证。
- 数据集和语料库的覆盖范围(22个领域)是否足以代表真实世界无限的长尾分布,待核实。
- 该框架对不同模型架构和规模(如更大参数量的闭源模型)的迁移效果,待核实。
可用于图书/PPT/简报的角度:
- “AI幻觉的元凶:为什么画一个‘2025年诺贝尔奖得主’会出错?”——从用户端的长尾需求出发,引出知识边界概念。
- “评测基准的盲区:当模型在自测中拿99分,实际却只有21分”——展示SearchGen-Bench的40分坍缩数据。
- “教与搜的辩证法:先教什么,再搜什么?”——介绍teach-then-search协同训练的设计思路。
- “智能体视觉生成的下一站:递归自改进”——展望该框架对AI持续学习能力的启发。
原始材料:
- URL: https://arxiv.org/abs/2607.05382v1
- arXiv ID: 2607.05382v1
- 作者:Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei
- 发布日期:2026-07-06
- 摘要全文:见上述“事件概述”及“方法/产品要点”部分。