AI消息速览

BDH-CQ——上下文学习与循环潜在推理

事件日期 2026-08-10 · 学术前沿 · 已接受

事件日期2026-08-10
信息日期2026-08-10
入库日期2026-08-11
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:BDH-CQ——上下文学习与循环潜在推理

英文标题:BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
英文关键词:BDH-CQ; In-Context Learning; Recurrent Latent Reasoning; ARC-AGI-1; Cost Efficiency; Latent Reasoning
原始来源:https://arxiv.org/abs/2608.09888v1

一句话结论

BDH-CQ 是一种将上下文学习与循环潜在推理结合的新推理模型:推理时输入不断更新模型的循环记忆,模型在高维潜在空间中迭代计算求解,而不把中间推理过程写成文字。论文报告,150M 参数配置在公开 ARC-AGI-1 评测集上达到 29.5% pass@2,每个任务计算成本约 $0.0007,突破了此前报告的 ARC-AGI-1 成本-准确率帕累托前沿。

事件概述或研究问题

  • 研究问题:如何让模型在推理时利用示范进行上下文学习,同时避免显式、口头化的中间推理,从而提升推理效率和成本表现?
  • 论文提出 BDH-CQ,将推理过程放在高维潜在空间中迭代完成,而不是让模型生成一串推理文字。
  • 除了 ARC-AGI-1 公开评测集,论文还设计了受 ARC 启发的受控干预实验,考察模型从示范中学到了什么、对推断出的变换的应用是否一致,以及哪些概念仍然困难。

方法/产品要点

  • 推理时输入会持续更新模型的循环记忆(recurrent memory)。
  • 查询求解通过高维潜在空间中的迭代计算完成。
  • 不将中间推理过程言语化(without verbalizing intermediate reasoning)。
  • 模型具备上下文学习能力:推理时提供的输入/示范可进入记忆并影响后续求解。

主要结果或产业意义

  • 150M 参数配置在 ARC-AGI-1 上达到 29.5% pass@2。
  • 每个任务的计算成本约为 $0.0007(按论文计算口径)。
  • 论文称该运行点突破了此前报告的 ARC-AGI-1 成本-准确率帕累托前沿,成为该基准成本效率的新 SOTA。
  • 产业意义在于:如果该方法可推广,可能大幅降低需要多步推理的智能体任务的推理成本。

为什么重要

  • BDH-CQ 说明“隐性/潜在推理 + 循环记忆”可以在不输出 Chain-of-Thought 的情况下获得较强的推理性能和极低计算成本。
  • 这为“测试时计算”提供了一条不同于显式推理文本的路径:模型可以在潜在空间中反复迭代,而不是依赖生成长篇推理。

与既有脉络的关系

  • 与 CompactionRL(上下文压缩)和 Copy Less, Ground More(证据感知强化学习)不同,BDH-CQ 不是通过压缩历史轨迹或奖励重塑来改进长上下文推理,而是通过循环潜在记忆在推理时逐步更新状态。
  • 增量信息:BDH-CQ 提供了 ARC-AGI-1 上的成本效率证据,说明“非言语化潜在推理”也可能成为推理成本优化的重要方向。

局限与不确定性

  • 摘要未披露完整的模型结构、训练方式、训练数据规模、循环记忆的具体实现等细节,待核实。
  • pass@2 不是严格的单次采样准确率;其与 pass@1、多数投票等指标的关系待核实。
  • $0.0007/任务 是论文计算得到的估计成本,实际部署成本可能因硬件、实现和推理长度而不同,待核实。
  • 公开结果主要集中在 ARC-AGI-1 和 ARC 类受控任务;在其他推理基准或真实产品场景中的泛化能力待核实。
  • 该论文是否经过同行评审或正式发表,待核实。

可用于图书/PPT/简报的角度

  • 案例:150M 参数模型在 ARC-AGI-1 上以极低成本刷新帕累托前沿。
  • 观点:让模型“在潜在空间里思考”可能比“把思考写出来”更省成本。
  • 趋势:测试时计算正在从“生成更多文本”转向“更新内部状态 + 迭代计算”。
  • 对比:显式 CoT 的高推理成本 vs. 潜在循环推理的低成本路径。

原始材料

  • 英文标题:BDH-CQ: In-Context Learning with Recurrent Latent Reasoning
  • arXiv ID:2608.09888v1
  • 作者:Björn Engdahl, Adrian Kosowski, Jan Chorowski, Zuzanna Stamirowska, Przemysław Uznański, Junlin Jiang, Rohan Phadke, Remigiusz Kinas, Richard Zhong
  • arXiv 元数据时间:2026-08-10T17:39:16Z
  • 类别:cs.NE, cs.AI, cs.LG, stat.ML
  • 原始链接:https://arxiv.org/abs/2608.09888v1
  • PDF 链接:https://arxiv.org/pdf/2608.09888v1