BDH-CQ 是一种将上下文学习与循环潜在推理结合的新推理模型:推理时输入不断更新模型的循环记忆,模型在高维潜在空间中迭代计算求解,而不把中间推理过程写成文字。论文报告,150M 参数配置在公开 ARC-AGI-1 评测集上达到 29.5% pass@2,每个任务计算成本约 \$0.0007,突破了此前报告的 ARC-AGI-1 成本-准确率帕累托前沿。
研究问题:如何让模型在推理时利用示范进行上下文学习,同时避免显式、口头化的中间推理,从而提升推理效率和成本表现? 论文提出 BDH-CQ,将推理过程放在高维潜在空间中迭代完成,而不是让模型生成一串推理文字。 除了 ARC-AGI-1 公开评测集,论文还设计了受 ARC 启发的受控干预实验,考察模型从示范中学到了什么、对推断出的变换的应用是否一致,以及哪些概…