AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 141-160 条,共 2259 条
第 8 / 113 页
事件日期 2026-09-01

论文提出用“近最优区域”而非单个最优比例来刻画 LLM 后期训练中 SFT(监督微调)与 RL(强化学习)之间的标注预算分配问题;研究发现该区域即使在 2%–10% 的较小性能容差下也相当宽,会随模型规模增大而变宽,并且可以从较小的代理模型可靠迁移到较大的目标模型。因此,用小模型做预算分配扫描,可能就不再需要对大模型进行穷举式搜索。

大型语言模型的后期训练通常同时使用 SFT 和 RL,但固定的标注预算如何在两者之间分配仍是一个开放问题。已有研究只给出了粗略趋势,例如低数据区域中 SFT 占主导,缺少原则性的分配框架,也没有验证最优比例是否能跨模型规模迁移。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

当“表面措辞”和“底层结构”被刻意拆开时,嵌入检索会更依赖字面 token 而非结构。竞赛数学最重改写档中严格 Hit@1 为 0.0%,但正确项几乎总在 Top-10;智能体轨迹中若答案需换物体/容器,检索接近或低于随机。词法重排和 LLM 重排只能部分恢复,数学恢复里有记忆成分,且下游评测中“oracle 检索”与“坏检索”没有可测差异。

研究问题是“结构检索”:检索目标与 query 共享底层结构,但不共享字面表述。 两个无关领域在同一协议下测试: 竞赛数学:MathNet-Retrieve;500 queries,117,088 条语料。 具身智能体轨迹:ALFWorld 衍生;118 queries,336 条轨迹。 “检索到正确项但排不到第一名”是全文贯穿的现象。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

在60个模拟数据集/条件和9个真实评估数据集上,量子稀疏自编码器(QSAE)并没有在所有情境下都比经典自编码器(CAE)精度更高,但在60个条件中的49个表现出更低的跨重复方差;在9个真实数据集中的6个上优于CAE。作者认为,QML在本任务中的主要价值不是普遍提升准确率,而是增强稳健性并更好地探索真实数据中的潜在结构复杂性。

Quantum Sparse Autoencoders for Q-Matrix Estimation in Cognitive Diagnosis

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

基于模型的强化学习(MBRL)在单智能体领域表现突出,但在竞争性不完全信息博弈中的扩展仍不充分,这是本文瞄准的研究空白。 多智能体博弈中,对手策略变化会引发非平稳性;论文指出,分散式(decentralized)模型学习面临严重的可辨识性(identifiability)障碍,因此论证集中式模型学习在数学上具有必要性。 摘要没有说明具体是哪四个基准游戏,也…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

本文提出一个机制设计框架,用于处理“对齐(偏好)和能力(可行行动与信息)未知”的AI智能体,核心目标是设计激励机制,使智能体在面对我们时既“诚实”又“服从”。

研究的问题是:当我们将任务委托给AI智能体时,智能体的真实偏好(alignment)与实际能力(capabilities)并不为我们所知。机制设计需要同时解决两类信息问题和激励问题:智能体是否会虚报能力或偏好(诚实性),以及其在执行任务时是否会按要求行动(服从性)。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

与预训练阶段不同,在大语言模型的“中段训练”(mid-training)阶段使用基于 logit 的前向 KL 知识蒸馏,会持续提升推理能力,但会拖慢事实回忆的获取;论文提出的 Switch Distillation 可以在保留事实回忆的同时获得推理与常识收益。

该论文研究知识蒸馏(KD)在语言模型不同训练阶段的作用是否一致。具体问题是:使用更强的教师模型进行 logit-based 知识蒸馏时,在“中段训练”——即有策展语料上的自监督学习中间阶段——是否仍能像预训练阶段一样同时改善推理和事实回忆?实验发现并非如此。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

(待核实:基于arXiv元数据中的候选摘要。)H3-World 提出一种轻量化框架,将 MiniMax-H3(33B)视频生成器原本粗粒度的自然语言控制,转化为具有时间精度的交互式世界控制,且无需新增专用动作模块。

该研究尝试回答:大型视频生成模型能否被直接改造成“可交互的世界模型”? 候选摘要指出,MiniMax-H3 已经能用自然语言零样本控制角色行为和镜头运动,但指令还不能精确对应到具体时间区间。 H3-World 的核心任务,是把这种“语言界面”变为时间上可控、空间上更精确的世界控制能力。 以上问题描述来自候选摘要,论文正文待核实。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

训练物理信息神经网络时需要联合优化物理残差损失和初值/边界条件损失,这些损失项的梯度可能相互冲突。论文指出,即使梯度手术在优化器变换前构造的方向 \(a_t\) 落入无冲突锥 \(\mathcal{C}_t\),现代优化器也未必能把这种无冲突性质保留到最终提议的更新 \(u_t\) 上,即“梯度更新失配”(GUM)。提出的“梯度更新对齐”(GUA)将优化器…

PINN 训练通常要求同时优化“物理残差”与“初值/边界条件”两类损失项,二者产生的梯度可能彼此冲突。 已有梯度手术方法在优化器变换之前,由各损失项特定梯度构造方向 \(a_t\),以降低梯度冲突。 新研究问题:优化器的历史状态、自适应缩放、预条件或解耦权重衰减等机制会进一步变换 \(a_t\)。论文论证:\(a_t \in \mathcal{C}_t\)…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

该论文针对大语言模型在“标签空间大、标签语义相似”的文本分类任务中容易混淆的问题,提出一种无需微调的困惑感知检索与知识注入框架:先找出模型难分的标签对,再加入易混淆候选标签,并生成针对性规则来区分相似标签。在 WOS、Flipkart、LEDGAR 三个基准上,相比检索基线,Macro F1 最高提升 10.0 个百分点;小模型(2B–20B)通过跨模型迁…

大语言模型在把文本分入包含大量语义相似标签的分类体系时表现不佳,因为标签间的区分常常依赖领域知识,预训练阶段未必能充分捕获。 一种常见做法是:先用嵌入相似度检索 top-K 候选标签,再提示 LLM 从候选标签中选择。 但这种 top-K 检索只减少了候选数量,并不能帮助模型区分“相似但不同”的标签;当两个相似标签同时出现在候选中时,模型仍缺乏足够信号判断…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

Facet-0 是一个将动作生成与腕部力/力矩(wrench)预测联合起来的机器人基础模型;在 ManuFacet-1K 上训练并经过任务适配后,它在五种亚毫米计算机装配任务上达到 82% 的平均成功率,而最强基线只有 15%。

真实世界的机器人装配往往面临亚毫米容差,要求系统同时具备空间精度、柔顺交互和对接触失败的鲁棒性。此前的机器人基础模型多侧重于视觉、语言与动作生成,而 Facet-0 将问题聚焦于“接触后果”:模型不仅要预测动作,还要预测并评估动作会引发什么样的接触效果。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

EvoSCM 提出让科学智能体不只“学会推理”,还“知道该相信什么”:它把科学假说表示为显式、可演化的结构因果模型(SCM),并通过“做出可证伪预测—实验检验—用偏差修正模型”的闭环,在 DiscoverPhysics 基准上持续提升科学发现效果。

研究问题:现有 LLM 科学智能体通常把科学假说写成自由文本,信念隐含在语言中,难以被检验、证伪和修正。 提出的方法:EvoSCM 让科学智能体携带显式的结构因果模型,并随着新实验证据的积累持续演化这些模型。 评估基准:DiscoverPhysics,要求智能体通过实验发现非标准物理世界背后的隐藏动力学。 核心主张:科学智能体不只需要更好的推理能力,还需要…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

本文提出一种名为 PTA-IRT 的“特权轨迹感知项目反应理论”框架,将智能体执行任务的历史轨迹与最终通过/失败结果结合,用于更高效地选择少量校准任务并估计智能体能力;在低校准预算下,该方法在四个 SWE 基准上一致优于既有 IRT 基线。

在真实软件工程(SWE)基准上评估智能体成本很高,因为每项任务可能涉及多步代码探索、修改和测试执行。已有高效评估方法通常只利用结果信号(如通过/失败)或静态任务语义来选择代表性子集,从而估算完整基准得分,但忽略了智能体实际解决问题的过程信息。本文研究的问题是:能否利用历史执行轨迹中的过程信号,提高低成本校准子集选择与能力估计的准确性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

从构思到修改,写作涉及不同层次的认知活动;仅提供自动补全等通用文本辅助并不够。本文提出并探索“主动思维伙伴”这一设计方向:让用户可配置角色和主动性的 AI 智能体在适当时机提供更高层认知支持,从而把写作 AI 从“替用户补字”推向“陪用户思考”。

写作包含从想法产生到修改完善的多种认知活动,且不同写作者、不同时刻的需求差异很大。主动 AI 有机会在“正确的时间”提供“正确的支持”,但现有主动写作工具大多停留在文本层面的通用辅助,例如自动补全。本文研究的问题是:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

CordisBench 是包含 1,200 道题的组件生命周期推理基准,用来考察语言模型能否在动态 Agent 执行框架(dynamic agent harness)中理解组件依赖、清理(teardown/cleanup)顺序与重配置的后果。结果显示,模型在小规模系统上通常表现不错,但随着相关交互数量增加,可靠性下降;额外推理投入可为部分模型带来明显提升,…

动态 Agent harness 使语言模型能够改变塑造其自身执行的软件,这种灵活性带来新的推理负担:一个局部插件变化可能通过依赖关系和清理过程传播,影响其他组件。 CordisBench 研究的问题是:语言模型能否对这种“组件生命周期”进行可靠推理? 该基准结合受控形式化设置与在 Cordis 运行时上执行的程序。Cordis 是一个管理组件依赖与清理的…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

该工作展示了一个已部署的文档理解系统:它基于总参数35B、激活参数3B的混合专家(MoE)视觉语言模型,结合“难度感知”数据筛选与内部生产数据微调,在质量调整后的预期成本上比人工基线降低超过80%,比最佳可比开源模型降低超过50%。

在受监管行业中,每年需从数亿份文档中提取结构化字段,成本高昂。自研OCR级联只能覆盖少数工作流,隐私规则禁止调用外部模型,而能达到质量门槛的开源VLM在服务成本上甚至高于人工标注。因此,研究问题是如何弥合文档VLM的“成本-质量差距”。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

基于该论文摘要:大语言模型能否真正“发现科学定律”仍是开放问题;作者提出科学定律发现基准 SCILAWS-BENCH,通过“真实观测”和“平行世界”两种互补任务评估模型,发现预测拟合度与科学有效性可能脱节,记忆会显著影响模型是复现还是超越已有公式,并且 best-of-N 研究暴露出选择瓶颈。

科学方程发现长期是科学进步的核心,通常经历“提出假设—观测检验—修正”的迭代过程。 随着大语言模型能力提升,其在“AI for Science”中的角色日益重要,但它们能否真正发现科学定律、以及应如何评测这一问题仍不明确。 已有评测往往使用合成环境简化任务,或使用可能已被 LLM 记忆的已发表公式作为目标,导致评估不够可靠。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

本文提出一种以用户涂鸦(scribble)为条件的 ResEnc U-Net,用于多示踪剂 PET/CT 全身病灶分割;在 autoPET/CT V 挑战的五折验证中,无交互时平均 Dice 为 0.554,经过 5 轮涂鸦修正后升至 0.751,说明少量交互提示能大幅提升分割性能。

全身 PET/CT 病灶自动分割的难点在于:不同示踪剂的生理摄取模式多样,病灶外观差异大。autoPET/CT V 挑战(据候选摘要;拼写与既有卡片 AUTOPET V 的差异待核实)将分割任务设计为交互式:算法接收图像以及用户标记前景/背景的涂鸦图,并须利用这些提示改进分割。本文描述的是作者为此挑战提交的系统。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-09-01

LLM 裁判给摘要打分不是一个无法解释的“黑箱直觉”,而是存在一条可定位的两阶段神经计算管线:第 15 层以下的注意力先进行局部错误比较并把结果路由到最终输入位置,第 15 层以上的 MLP 级联整合信号并写出评分;最终决策在残差流中的一个明显晚期层结晶(Themis 为第 26 层,Prometheus 为第 25 层)。

LLM 作为自然语言生成质量评估器已被广泛用作打分工具和自动训练信号,但其内部“如何得出评分”的机制仍然不清楚。本文针对摘要评估场景,对两个开源 LLM 裁判——Themis(Llama-3-8B)和 Prometheus(Mistral-7B)——进行机制可解释性研究,试图打开评分过程的黑箱。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条