自然产生的用户交互反馈并非如近期研究所说那样“噪声大且难以利用”;它其实是一种高度可操作的LLM改进信号。以往认为无效,主要是因为现有评估范式存在系统性偏差:当模型因反馈而真正修正问题时,LLM评判者常常反而偏好较差的基线输出。
本文挑战“用户反馈信号噪声大、难以有效利用”的既有观点。研究问题是:用户反馈对LLM修订是否有独特的、不可替代的增益?如果有,为什么此前的评估没有发现它?
自然产生的用户交互反馈并非如近期研究所说那样“噪声大且难以利用”;它其实是一种高度可操作的LLM改进信号。以往认为无效,主要是因为现有评估范式存在系统性偏差:当模型因反馈而真正修正问题时,LLM评判者常常反而偏好较差的基线输出。
本文挑战“用户反馈信号噪声大、难以有效利用”的既有观点。研究问题是:用户反馈对LLM修订是否有独特的、不可替代的增益?如果有,为什么此前的评估没有发现它?
将 E2M1 FP4 载荷与无符号 E5M3 块缩放结合(即 UE5M3),并采用选择性随机舍入,可以在约 190B token 的 Nemotron-H 8B 预训练中取得比 NVIDIA Transformer Engine 参考配方更低的训练/验证损失和更高的下游量化推理点估计,同时省去随机 Hadamard 变换与 BF16 最终层豁免。
稳定的 4 位浮点(FP4)预训练很困难,因为 FP4 的 E2M1 格式只能表示很窄的数值范围。 NVIDIA Transformer Engine 的参考配方依赖“当前张量缩放 + 随机 Hadamard 变换(RHT)+ BF16 最终层”来维持稳定,但这些操作加在了 FP4 矩阵乘法之外,增加了额外工作。 本文尝试用另一种更简单、更利于硬件实现的配…
TRACE(Transparent Reasoning Architecture for Credible Execution,透明推理架构以实现可信执行)提出了一种四层可审计决策框架,使自主机器人的每个动作都可以通过文档化因果链追溯到传感器证据;在仓库机器人导航的500个模拟决策周期中,其三个可审计性指标均超过98%。
研究问题:由深度学习驱动的自主机器人面临根本性审计挑战——发生事故时,调查者无法重建系统为什么做出特定决策。 论文方案:论文提出 TRACE 决策框架,用文档化因果链连接传感器证据与自主行动,从而支持决策级审计。 材料来源:arXiv 预印本 2609.02861v1,作者 Cagri Temel,公布时间为 2026-09-02。
从论文摘要看,现有统一生成模型(UGM)和世界模拟器在面对“从视觉输入推断规则,再生成逻辑约束图像”的任务时,普遍存在**推理-生成鸿沟**:局部看起来合理,但全局往往不合逻辑。RIG-BENCH 正是用于暴露这一短板的压力测试与诊断基准。
背景:近期的统一生成模型(UGMs)和世界模拟器在视觉感知与合成上取得前所未见的结果,但主要依赖表层事件对齐,高层视觉推理能力仍未被充分探索。 核心概念:真正的视觉生成智能需要 **Reasoning-to-Generation**,即从视觉输入中推断潜在规则,并通过精确、受逻辑约束的视觉结果来体现解决方案。 研究问题:如何系统性评测模型是否具备“推理驱动…
SolarWM 提出一套从数据处理到长时程推理的“完全开放”框架,用可重构数据引擎将来自 10 个数据集的 143 万个规范片段统一为帧对齐契约,并在保留 Wan2.2、LTX-2.5、MiniMax-H3 各自表征与目标的前提下,通过三阶段统一训练方案得到 4 个 5B–33B 模型;据摘要,这些模型仅用 5 秒序列训练,即可在分钟到小时级的推演(rol…
跨异构数据源和多种视频骨干训练视频世界模型存在挑战:数据集在时长尺度、相机几何、视觉质量、运动模式和描述(caption)风格上差异很大;不同视频生成器又使用不同的表征与架构。简单混合数据、为某个模型单独定制实现,会造成监督不一致,也让结果难以复现和比较。SolarWM 的核心问题是把“数据源”与“模型实现”之间的耦合关系拆解开,建立一个可复现、可扩展的交…
ShallowStream 提出让多模态大语言模型(MLLM)的浅层网络在持续视频流中同时完成帧编码与检索索引构建,在保持与最强现有流式方法相当性能的同时,显著降低每帧预填充延迟和端到端延迟。
流式视频理解是具身智能、自动驾驶、工业监控、安防预警和可穿戴助手等现实应用的关键能力。然而,用 MLLM 持续处理视频流计算开销巨大。已有工作尝试通过视觉 token 剪枝、token 合并、量化、按需取帧和上下文卸载来降低开销,但大多忽略了“模型深度”这一维度:对每一帧反复执行全深度 MLLM 预填充非常昂贵,而且 KV 缓存会随预填充深度线性增长。Sh…
SafeEvolve 提出一种由智能体自身经验驱动的“护栏-策略协同演化”框架,在 agentic 安全基准上取得优于现有基线的安全-效用权衡。
LLM 智能体的性能由基座模型和与环境交互时使用的“护栏”共同决定,安全风险不仅可能出现在有害最终回答中,也可能出现在多步执行轨迹中。现有安全对齐机制往往只侧重外部护栏更新或单纯策略优化,单独使用任何一种范式都难以桥接运行期控制与内在安全。
RoGe 是一个端到端统一框架,将“隐式场景重建”与“视频扩散生成”联合训练,去掉了以往混合方法中“渲染图像/点图/3D Gaussian”这类有损的显式 3D 桥接;摘要称其在 DL3DV 上的图像级指标和视频时间一致性均优于重建型、生成型和混合型基线。
RoGe: Novel View Synthesis via End-to-End Implicit Reconstruction and Generation
作者提出了一套结合题目筛选、合成推理轨迹、监督微调(SFT)与强化学习(RL)的语言模型后训练方案,并引入反馈驱动的测试时计算策略 GenCorrect;据摘要报告,该系统在 IOI 2025 和 IOI 2026 题目/赛制中均超过金牌线,其中 IOI 2026 的竞赛专用系统在 535.4/600 的分数上超过了最高分人类选手 498.27,作者称这是…
竞赛编程已成为测试大语言模型推理能力的重要场景,国际竞赛如 IOI、ICPC 被视为最具挑战性的设置之一。 论文关注的问题是:如何通过后训练让语言模型在竞赛编程中达到金牌级表现。 摘要中报告的方法并非简单增大模型或预训练规模,而是对模型进行竞赛场景的端到端专门化。
MuyBridge 是一个纯端侧系统,用单部手机的单目视频流估计运动员基于节段法的人体质心(segmental center of mass,CoM)轨迹:以 63 FPS 的 2D 姿态估计为主干,配合约 2.86 Hz 的稀疏单目深度更新,在 AthletePose3D(跑步、田径、花样滑冰)上取得 33–41 mm 的垂直方向 CoM 误差,且不需要…
三维质心是运动、康复与临床步态生物力学分析中的基本量。但现有技术存在两难:3D 姿态追踪和网格恢复等方法主要优化 3D 关键点精度,缺乏解剖学约束;多视角三角化等方法则需要沉重的计算与采集设施,难以部署在教练和运动分析师最需要的训练/比赛现场。因此,从单摄像头获得公制的 CoM 仍很困难。MuyBridge 正是针对这一缺口提出的手机端单目方案。
SpeND(Spectral-like Neural Discretisation)将无网格离散算子中“未被多项式一致性约束的自由度”交给神经网络学习,使构造出的微分算子能在更宽波数范围内近似谱算子的频响,同时通过硬约束投影严格保持多项式一致性。
SPH、RBF-FD、LABFM 等无网格方法通常通过在局部模板上强制多项式一致性来构造离散微分算子。当模板节点数多于一致性约束数时,相应线性系统欠定,剩余自由度由核函数选择、基函数预处理或最小范数条件隐式决定。问题在于:多项式一致性只约束算子低波数极限,不控制细小结构所在波段的精度。SpeND 将这部分自由度选择建模为学习问题。
本文提出一种面向电信网络根因分析(RCA)的结构化推理框架,通过在诊断前将异构网络遥测组织成规范上下文、在诊断中强制决策路径推理、在输出时生成证据支撑的解释,来减少大语言模型(LLM)在5G/6G场景下直接用于RCA时的幻觉与不稳定,提升诊断准确率和决策一致性。实验基于TeleLogs和TelecomTS两个5G RCA数据集(待核实具体规模与来源)。
电信网络运维中的根因分析需要从跨层、多源、动态的网络数据中定位性能劣化原因。5G及未来6G网络的跨层依赖使RCA更加困难。现有方法经历了基于规则、机器学习到新兴的LLM增强范式;但直接使用通用LLM做电信RCA存在幻觉、推理不稳定、与结构化网络证据对齐不足等问题。该工作因此提出并验证一个让LLM沿证据化路径进行诊断的结构化推理框架。
在光滑凸优化中,采用预定步长序列的梯度下降(GD)仍有不可忽视的收敛误差下界:本文给出 non-anytime 下界 \(\Omega(n^{-1.6342})\) 和 anytime 下界 \(\Omega(n^{-1.2408})\),分别改进了 Ma-Chen 与 Tsai 等人的结果,并借助 silver schedules 的非 anytime…
本文是一篇 arXiv 理论论文,属于优化与机器学习理论交叉方向。研究问题是:在光滑凸优化中,如果梯度下降的步长序列是预先确定的(predetermined stepsizes),GD 能被加速到什么程度。
Graph Machine(GM)是一种维护 O(n) 大小状态并通过稀疏动态路由访问该状态的架构;用 GM 稀疏层替换 Qwen3-0.6B 中 75% 的稠密 Transformer 层后,在 15.7B tokens 上从头预训练,每个 KV 头只需从 4,096 个 token 中检索 4 个 token,最优模型的 loss 便获得轻微改善。
论文关注 Transformer 预训练中的状态访问与计算复杂度平衡。 作者指出,既有方法要么使用固定大小状态,要么使用“稀疏但静态”的路由;GM 希望实现稀疏层内 O(n) 复杂度,同时不把潜在可访问状态大小限制为 O(1)。 实验路线:将 Qwen3-0.6B 的 75% 稠密 Transformer 层替换为 GM 稀疏层,并使用 15.7B tok…
GRADSOLVE 是一个面向 NVIDIA GPU 的开源 JAX 库,用于求解低维 ODE 集成(ensemble)并执行反向模式求导:它记录自适应求解器接受的步,再对这些步做定步长重放和微分,返回这些步的精确离散伴随;一旦完成一次记录,其梯度计算速度比 Diffrax 的 checkpointed adjoint 快约 5.6–14.1 倍,具体优势…
常微分方程(ODE)广泛用于科学与工程模型,许多应用需要关于参数的导数。 由大量独立轨迹组成的 ODE 集成适合在 GPU 上运行。 现有 GPU 软件存在两难:最快的集成求解器无法以同等速度被反向模式求导;而为求导设计的求解器在正向求解上又更慢。 摘要指出,此前没有一个工具能在融合核函数求解速度的量级上同时提供反向模式梯度。GRADSOLVE 旨在填补这…
GDB-Reward 的核心主张是:把图形设计领域各类不可微的评估指标统一转换为强化学习奖励,从而在不微调文生图模型的情况下,提升模型输出对设计规格的遵从性(依据候选摘要,具体效果与机制待核实)。
文生图模型在自然图像合成上表现较强,但在图形设计上仍有短板;图形设计要求满足版式、布局、颜色与视觉沟通等精确约束。 提示词优化是扩散模型微调之外的一种低成本替代方案,但冻结的图像生成器不可微,需要能对候选输出排序的奖励信号。 研究问题由此提出:图形设计评估指标本身能否直接成为强化学习奖励?
在无噪声高斯压缩感知的理想化线性设定中,**全维线性生成先验**在整族可调线性先验中取得最小期望重建误差;此时调低先验复杂度并不能改善重建误差。该结果与去噪任务中低复杂度先验因偏差-方差权衡而更优的行为形成对比。
本文研究的是生成先验用于压缩感知等逆问题时的“可调复杂度”设定:即维护一族复杂度不同的生成先验,在反演时选择特定复杂度。此前已有实验表明,在多种逆问题中通过适当调节生成先验复杂度可以获得更低的重建误差;而本文试图建立对应的理论。具体研究问题是:在**可调线性生成先验族**(且族内各先验通过奇异值分解自然关联)的设定下,压缩感知的最优先验复杂度应当如何选择?
论文为 Model-RB 基准实例 `frb100-40` 给出了可核验的最优性证书:一个 100 顶点的独立集,以及一个将该 4,000 顶点图划分为 100 个大小为 40 的团的验证性划分;二者合在一起证明最大独立集大小为 100,最小顶点覆盖大小为 3,900。预注册搜索实验显示,新增的 pair 与 triple 修复算子相对基础 ULSA 没有…
`frb100-40` 是 Model-RB 基准中一个超过 20 年未被解决的公开挑战。据摘要,自 2014 年以来,其实例的公开记录停留在“100 个变量中的 99 个”。本研究的目标不仅是找到更好的启发式结果,而是为这一实例提供确定性的最优性证明。
CW-Net(Concept-Wrapper Network,概念封装网络)将自动驾驶机器学习规划器的决策“因果性地”锚定到人类可理解的概念上,并在真实自动驾驶车辆上完成部署;结果显示,它改善了驾驶员对车辆行为的心智模型,使其能更好地预测车辆行为,尤其是在意外场景中。
背景:自动驾驶汽车越来越依赖深度神经网络,但黑箱规划器让人类难以预判其何时会失败,可能带来严重安全后果。 既有可解释性研究大多局限于仿真或玩具级场景,难以判断其在实际部署中的真正用处。 核心问题:能否提供一种可理解、有用且对决策过程忠实(causally faithful)的可解释深度学习方法,并在真实自动驾驶车辆上改善用户的预测能力? 作者提出 CW-N…
本文提出一种轻量级全合一图像恢复方法 FReSH-IR(Frequency Reconstruction via Spectral Harmonization),通过在层级编解码器中显式分解高、低频特征并结合傅里叶跳跃连接,以比 Transformer 类模型少 80% 的参数与计算量,取得相近的恢复质量。
雨、雾、雪等不利天气会显著降低图像质量,影响人类感知和物理 AI 系统。现有恢复方法计算开销大,难以处理高分辨率图像,也难以同时应对多种退化。论文试图解决“能否用轻量级网络实现多类天气退化统一恢复”的问题。