AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1241-1260 条,共 2259 条
第 63 / 113 页
事件日期 2026-07-30

在测试的推理阶段边界上,**边界K/V缓存是发散轨迹的因果充分载体**;BF16下“保留实时缓存”与“一次性预填相同token”会产生行为差异,而FP32下不产生解码分歧。精确token重放可以可重复,但不等于保持实时状态保真度。

该研究检验一个常用于阶段重放诊断的假设:重建中间token前缀后,用“一次性预填(fresh-prefill)”继续生成,等价于从原本到达该前缀的解码器状态继续生成。作者在一个Qwen2.5衍生系统的完整推理阶段边界上检验了这一假设,并比较了不同KV缓存构造方式与数值精度的影响。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

SCOPE 提出一种将供应链实体 token 化、并通过共享运营表示统一协调多类决策的复合策略模型,在城市生鲜零售的真实运营数据上持续优于“分阶段独立优化”的方法,说明跨环节耦合建模能提升端到端供应链决策效果。

本文研究的问题是:供应链 AI 能否从孤立的决策模块走向统一运营规划?一个完整补货计划需要同时决定:每个门店/仓库存放哪些商品、由哪个上游设施供货、补货频率是多少、以及配送如何路由。这些决策在运营上相互耦合——选品会影响后续环节的需求与负载;货源分配和补货频率会重塑配送请求;而路由可行性和成本又反过来决定前序选择的系统价值。然而现代供应链中这些决策常由不同…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

ScaFE 不直接把临床照片交给视觉语言模型(VLM)诊断,而是让大语言模型生成确定性的、可执行的“临床特征程序”,在本地计算瘢痕视觉属性,再用轻量随机森林分类;在三医院 600 张照片的留一站点评估中达到 81.0% 的站点宏平均平衡准确率,比最强基线 BiomedCLIP 高 10.0 个百分点;仅用 10% 开发数据时仍保有 72.0% 平衡准确率并…

病理瘢痕分类需要从临床照片区分瘢痕疙瘩和增生性瘢痕,但存在专家标注数据少、跨医院图像采集差异大等困难。端到端图像模型依赖大量数据;如果把照片发送到托管的 VLM,可能违反本地数据治理要求,且决策难以复现和审计。ScaFE(Scar Feature Engineering)试图将 LLM 的临床知识转化为在本地运行的可执行程序,而不是让模型直接看图像诊断。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

在把“批评、反思、重写、辩论、检查”等所有环节消耗的token都计入成本后,**没有任何方法在同等成本下可靠优于“重复采样取多数答案”这个简单基线**;共有10项比较显著更差,且全部来自模型检查自身输出的方法。

许多方法让语言模型规划、批评并重写自己的答案,或反思错误、从多次尝试中挑选最佳、与自身副本辩论。这些方法通常比单条思维链生成更多文本。 由于“生成更多文本”本身就能提高准确率,因此相对单条思维链的提升并不能证明该方法的“设计思想”真正起作用。 Wang et al. (2024) 曾报告:在预算可比时,对同一问题反复采样并保留最常见答案的简单基线经常获胜,…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

在 GNN 的同一张图上,节点分类(NC)到链接预测(LP)的迁移在“同质性图”上稳定有益;而链接预测到节点分类的迁移则很脆弱,朴素复用表示甚至可能降低准确率,只在“LP 容易但 NC 尚未饱和”的结构主导场景中才可靠为正。迁移方向具有强方向性,并可用简单数据集统计量(尤其是同质性)来预测和规避负迁移。

Same Graph Cross-Task Transfer in GNNs: Protocols and Predictors

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

ROAD 将判别式3D基础模型已有的语义和结构先验迁移到扩散Transformer中,并用互惠目标对齐解决生成/判别潜在空间的异质性,从而以仅 1.5% 的工业基线 Step1X-3D 训练数据达到有竞争力的高保真3D生成性能,显著降低训练成本。

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

ReToken 是一种轻量级可学习嵌入,充当显式检索目标,从预填充的视觉 KV 缓存中选取与查询相关的稀疏视觉 token;在 Visual Haystacks 上使 Qwen3VL-8B 提升 13.4 个百分点、InternVL3.5 提升 12.4 个百分点(相对提升超过 20%),并能零样本迁移到长视频场景,在 LVBench 上为 Qwen3VL…

长视觉上下文是视觉语言模型(VLM)的挑战:随着干扰物数量增加,模型性能下降;同时,在 GPU 内存限制下,一次性处理全部视觉 token 在计算上不可行。ReToken 针对“在长视觉上下文中进行视觉检索”这一问题提出改进。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

在本地计算机使用智能体(CUA)上增加推理时计算往往收益递减,并会改变失败模式;上下文扩展可提升轨迹稳定性但会饱和,时间扩展减少停滞却未必提升任务成功率,结构分解带来规划/格式开销,并行扩展以高计算成本部分缓解失败。

Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

PhiZero 提出一种以“物理语言”(physical language)为核心的物理世界模型:先用紧凑离散的世界状态转移序列显式推理未来演化,再将其渲染为视频,而不是像现有模型那样直接在像素空间预测未来视频。

现有的物理世界模型通常直接在像素空间预测未来视频,底层动力学隐式地存在于高维视觉预测器内部。PhiZero 受人类能够从视觉经验中抽象出预测结构、并用自然语言进行显式推理的能力启发,尝试从在野(in-the-wild)视频中以自监督方式学习“物理语言”,并用它显式推理物理世界如何演化。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

SWE-bench类基准中约13.6%的PR-Issue配对存在错位;本文提出的PAIChecker多智能体系统能在SWE-Gym和SWE-bench Multilingual上分别达到最高92.12%和91.67%的二元准确率,优于四种LLM后端下的现有方法。

SWE-bench类基准广泛用于评估大语言模型(LLM)解决GitHub issue的能力。其常见构建流程是:从PR描述中提取issue引用,将每个PR与其关联issue配对;用issue描述作为问题陈述,用PR补丁作为测试oracle。然而,大型软件仓库的复杂开发与维护过程可能导致这种PR-Issue配对实际并不对齐。本文系统研究了SWE-bench V…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

PAC-MAN 将控制障碍函数与强化学习结合,并引入部署级真实的机载感知约束,使人形机器人仅凭头戴相机提供的分割遮罩深度信息就能完成躲避球任务,在仿真基准上接近“特权状态”性能,并在 Unitree G1 真机上实现零样本迁移,95% 的投掷成功躲过。

本文研究的是人形机器人在动态躲避球场景中的全身安全问题。现有强化学习策略通常假设拥有准确的球状态或特权信息,而真实机器人只能依赖自身传感器。PAC-MAN 的核心问题是:**当控制屏障安全约束与不完美的机载感知耦合时,如何设计训练与部署策略,才能使机器人既安全又敏捷地躲避投掷物?**

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

OSReward 是一个用于评估视觉语言模型(VLM)作为“计算机使用智能体(CUA)轨迹判断器”是否可靠的基准。作者发现,即便是最先进的 VLM 判断器也存在系统性“宽松偏差”,容易把失败轨迹误判为成功;为此,作者构建了开放推理标注语料 OS-Shepherd-100K,并训练出低成本、可靠的开放奖励模型 OS-Shepherd(9B/35B),在成本比…

计算机使用智能体(CUA)在跨平台数字任务中快速进步。判断一个 CUA 轨迹是否完成指令,是 CUA 评估、数据筛选和强化学习的核心。人工编写的验证器和人工标注都难以规模化,因此领域越来越依赖 VLM 作为轨迹判断器。然而,这些 VLM 判断器本身是否足够可靠,一直缺乏系统研究。OSReward 正是针对这一问题提出的标准化评估基准。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

在接近生产环境的 oncall 根因分析(RCA)评测中,五个前沿智能体的最佳准确率在 Medium(真实输入设定)上只有 25.3%,在 Hard 上只有 10.0%;最弱模型会在 40% 的故障报告中提出不合理的幻觉根因。即使 Claude Fable 5 也无法弥合这一差距,说明通用编码智能体距离安全承担生产可靠性值班仍有明显距离。

大语言模型已经能写代码、打补丁、搜索代码,但 oncall 根因分析要求的是另一种能力:从模糊的用户报告出发,在嘈杂的指标、日志、追踪(traces)和源码中进行推理,并且常常要在故障发生数小时后才开始。ORCA-bench 正是为此设计:把通用编码智能体放进生产保真的 oncall 场景,系统测量它们能否完成根因分析。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

β-OPSD 将 vanilla OPSD 重新解释为“策略优化族”中 β=1 的特例,通过可调节的 KL 惩罚权重 β,在参考策略与特权教师之间做几何插值,并用廉价的自蒸馏目标逼近昂贵策略优化问题的解,从而在数学推理基准上比 vanilla OPSD 更稳定、更有效。

在线策略自蒸馏(On-policy Self-Distillation, OPSD)是提升推理语言模型的有前景方法,但在实践中很脆弱,往往需要大量工程调参才能稳定工作。 作者认为这种脆弱性有结构性来源:vanilla OPSD 正好是更广泛的策略优化家族中的 β=1 成员;β 是约束学生靠近参考策略的 KL 惩罚权重。 这一等价关系使 β 从“隐式固定为…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

MixFrag 提出一种基于“量化脆弱性”引导的混合精度训练后量化(PTQ)框架,通过KL散度评估ViT各组件对量化的敏感度,并将比特分配建模为多选择背包问题(MCKP),在目标比特预算下自适应分配层间精度,从而在目标检测等任务上取得超越现有混合精度PTQ方法的效果。

现有ViT的PTQ方法通常对各组件采用统一比特宽度,忽略了不同层/模块对量化误差的异构敏感性,导致精度分配低效。MixFrag 旨在解决该问题:如何为Vision Transformer的不同组件自动分配不同比特宽度,在满足总比特预算的同时最小化量化性能损失。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

本文将单分子化学结构识别(OCSR)和 Markush 结构识别统一建模为“图像到文本翻译”问题,提出 OCSRGlyph 与 MarkushGlyph,并引入一种新的 Markush 结构翻译准确率评估指标。

化学结构在专利和科学文献中通常以图像形式出现。若要用于数据库索引或构建机器学习模型训练集,需要将这些图像转换为线性符号表示(line notation)。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

MANTA 让基于大语言模型的多智能体系统在推理时自适应调整通信拓扑,使“协作架构本身”也能自我改进;在五个基准上平均得分 74.0,比最强基线高 5.8 个百分点。

现有 LLM 多智能体系统通常将通信拓扑视为固定设计或离线优化目标。MANTA 提出在部署过程中根据协作轨迹动态修改智能体角色、通信链接、执行顺序、信息可见性和验证路径,从而将“推理时自我改进”扩展到协作架构层面。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

这篇论文用机器学习方法判断超对称箭图规范理论中的 Seiberg 对偶;在约 10 个箭图节点规模的问题中,Transformer 与多层感知机(MLP)等网络架构倾向于胜过确定性算法,而用成熟寻路算法补充网络后,搜索策略的效率和准确性还能进一步提升。

Learning to Trace Seiberg Dualities

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-30

KAISEN 是一个针对临床风险模型亚组公平性审计的可复现五阶段流水线;通过合成基准压力测试发现,审计结论的可靠性取决于最小可检测效应、缓解方法选择、代理变量是否错设以及队列随机实现,不能只看平均结果或统计显著性。

临床风险模型经常在总体指标上表现良好,却在不同患者亚组之间产生显著不同的错误率。已有研究提出审计流水线来发现这类问题,但这些流水线本身很少被压力测试,因此人们并不清楚审计的哪些部分、在什么条件下可信。KAISEN 把“审计流程本身”作为研究对象,在已知真值(ground truth)的合成数据上评估每个环节何时失效。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条