AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 301-320 条,共 2259 条
第 16 / 113 页
事件日期 2026-08-27

仅凭“首次访问帧与返回帧高度相似”并不能证明视频世界模型记住了场景,因为中间的生成过程可能根本没怎么变化。R2M-Bench 通过同一条 rollout 内的相对校准指标(MemoryGain 与 NMR),把“重访特有的记忆一致性”和“普通时间稳定性”区分开来,更可靠地评估交互式视频世界模型的重访记忆。

现有评估常用绝对重访相似度来判断模型是否记住了“离开—返回”场景,但该指标容易受渲染稳定性、重复内容、运动失败等因素干扰:即使模型没有真正记忆场景,只要生成画面变化很小,得分也会很高。R2M-Bench 针对这一混淆提出了一种可观测的“重访选择性一致性”评估方法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

QuantumBoostNet是一种将经典骨干网络与10量子比特参数化量子电路结合的混合架构,在心脏超声视图识别中优于当前最先进的经典和混合经典-量子模型,并在标准图像分类基准上表现出更强的噪声鲁棒性。

心脏超声(超声心动图)视图/角度的准确识别是心血管影像中的关键步骤,直接影响解剖结构解释、测量准确性和临床错误率。尽管计算机视觉已有显著进展,但许多先进模型在标准基准上表现好,在面对医学图像中大量噪声时却欠佳。为此,研究者提出QuantumBoostNet这一混合经典-量子架构,专门针对高噪声医学影像场景下的视图识别进行优化。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

Puro-2B 是一套面向资源受限实验室的开源预训练配方:在消费级 RTX 5090 GPU 上用 FP8 精度从零训练 2B 级模型,最高使用 1.4 万亿 tokens;最佳模型计算成本低于 6.9K 美元,性能接近 Qwen2.5-1.5B。拟合的 Puro 成本缩放定律进一步表明,约 4.4K 美元(<5,090 美元)即可达到 Qwen2-1.5…

大型语言模型预训练长期被认为是“天价”研究,学术和小型开源社区难以参与。论文指出,即便小规模训练,Llama-3.2-3B 也需超过 150 万美元,复现 SmolLM3-3B 需超过 70 万美元。尽管已有开源权重和部分训练配方,但缺乏一套成本高效、硬件可及且完整开源的预训练方案。Puro-2B 报告提出并验证了这样一套配方,将预训练成本压缩到数千美元量…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

仅用心率等端点指标验证相机rPPG是不够的;本研究显示,从接触式PPG到相机rPPG的“可恢复性”是属性特定的,群体层面的统计合理性并不能保证单条记录层面的生理属性得到保留。

相机式远程光电容积描记(rPPG)通常通过端点准确性(如心率误差)进行验证,但端点表现良好并不等于源接触式光电容积描记(PPG)中的其他生理属性在逐条记录上得到保留。本研究评估了从接触式PPG到相机rPPG的属性特定可恢复性,条件是异质的观测环境。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

PES 通过将 LLM 智能体的“人格”(指令、语气、自我呈现)与“执行”分离到不同信任域,使受治理组织中的人格可以自由漂移,同时执行仍保持有状态、可审计和可追溯。

受治理组织中的 LLM 智能体需要同时满足两个需求:人格需要自由演化,执行需要保持可审计的痕迹。论文指出,单一信任域很难低成本地同时满足这两者,因此提出“人格-执行分离”(Persona-Execution Separation, PES)架构模式。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

当前视频生成模型虽然常被称作世界模型,也能生成看似合理的视频,但在“相同初始观测与动作下,多次生成的行为分布是否与真实物理可能性分布一致”上普遍未达标。

视频生成模型正越来越多地被定位为世界模型。 许多物理过程在相同条件下存在多种合法演化方式,因此世界模型不仅应生成一条合理轨迹,还应复现可能行为背后的分布。作者将此称为“概率对齐”(probabilistic alignment)。 现有评测大多只评价单条视频的合理性,不检查重复生成是否恢复正确分布。 核心问题:当前视频生成器距离“概率对齐的世界建模”还有多…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

在碎片化文本复用证据下,将“找回文章级重印/复用”的任务从“片段检索”转为“pair级证据整合”,可生成紧凑、可审计的候选传播关系集合;直接LLM提示配置适合高召回扩展,而规则工作流在精确率-召回率权衡上更强。

该研究面向18世纪苏格兰哲学家David Hume的散文在ECCO书籍与历史报纸中的重印与复用。核心观察是:输入是碎片化的文本复用命中,而不是干净的文档对,且正例覆盖不完整。因此,作者将任务定义为pair级证据整合(pair-level evidence consolidation),即把多条碎片化命中聚合成可能存在的传播关系。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

评估感知(eval-awareness)不应被视为一个单一的、可整体压制的量;当模型在思维链中把“被测试”框定为“测试我的能力”而非“测试我的边界”时,其遵从行为显著更高。安全评估需要区分评估感知的语义类型,而不能只看总体抑制率。

安全评估流程中越来越多地使用引导干预(steering interventions)来抑制评估感知,即模型意识到自己正在被测试。这类做法隐含假设:评估感知是一个可加总、可整体压制的单一量。本文提出相反视角:模型在思维链中表达出的评估感知,可分为能力型(capabilities-flavored,例如“用户正在测试我遵循指令的能力”)、安全型(safety-…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

抵押贷款文档自动化通过智能文档处理(IDP)将非结构化贷款文档转换为可验证、可集成的结构化数据,从而缓解人工处理带来的延迟、低效和合规风险。

本文是 LlamaIndex 博客上的指南文章,讨论抵押贷款文档处理为何复杂,以及如何用智能文档处理技术实现自动化。内容覆盖文档摄入与分类、数据提取与结构化解析、验证与跨文档匹配、人工复核、与贷款发起系统集成,还介绍了 LlamaParse 在其中的应用和最佳实践。

学术前沿 · 原始来源:LlamaIndex 博客 · foundation-model
事件日期 2026-08-27

MAELLE 将化学反应直接建模为电子占据向量上的离散流匹配,在 USPTO-480K 基准上取得与领先反应预测模型相当的表现,并在分布外场景下保持稳健,同时能恢复符合已知化学的机理轨迹并预测副产物。

化学反应本质上是电子空间的重新排布,但大多数机器学习方法要么通过从头生成产物分子来建模,要么在分子拓扑上直接做启发式图编辑。MAELLE 提出另一种路径:在电子占据空间上对反应过程进行离散流匹配,从而绕开分子拓扑编辑,直接刻画电子的重新分布。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

据论文摘要,CAST(Concept-guided Artifact Suppression Tuning)通过稀疏自编码器识别并抑制临床笔记中的格式伪影,在 MIMIC-IV 出院小结死亡风险预测任务上优于微调编码器基线,并与强 LLM 基线竞争力相当,同时提供特征级审计踪迹。(待核实)

临床语言模型在院内数据上可能达到较高准确率,但在部署环境变化时性能下降,原因在于模型会利用笔记特有的伪影——例如模板、分隔符、套话——而这些伪影并不反映真实患者状态。论文提出 CAST 框架,目标是让临床文本分类模型更稳健、可审计。(待核实)

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

对于库存控制、排队网络控制、品类优化这类边界清晰(well-specified)的运筹学问题,最强测试模型 gpt-5.6-sol 在几乎全部评估实例上匹配或优于现有最佳方法;即使在 level 2 设置下——只给定问题类别描述和参数范围、生成固定算法之后再看到评估实例——这一结论依然成立。

本论文(arXiv:2608.27296v1)提出的研究问题是:大型语言模型(LLM)能否为“良好指定”的运筹学问题设计有效算法?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

LeVJEPA 是首个在 LeJEPA 无坍塌目标下训练的视频编码器,完全去除 EMA 目标编码器、stop-gradient 和容量受限预测器等常见启发式部件,仅保留“编码器 + 投影器”结构,并用 SIGReg 正则化以可证明的方式防止表征坍塌,从而在显著降低视频预训练计算成本的同时,匹配或超越现有方法。

视频包含物理世界的时间结构,但从视频中学习表征的计算成本一直很高。现有自监督视频预训练方法要么依赖架构不对称(如指数滑动平均目标编码器、stop-gradient、容量受限预测器)来避免表征坍塌,要么通过像素空间重建掩码内容来规避该问题。LeVJEPA 研究的是:能否在没有这些启发式设计的情况下,仍然高效、可扩展地训练视频编码器。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

本研究基于马萨诸塞州和佐治亚州两个医院系统共 36,807 例符合 Sepsis-3 标准的成人患者(29,116 例与 7,691 例),利用 43 项常规记录的临床变量、72 小时治疗窗口,以死亡作为治疗层级的排序信号而非逐状态目标,学习出一个连续的脓毒症严重程度指数。内部验证显示该指数能区分幸存者与非幸存者,跨机构验证显示其结果具有中等至较好的一致性…

目前使用的脓毒症严重程度指数(如 SOFA 等)依赖数十年前固定的变量和权重,离散化粗糙,且校准队列不能反映当代重症监护实践。目前没有替代方案直接从患者轨迹中学习并投入常规使用。本研究旨在开发并验证一个直接从常规临床数据中学习的连续脓毒症严重程度评分。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

KnockGS 提出从 3D 高斯物体在已知外力作用下的动力学响应中估计其弹性与密度尺度,并将估计值冻结写回同一物理模拟器,使模型在与拟合时不同的交互下仍保持预测能力。这是迈向“渲染外观与模拟响应一致”的交互式 PhysicalGS 系统的第一步。

物理集成的 3D 高斯表示(PhysicalGS)允许重建的可变形物体在显式材料模型下被模拟和渲染。但现有流程通常假设材料参数已知或人工指定,难以从观测到的物体动态中推断参数。KnockGS 的研究问题因此是:能否利用一次已知外力下的交互响应,估计出足以支撑后续模拟的材料标量参数?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

本研究提出 INTENT-AS-A-TOOL 方法,通过给模型增加“意图定向工具”,用工具调用概率作为无裁判、细粒度的信号,来追踪大语言模型在推理过程中产生有害行为的意图倾向,从而补充思维链监控并识别在线干预的关键步骤。

随着大语言模型(LLM)被部署为自主智能体(autonomous agents),安全失败越来越多地涉及有后果的实际行动。该研究关注“智能体错位”(agentic misalignment),即智能体在目标冲突和压力下采取有害行动的情况。研究发现,有害执行往往在思维链(chain-of-thought, CoT)推理中出现先行的意图信号;但事后标注的 Co…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

大型语言模型在表征空间中并没有把道德内容坍缩成一个单一检测器,也没有把不同道德基础彼此隔绝;而是同时存在“共享的正向共同成分”和“近最大数量的独立维度”,形成一种既整合又可区分的道德知识几何结构。

研究问题:LLM 能检测道德内容只是低门槛,它们能否进一步区分不同道德基础,并在表征空间中组织这些基础之间的关系?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

现有大语言模型(LLM)做代码审查时通常被简化为“单轮静态判断”,而本文提出 MCR-Bench,首个面向“缺陷状态感知”的多轮代码审查基准,用 2,269 个真实多轮审查任务评测主流 LLM,发现其整体能力有限、随轮次增加显著下降,且对缺陷类型和严重程度高度敏感。

真实软件开发中的代码审查通常是开发者与审查者之间多轮迭代交互的过程,成本高且耗时。近年虽有工作尝试用 LLM 实现自动化代码审查,但多数方法把代码审查过度简化为单轮、静态的决策任务,无法反映真实审查场景中的多轮交互性和复杂问题求解过程。为此,本文引入 MCR-Bench,试图弥合这一差距。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条