AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 881-900 条,共 2259 条
第 45 / 113 页
事件日期 2026-08-10

论文提出 Latent Dynamics Reasoning(LDR),把视频潜在状态的时间演化建模为显式运动学积分:低阶动力学由数值积分完成,模型只回归三阶及以上残差;在 PhyWorld 白盒物理基准上,LDR 的分布内/分布外误差差距比视频扩散基线小 20 倍以上,论文称其为首个能外推所学动态的视频世界模型。

当前领先的视频扩散模型主要拟合像素,而没有显式建模像素或潜在状态如何随时间变迁,因此能生成视觉上合理的帧,但不一定遵守物理规律。LDR 的动机是从纯像素观测中学习世界动力学,并检验其能否外推到训练分布之外。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

对于一个一般的非负实解析势 \(V\),当大参数 \(\beta\) 趋于极限时,朗之万扩散 \(dX_t = -\beta\nabla V(X_t)dt + \sqrt{2}dB_t\) 若从 \(V\) 的零集出发,会被限制在零集上;其极限动力学可按局部学习系数及其重数对零集分层来描述,并且该演化强烈偏向更高维(原文亦称“更奇异”)的层。这为“随机梯度…

论文背景是过参数化统计模型与深度学习中的“泛化之谜”,尤其涉及 Watanabe 的奇异学习理论。 研究的具体对象是朗之万扩散 \(dX_t = -\beta\nabla V(X_t)dt + \sqrt{2}dB_t\),其中 \(V\) 是一般的非负实解析势,\(\beta\) 很大。 在大 \(\beta\) 极限下,若过程从 \(V\) 的零集出发…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

据论文摘要,Johnson 等人展示了一种自主三杆张拉整体(tensegrity)机器人,能够在遭受极端冲击(包括从 5.7 米高处跌落到沥青路面)后,依然在多种地形上实现稳健移动。该结论仅基于已知元数据,具体实验细节待核实。

研究问题聚焦于:如何让自主机器人在极端冲击下仍保持运动能力?相关成果发表于 Nature Machine Intelligence(2026 年 8 月 10 日在线),作者为 Johnson 等人。摘要显示该研究演示了一种三杆张拉整体机器人,但完整研究背景、问题定义与实验设计尚未获取,待核实。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-10

一篇发表在《自然》上的评论文章认为,如果没有强有力的标准和明智的监督,人工智能可能侵蚀高等教育的基础;文中具体监管建议因正文未抓取,待核实。

本文是一篇观点/评论文章,英文标题为 *I caught my students using AI to cheat in an exam — here’s what universities must do to stamp this out*。根据标题及摘要提示,作者疑似从自己发现学生用AI在考试中作弊的亲身经历切入,讨论大学应如何杜绝此类行为。具体论…

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-10

Nature 于 2026 年 8 月 10 日在线发布了一篇关联网络研讨会的报道,面向招聘经理和求职者,讨论在科学职位申请中如何与何时使用人工智能;具体建议内容待核实。

该材料来自 Nature 的一篇职业类报道(或新闻),标题为 “How and when to use artificial intelligence in your science job application”。其核心议题是:在科学领域的职位申请过程中,AI 工具应被如何使用,以及在哪些环节使用是合适或有效的。文中提到一场网络研讨会(webinar)…

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-10

GENCO(GEometric Neural Corrective Optimizer)是一个统一神经求解器,可在同一架构和共享网络表示下处理潮流(PF)、最优潮流(OPF)和状态估计(SE)三类稳态电网分析任务;在多个基准和真实电网数据上,它相对经典求解器可实现数十倍加速,并配套开源低代码开发框架 GridFM,为“电网基础模型”提供了具体切入点。

基础模型正在改变商业工作流并提升生产力,但在电力系统分析等工程领域仍基本缺席,原因在于这些领域必须强制执行严格的物理一致性。论文提出 GENCO 和 GridFM 开发框架,目标是为大规模稳态输电网分析提供统一的神经求解方案,并降低电力系统工程师使用神经求解器的进入门槛。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

思考模式融合(Thinking Mode Fusion, TMF)中,非思考监督比例增大会降低思考模式的准确率;训练调度可以调节这一权衡,且最优调度取决于数据比例。

研究问题:TMF 将“非思考模式”(简洁回答)与“思考模式”(长形式推理)统一在同一大语言模型中,但其训练动态——尤其是两类模式数据的 **比例** 和 **训练调度**——尚未被充分探索。 本文针对数学问题求解,系统研究了思考与非思考模式之间的数据比例和训练调度对模型性能的影响。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

面向荷兰政府场景的大语言模型评估框架“Grip on LLMs”提出六个评估维度,发现没有任何单一模型在所有维度上表现最优;模型质量越高通常伴随更大的环境与财务成本,而社会偏见与二者基本无关;事实性高并不等于诚实性高。

大语言模型越来越多地被应用于政府机构,但现有评估框架很少同时反映公共行政价值和非英语语言环境的要求。本研究与荷兰一个大型市政组织的领域专家合作,开发了“Grip on LLMs”评估框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

当前文档解析器在通用表格基准上得分很高,但在复杂真实世界表格上明显失效。本文提出诊断基准 TableParseMap 和无需重训练的修正框架 DEC,将冻结解析器的表格 TEDS 平均提升 1.57 点,在大型表格上提升达 5.66 点。

近期文档解析器在 OmniDocBench v1.6 上的表格 TEDS 得分已超过 93,但社区反馈和作者审计发现,这些解析器在复杂真实世界表格上仍持续失败。为量化这一差距,作者引入 TableParseMap:一个包含 916 个真实世界表格的诊断基准,覆盖 5 个挑战场景和 9 种失败类型。被评估的最强解析器在该基准上仅达到 85.03 TEDS,说…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

FinATOM 提出让因果语言模型通过受限 token 生成直接表达股票收益预测与 ETF 配置决策,而不是为不同任务外接回归、排序或策略头;候选摘要报告该方式在 2023–2025 年 ETF 测试和 FinTexTS 上带来夏普比率改善(完整方法与数字待核实)。

传统金融预测通常依赖任务特定的输出头,导致语言模型与最终被评估的数值对象分离。本文研究的问题是:因果语言模型能否通过受限 token 生成,直接表示“预测”和“配置”两类数值决策?为此,FinATOM 引入统一的、无任务专用头的接口,用于三步股票收益预测和动态五 ETF 配置。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

在排序型链接预测公平性评估中,人口统计均等(Δ_DP)可能因为没有考虑链接在排序中的位置而掩盖暴露偏差;排名感知的 NDKL 能发现这类偏差,后处理方法 MORAL 能在效用损失较小的情况下降低这些偏差。

公平排序链接预测常用人口统计均等(demographic parity, Δ_DP)作为公平性指标。 Mattos et al. (2025) 认为,Δ_DP 只关注总体比例,忽略了链接在排序中的位置,因此无法识别“某些子群对链接被系统性地排得更靠后”的暴露偏差。 本研究复现了上述主张,并进一步检验其稳健性:在合成同质性设置、类别型敏感属性、额外公平性指标…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

本文提出一种将能量与动量显式编码进潜状态的能量结构化潜世界模型(ELWM),并借助物理条件神经时间场(PC-NTF)与 Eikonal 方程生成物理一致的导航策略,在运动预测、导航成功率和碰撞率等指标上优于通用潜模型与 Active Neural Time Fields 基线。

物理一致的运动规划要求生成轨迹严格符合真实世界执行动力学。现有潜世界模型虽然可以预测未来表示,但学习到的未来表征无约束,物理规律被隐式吸收而难以复用,导致在开放世界导航中可靠性不足。本文试图回答:如何让潜世界模型显式携带可复用的物理知识,从而在开世界中实现安全、动态可行的运动规划?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

DSLE 是一个将《黑暗之魂:重制版》全部 22 场 Boss 战封装为 Gymnasium 风格接口的容器化学习环境;当前评测中,专家系统和进化基线仅能稳定击败教程 Boss(峰值胜率 63% 与 43%),PPO/DQN 几乎无学习迹象,其余 Boss 均未被任何方法击败。

该工作介绍“Dark Souls Learning Environment (DSLE)”,目标是为游戏智能体提供更接近真实游戏场景的基准测试环境。DSLE 包含《黑暗之魂:重制版》中全部 22 场 Boss 战,通过 Gymnasium 风格接口暴露给智能体,支持高维视觉输入、实时战斗和稀疏的终局奖励。研究问题聚焦于:现有强化学习方法能否在真实商业游戏、…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

本研究提出一种基于腕戴式多模态传感器数据的深度学习融合框架,用于检测和分类身体聚焦重复行为(BFRB),在二分类检测中达到F1分数0.985、AUC 0.997,在九分类方案中宏平均F1为0.700、AUC为0.963,优于单模态基线。

身体聚焦重复行为(如拔毛、抠皮)是与强迫症和焦虑障碍相关的强迫性运动行为。这类动作细微且与普通非病理性手势重叠,早期客观检测困难。本研究利用腕戴设备数据,开发并评估多模态深度学习框架,以实现对这些行为的自动检测与分类。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

Taboo 是一种零提示(zero-prompt)的运行时诊断压力测试,通过动态屏蔽 logit 空间中的高概率候选 token,强制大语言模型偏离其“标准生成路径”,从而评估模型在真实部署约束下的鲁棒性。本结论基于论文摘要元数据,具体机制与数据待核实。

现有大语言模型评估大多在名义条件下进行,基准分数可能造成“能力错觉”:模型只在一条狭窄、高度优化的生成走廊上表现良好。实际部署中,复杂系统提示、安全护栏和结构约束会不断迫使模型偏离这条路径,导致基准分数与部署性能出现分歧。为量化这种“离路径”鲁棒性,论文提出 Decoding-Level Taboo。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

现有基于置信度的无验证器测试时缩放(VF-TTS)方法在复杂任务上会灾难性失效,因为“全程高置信度”往往对应探索不足和自信的错误;本文提出 Consilience 框架,通过显式建模置信度的时间不对称性——惩罚初始高置信、要求最终高确定性——来挑选更稳健的推理轨迹,并在研究生级数学和自由形式代码生成上超过基线。

测试时缩放(Test-Time Scaling)通常依赖外部验证器(如代码中的编译器/测试用例、机器人中的价值函数)来筛选高质量采样。 但很多实际应用没有高质量验证器,因此无验证器测试时缩放(VF-TTS)受到关注。 其中“基于置信度”的 VF-TTS 方法仅用模型置信度对采样轨迹排序,开销小、对模型内部状态访问少,被视为很有前景。 本文指出现有置信度基方…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

CEAA 提出一种模块化、面向实现的认知架构,用于在实时交互式 3D 计算系统中部署具备认知能力的具身智能虚拟代理(IVA),旨在弥合高层智能体推理模型与实时具身执行之间的鸿沟。

论文指出,在实时交互式虚拟环境中开发具备认知能力的具身 IVA 仍然困难。现有架构往往偏向两类:一类是受商业游戏引擎约束的低层反应式控制系统;另一类是难以在虚拟世界中落地的高层推理模型。CEAA 尝试提供一个可复用的实现导向模板,作为部署 IVA“大脑”的参考架构。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

目前的自动化 TTS 评估方法(MOS 预测器与音频大模型裁判)并不能可靠覆盖听者实际感知的多样语言维度:MOS 预测器主要塌缩到声学信号质量,音频大模型裁判则是选择性且依赖提示词的检测,两类方法都难以全面捕捉语言结构性的语音错误。

本文研究问题:自动化 TTS 评估方法(MOS 预测器和 Audio-LLM 裁判)声称反映人类感知,但它们究竟能在多大程度上捕捉听者真实感知的不同语音维度?作者将笼统的“自然度”拆解为一个基于语言学的标注体系,并构建了首个维度级的 TTS 元评估基准。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-10

CEAVAD 将视频异常检测的判断单位从“孤立异常概念”改为“可证伪的事件假设”,通过让“危险解释”与“良性解释”在视频证据面前相互竞争,无需目标域训练即可建立推理时的异常决策边界;在三个广泛使用的 VAD 基准上,该方法达到免训练范式下的最优性能。

视频异常检测(Video Anomaly Detection, VAD)要识别并在时间上定位视频中的异常事件。监督方法需要大量目标域标注数据来学习异常决策边界。已有的免训练方法借助预训练模型的语义知识和推理能力来解读视觉内容,但这些能力本身并不直接给出异常判定标准:模型能生成更丰富的异常描述,可能只是“更像危险”,并不等于判定“是否异常”。因此,核心研究问…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条