AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 761-780 条,共 2259 条
第 39 / 113 页
事件日期 2026-08-13

LLM编码智能体的“匹配执行分数”并不能区分命令生成错误与生成后被接口(序列化、包装、重新解析)引入的故障;QuoteBench通过精确最终状态验证测量这一边界,结果显示披露边界后模型恢复能力差异巨大,因此评估应报告完整配置而非只报匹配分数。

QuoteBench: How Matched Scores Can Hide Command-Path Failures

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

PlayWorld 提出用多模态“智能体玩家”(Agent Players)代替固定动作序列,来评测视频世界模型在长时程目标下的表现;实验显示,当前九种先进世界模型在长时程交互目标上仍不可靠,尤其在空间一致性和持久状态演化方面。

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

机器学习决策系统能达到的性能不是由算法复杂度单独决定,而是受制于底层数据生成过程的结构性信息界限;想在预测上突破,必须先有足够好的数据模型。

本文从信息论、交互建模和随机动力学三个视角,审视数据驱动决策系统的内在限制。作者指出,机器学习程序通常用预测准确率和计算效率来评价,但其可实现性能根本上受数据生成过程的结构性质约束,这些约束可形式化为信息界限。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

OmniScientist 是一种端到端、全模态、全学科的 AI 科学家系统,直接从异构原始证据开展多学科研究;在 36 个真实数据案例中全部完成“原始数据 → 可编译论文”的全流程,且直接感知相比“只接收预计算标量特征”的盲变体在 7 个评估维度上均更优、在 85% 的成对比较中胜出。

现有 AI 科学家虽然能自动化越来越完整的科研工作流(假设生成、代码执行、论文写作),但通常只处理文本、代码、标签或预计算摘要,导致对科学发现关键的**空间、时间、跨通道、程序性关系**无法被智能体利用。OmniScientist 旨在解决“工作流覆盖 ≠ 完整证据访问”的问题,让研究直接基于原始多模态证据进行。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

本文提出 ARMDIL(Adaptive Router for Multi-Domain Image classification with LLMs),利用多模态大语言模型(MLLM)作为路由器,为每张图像动态选择最合适的视觉骨干模型,以提升跨数据集、跨域图像分类的鲁棒性与可适应性。

现代图像分类模型在单一任务特定数据集上表现良好,但跨领域、跨难度泛化能力有限。本研究针对这一挑战,提出一个由 MLLM 智能体驱动的异构集成框架,将不同架构的视觉模型组合起来,实现更稳健的跨数据集图像分类。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

本文提出一种不需要选定下游任务或验证集、仅依据预训练轨迹即可衡量单个训练样本影响力的方法,并在 Pythia 与 PolyPythia 的 18 种配置上发现:训练早期文学类数据与最终参数轨迹的对齐更强,后期 STEM 类数据的对齐更强。

在语言模型预训练中,跨时间一致地衡量训练数据影响力很困难。常见做法需要选择一个能代表模型通用能力的下游任务或验证集作为归因目标;同时,依赖中间检查点的任务表现会使不同训练阶段的比较变得复杂。该研究尝试回答:能否不依赖任何下游任务,直接度量训练数据在预训练轨迹中的影响力?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

MARC v1 是一个开源、模型无关的确定性多智能体编排框架,用角色分工和可追踪中间输出替代单体 LLM 提示,面向临床推理,并支持 YAML 配置与 CPU 本地部署。

论文(arXiv:2608.13476v1)提出 Multi-Agent Reasoning and Coordination(MARC),旨在解决临床 AI 推理中单体大模型提示不可解释、故障难以定位、需要手动提示工程等问题。MARC 通过协调抽取、推理、答案生成和评估等角色专门化智能体,显式传递上下文并保留可追踪的中间结果,从而支持分阶段失败归因。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

MapRoute++ 是在 Genμ 2.0 挑战赛 Task 3 中提出的视觉概念遗忘方法。它在 MapRoute 基础上加入任务特定训练目标、更丰富的概念表示和语义路由,在 Stable Diffusion v1.4 的官方基准上以 ERR 指标平均超过当前最优基线 12.1%,同时强调保留无关概念和语义相邻概念。

文本到图像扩散模型在生成时需要移除特定视觉概念(如受版权保护或不当内容),但又要避免破坏模型对其他概念的生成能力。MapRoute++ 针对这一“视觉概念遗忘”问题,作为 Genμ 2.0 挑战赛 Task 3 的参赛方案,提出改进的路线式遗忘框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

在完整自动驾驶软件栈 Autoware 上,LLM 辅助动态分析的主要瓶颈不是候选弱点生成,也不是模糊测试,而是“构建集成”(build integration);研究预算内未动态确认任何候选弱点,观察到的崩溃全部来自桩代码而非 Autoware 本身。(待核实)

自动驾驶车辆依赖庞大的安全关键软件栈,攻击者可控输入可能影响转向、制动或其他控制决策。 静态分析可以找出候选弱点位置,但要动态确认其可利用性,通常需要人工构造可执行测试工件,成本很高。 本研究试图回答:大语言模型能否自动化完成这一过程,具体对象是开源自动驾驶软件栈 Autoware。(待核实)

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

本研究提出一个以美国小学五年级及以下知识为边界的 88B token 预训练语料 LITTLECURRICULUM,并从中训练出 5B 参数模型 LITTLELEARNER,作为研究模型知识获取与能力边界的可控沙盒;初步实验显示,后训练和上下文学习能让模型更好地利用已有知识,但不会让能力扩展到课程范围之外。

研究问题:现代大语言模型在海量异构网络文本上训练,研究者很难判断模型在训练时是否已经接触过某类知识,因此难以研究知识和技能的获取过程。 事件:作者构建了一个课程化、教学可控的预训练语料,并从头训练模型,使训练数据的知识范围可解释、可限定。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

许多临床预测模型把干预后结局视为从基线测量到未来终点的“单步映射”。但实际术后恢复往往是一条不规则轨迹:临床观察、用药调整、再次干预、生理测量等事件异步发生,并可能随时间改变风险判断。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

Intern-S2-Preview 是一个面向科学发现的多模态智能体基础模型系列,通过“科学多模态预训练 + 统一后训练(SFT、多任务RL、智能体RL、蒸馏)”的流水线,在科学、多模态、智能体和通用基准上取得有竞争力或领先的结果;其中 397B 模型引入了从时间序列理解到数值预测的扩展能力,而独立的 4B 记忆解码器扩展可在不修改冻结 397B 骨干的情…

科学发现越来越需要 AI 系统能够对异构模态的科学证据进行推理,与科学工具和环境交互,并在长时间任务跨度中持续推进。为此,研究团队提出 Intern-S2-Preview 系列模型,旨在支持多模态科学理解、推理、生成和长时程任务。该工作来自 arXiv 预印本(arXiv:2608.13505v1),发布于 2026-08-13。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

HumanTracker 是一个专门用于人形机器人运动跟踪评估的基准与指标,其核心是让评估结果更贴近人类在视频中的直观感知,并能捕捉传统运动学指标容易遗漏的接触与稳定性错误。

人形运动跟踪是遥操作和全身模仿学习的关键技术,但现有评估往往与人类在视频中的感知不一致。传统运动学误差只是逐帧姿态差异的平均值,会忽略最影响观感的物理伪影,例如支撑不稳定、脚滑步、触地时机错误等。同时,常用测试集规模小、多样性不足,难以覆盖接触丰富、长时程的行为。为此,研究者提出 HumanTracker 基准和 HumanScore 指标。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

FineX 将细粒度动作线索分解为 RGB 外观、姿态热图几何和骨骼图拓扑三路表征,通过成对交叉注意力与潜空间稀疏专家混合(Sparse MoE)进行融合,在 Gym99、Gym288 和 Diving48 上达到当前最优结果;在长尾分布明显的 Gym288 上,平均类准确率从 68.6% 提升到 76.2%(+7.6 个百分点),且不依赖文本监督或大规模…

细粒度人体动作识别(Fine-grained Human Action Recognition, FHAR)需要区分视觉上相似、但主要差异体现在身体配置、动作节奏或局部外观上的动作。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

将一个可控单量子比特与常规传感器耦合,可在学习经典信号时将所需测量次数指数级减少,并在超导腔-量子比特实验中实现10^7倍测量次数缩减。

量子优势常被认为需要远超当前实验平台的处理能力。 本文研究问题:能否用单个可控量子比特增强常规传感器,以指数级减少学习经典信号所需的测量次数? 回答是肯定的,并给出了理论框架与实验验证。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

多标签 Jaccard 度量(IoU)的精确凸校准需要指数多个预测坐标;如果只要求固定加性遗憾容差,则存在多项式预测维数的凸替代损失。

本文研究多标签分类和二元分割中常用的逐样本 Jaccard 分数(intersection over union, IoU)在凸替代损失下的校准维数。当标签数为 $s$ 时,真实标签组合和预测报告组合各有 $2^s$ 种。在约定 $\mathrm{Jac}(\varnothing,\varnothing)=1$ 下,论文分析 Jaccard 损失矩阵的结构…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

视网膜基础模型的潜在空间可以作为临床可控视网膜图像合成的基质,生成结果能保留临床表型信息;但用真实图像训练的分类器评估时,这些优势消失,存在“合成-真实表征差距”(synthetic-to-real representation gap)。

该研究评估四个视网膜基础模型在“表征 tokenizer 框架”下支持临床可控图像生成的能力,并检验基础模型潜在表征中的人口统计学与临床信息在合成图像生成过程中是否得以保留。可控生成能力此前在医学基础模型领域探索较少。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

从三维平衡密度场可以直接学习经典密度泛函理论中的超额自由能泛函,同时保持空间对称性与变分一致性,且无需自由能或化学势标签;单个学习到的泛函可跨温度、体系尺寸与统计系综迁移,并能复现结构因子、状态方程、液-气共存和界面展宽等非训练目标。

液体的集体行为敏感依赖热力学条件、界面与受限环境,而预测每个新状态通常需要单独的原子模拟。经典密度泛函理论提供了一种可重复使用的变分描述,但其核心超额自由能泛函一般未知;已有的学习近似大多局限于平面或低维情形。本文作者 Bingqing Cheng 展示了直接从全三维平衡密度场学习这一泛函的可行性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

当前主流多模态大语言模型(MLLMs)在基于TikZ代码的科学图表编辑任务上仍不可靠:专有模型平均编译成功率仅约75%,且在图表还原和编辑正确性上表现有限;但通过构建混合训练集并采用“重建—编辑”课程学习,参数量低于9B的紧凑模型(如Qwen3.5-4B)可取得显著提升。

科学图表的代码化编辑比单纯的图形理解或代码生成更具挑战性:模型必须同时恢复视觉结构、定位用户提出的修改请求、生成可编译代码,并保持所有无关内容不变。现有TikZ基准大多集中于图形重建与生成,少有系统评估“指令引导的科学图表编辑”任务。为此,论文提出Edit2TikZ基准,专门衡量模型在给定编辑指令下生成可编译TikZ代码并保持其他内容不变的能力。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条