AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 501-520 条,共 2259 条
第 26 / 113 页
事件日期 2026-08-21

OmniAssistBench 是一个面向全模态大语言模型(Omni-LLM)的助手式交互基准,通过将现有网络视频逆向工程为多轮引导任务,要求模型在动态交互中结合视觉状态、用户目标和先验知识进行实时引导;当前最强的专有模型 Gemini-3-Pro 仅得到 66.4/100,开源模型 Qwen3-Omni-Instruct 得到 51.2/100,说明模型…

传统视频理解评测是被动的、基于静态离线数据集的;但实时视频助手需要主动感知环境、理解用户目标并调用先验知识来提供帮助,而且模型的回答会反过来改变用户接下来的动作,因此静态数据集无法覆盖这种动态性。OmniAssistBench 的提出即是针对这一评测瓶颈。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

前沿大语言模型在心理治疗式对话中表现出“过度使用询问、忽视心理教育、强情境锚定”等可测量模式;将十种治疗动作本体(ontology)作为工具集暴露给模型,可在不微调的情况下显著缩小模型与人类治疗师之间的行为差距。

用户越来越多地使用大语言模型寻求情感支持,但学界对模型如何实际开展心理治疗式互动知之甚少。本文试图回答:模型驱动的会话中,模型采取了哪些“治疗动作”?与人类临床医生相比有何差异?能否在不微调的情况下,通过外部工具暴露来引导模型更接近人类治疗师?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

论文提出一种免训练的“记忆增强压缩”框架:从历史推理轨迹中构建可复用推理记忆,并在 prefill(预填充)侧作为支撑结构,用记忆补偿压缩过程中丢失的信息,从而在缩短生成的同时提升压缩后的思维链准确率,并相对标准 CoT 获得 1.14–1.49× 延迟加速。

大模型常依赖思维链(Chain-of-Thought, CoT)求解复杂任务,但冗长的推理轨迹带来较高推理开销。CoT 压缩可以缩短生成,但过度压缩可能破坏逻辑连贯性、降低性能。论文将这一权衡形式化为 Context-Generation Substitution Law(上下文—生成替代规律):显式推理上下文可以替代一部分解码阶段生成的内容。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

在欧盟《可持续产品生态设计法规》(ESPR)的数字产品护照(DPP)与《通用数据保护条例》(GDPR)的数据保护影响评估(DPIA)等合规文档生成任务中,LLM的表现受法规明确程度和提示上下文影响:较宽松的DPIA格式需要更高上下文的提示才能保持一致性与完整性;较严格的数字电池护照(DBP)格式在不同提示下结果一致,但更容易产生幻觉。

欧盟在可持续发展和隐私监管领域持续处于领先地位,许多新法规要求企业生成特定文档以证明合规。例如,ESPR引入DPP以提升产品生命周期透明度,GDPR要求开展DPIA以缓解隐私风险。然而,生成这些合规文档面临现实困难:工业数据格式异构、分散在公司与供应商系统中,难以直接提取为合规DPP格式;DPIA文档则缺乏标准化格式,且需要跨学科专业知识。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

EnSI-RAG 提出了一种不依赖查询的实体中心索引,将长文档中的证据按“实体-类型-语义类别-值”组织,使检索增强生成(RAG)在跨实体、多跳长文档问答中比既有分块检索方式平均准确率提升 6.62 分(在 Loong 和 Oolong 上的平均准确率为 78.24;具体基线设置待核实)。

长文档问答的挑战在于:相关证据常常分散在多个实体及其关系中;传统 RAG 通常把文档切成原始片段(chunk),靠嵌入相似度检索,当片段边界切断实体与支撑证据、或问题需要跨文档多跳推理时,效果会下降。EnSI-RAG 尝试用实体结构索引来解决这一问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

条件流匹配中的插值调度不必预先固定:通过一次短试运行记录每个时间步的损失难度,把调度设成该难度分布的分位数函数,能自动让模型在速度场最难学的时间段停留更久,且几乎不增加训练开销。

条件流匹配(Conditional Flow Matching, CFM)通过让网络回归一条预设噪声到数据插值路径的速度来训练生成模型。插值调度(interpolation schedule)会显著影响收敛和样本质量,但现有 CFM 通常把它在训练前固定下来,既不依赖数据也不依赖模型。本文观察到回归难度沿路径系统性变化,并提出从模型自身推导调度的方法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

ConceptTS 提出一种用大语言模型(LLM)生成命名概念和自动标注规则的多变量时间序列预测框架,在保持与强黑盒基线相当精度的同时,通过概念瓶颈提供可读、可干预的预测解释。

现有先进的多元时间序列预测模型虽能捕捉复杂的时间依赖和跨变量关系,但其内部表示不透明,从业者难以理解某个预测结果为何产生。这种缺乏可解释性的问题,限制了模型在需要理解并评估预测依据的场景中的应用。本文提出 **ConceptTS**,将预测过程组织为围绕命名且可读的概念,使决策过程显式化。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

CLEAR 通过轻量级隐藏状态门控动态控制安全低秩适配器的激活强度,在冻结主干模型的前提下降低有害回应率,同时减少全局安全调优(如 SFT、标准 LoRA)带来的效用损失。

大型语言模型的安全微调常以提高安全性为代价损害通用能力,因为全局安全调优可能同时改变模型对有害输入和良性输入的反应。CLEAR 以条件式安全适配框架来解决这一安全-效用权衡问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

现有大语言模型(LLM)在专利起草的单个子任务上虽有进展,但在“直接根据早期、非正式、去法律化的发明人披露,生成完整且法律连贯的专利申请”这一现实核心任务上仍明显不足;本文提出 Dis2Pat 数据集与 Patent-MAF 多智能体框架,后者在评测中持续优于开源模型,并与大型闭源模型保持竞争力。

真实专利工作流通常始于发明人撰写的非正式、去法律化披露,而以往研究大多假设输入已经处于后期、高度结构化甚至法律化阶段。 现有 LLM 主要被用于专利起草中的个别任务,缺少对完整申请生成这一核心挑战的系统评测。 为弥合这一差距,作者引入 Dis2Pat(disclosure-to-patent)数据集,要求模型直接从发明人风格的披露生成完整专利申请。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

AUSO 提出一种渐进式、动作级(action-level)的技能学习与利用统一优化方法,让技能先作为可学习知识、再支持能力形成、最终只在能改善单个动作决策时才被调用,从而在 ALFWorld、WebShop 和 SearchQA 上一致提升智能体性能与分布外泛化能力。

论文指出,随着智能体策略演化,技能应当扮演不同角色:先提供可学习知识,再支持能力形成,最后仅在能改进个体决策时被调用。现有方法很少显式建模这一生命周期,通常要么将技能留在模型外部,要么完全内化,要么通过噪声较大的任务级成功率在“内化”和“利用”目标之间做选择。这类设计割裂了训练过程,并给同一轨迹中的所有动作赋予相同重要性,而实际上技能指导可能对部分决策有帮…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

在由“生成—批评—修订”构成的大语言模型自精炼流水线中,模型容量不应均匀分配:更大的生成器与修订器通常带来更好性能,而过小的修订器甚至会损害结果;批评器的规模对整体性能影响极不敏感,但即便使用很小的批评器也比完全跳过批评环节更优。

自精炼(self-refinement)通常被组织为生成(generation)、批评(critique)和修订(revision)三个阶段,是提升大语言模型生成质量的常用范式,也是许多LLM智能体的核心机制。这三个阶段对模型能力的需求并不相同,但现有研究大多把模型规模当作实现细节,较少系统考察模型规模对各阶段效果的影响。本文首次针对自精炼流水线进行分阶段…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

本文提出“解剖感知神经网络”(Anatomy-Informed Neural Networks, AINN):软解剖先验以惩罚项加入损失,硬解剖先验通过架构和状态表示强制实现;并以导丝诱导的主动脉髂动脉变形作为有限数据下的临床测试案例。值得注意的是,本阶段**尚未训练任何神经网络**;运动学、损失与投影模块已验证,力学求解器仅对照自身最优性条件验证,预测位…

深度学习的解剖模型可能出现“数值上看似合理、解剖上不可能”的预测,并且在数据稀缺时泛化性差。本文提出AINN来缓解该问题,并选择了一个有临床意义的有限数据场景:硬质导丝经腔内引入时,主动脉髂动脉树如何变形。摘要称这对当代主动脉外科重要,并与未来自主血管内导航相关。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

据候选摘要,生成式AI反转了机器验证的成本关系——在AI速度下,机器验证不仅经济,而且是生产力必不可少的安全机制。实验中,一名研究员在五周内使用消费级AI订阅,指挥一小队AI智能体从应用代码出发,经过验证的编译器和执行器,最终在社区硅shuttle上实现了一颗RISC-V处理器的流片;全程没有证明经过人工审查,也没有人类编写RTL。(待核实)

传统上,机器验证是持续六十年的主要成本开销,仅用于特殊工件。本文提出,生成式AI将这一关系反转:验证成为“不可腐败的裁判”,使一个人可以安全地大规模指挥自主机器工作。具体研究问题、实验设计待核实。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

AdaptedKG 提出一种不修改推荐骨干模型、只在训练时离线利用知识图谱(KG)关系证据来评估交互“可信度”的行为去噪方法,通过保留/丢弃历史交互和重加权训练损失,在标准序列推荐器及多种行为去噪序列推荐器上取得提升。

序列推荐根据用户历史交互预测下一个物品,但真实日志中混杂持久偏好、临时需求、探索行为和偶发操作,部分交互会扭曲历史表征或提供不可靠监督。已有去噪方法主要依赖共现、顺序或模型预测,缺少物品间关系的显式证据。知识图谱能够提供这类证据,但物品流行度、图度数、覆盖不均和广泛共享实体可能虚增连通性,使可靠性估计产生偏差。AdaptedKG 正是针对这一问题提出校准后…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

在短观测定价面板中,估计误差的变异主要来自“跨设计”成分而非同一价格轨迹内的抽样波动;基线模拟中,梯度提升规格下这一跨设计成分占估计误差方差的97.6%,而仅基于单条已实现轨迹的面板内重抽样无法识别该成分。

短观测定价面板可能包含大量观测,却只提供少量不同的价格变动。论文研究这种“观测多、有效变动少”的稀疏定价机制对统计推断的影响,区分两类不确定性:给定一条已实现价格轨迹条件下的不确定性,以及同一价格过程产生的不同替代轨迹之间估计误差的变异。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-21

在基于视觉语言模型(VLM)的免训练视频异常检测中,把模型生成的文本答案直接当作异常分数会丢失片段间的相对排序;改用答案分布计算概率读出,能在所有测试的基准和指标上稳定提升 AUROC/AP,平均提升 5–13 个百分点。

免训练视频异常检测(VAD)可以通过让 VLM 回答关于视频片段的问题来实现。但 VAD 基准要求为每个片段输出一个标量异常分数,并用 AUROC 或 AP 评估排名质量。论文指出,VLM 检测器必须明确一个“答案接口”:答案尺度决定允许的答案集合,读出规则将模型输出分布映射为分数。这个接口本身会改变被评估的排名,因此属于检测器的一部分,而不是格式细节。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

智谱GLM-5.3 API正式上线,在Artificial Analysis综合智能指数取得60分,与Claude Fable 5、GPT-5.6 Sol同档;模型沿用GLM-5.2基础模型,性能提升主要来自后训练,API定价与5.2不变,权重将于下周五开源。

智谱GLM-5.3 API正式上线,擅长复杂编码、防御性网络安全与长程任务。该模型在Artificial Analysis综合智能指数中取得60分,与Claude Fable 5、GPT-5.6 Sol处于同一档次。模型以更小参数规模、更低调用成本实现同档智能,处于高智能低成本区间。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · benchmark-evaluation
事件日期 2026-08-20

优必选在2026世界机器人大会(WRC 2026)上集中展示工业、商用、家庭消费三大场景的人形机器人产品矩阵,并强调用自研“基座模型—世界模型—行动模型”全栈技术体系支撑规模化落地。材料称2026年是“人形机器人市场化应用的元年”。

2026年8月19日至23日,WRC 2026在北京举行。优必选搭建工业、商用、家庭消费三大沉浸式展区,多款新品集中亮相:

产业观察 · 原始来源:新智元 · ai-industry
事件日期 2026-08-20

根据现有元数据摘要,Stampli 在截止日期固定、设计资源已被其他项目占用的前提下,使用 Codex 和 ChatGPT Work,将原本需要数周的发布会制作压缩至数天,发布工时减少 68%。(细节待核实)

Stampli 面临一个固定期限的发布任务,但设计资源已被调配到其他工作,无法按常规流程推进。该公司使用 Codex 和 ChatGPT Work 来加速发布会制作流程。原始网页正文未能抓取,具体事件背景、项目规模与执行细节待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-20

唐杰认为,讨论模型规模不能只看参数量,还要结合训练数据、算力投向与运行条件;行业曾集中追逐万亿参数模型,事后看是“集体走过又折返的弯路”,后训练是当前提升空间最大的“旋钮”。

智谱首席科学家唐杰在X发文讨论Scaling Law(扩展定律),反思行业对模型参数规模的路径依赖。他指出,模型规模的讨论不能简化为参数数量,需要同时考察训练数据量、算力配置和实际运行条件。行业曾集中投入万亿参数模型,但事后看是“集体走过又折返的弯路”。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
每页 20 条