AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1341-1360 条,共 2260 条
第 68 / 113 页
事件日期 2026-07-28

现有最先进的大语言模型(LLM)在充当政治信息中介时,高聚合得分掩盖了系统性失败:它们在信息清晰时表现可靠,但在信息缺失、模糊或矛盾时频繁崩溃,同时会扁平化政治语言强度,且失败可能受政党先验和输出语言影响;目前没有模型能一贯可靠地完成这一中介任务。

随着LLM越来越多地中介公民所依赖的政治信息,缺乏标准化方法来评估其是否负责任地承担这一角色。已有研究将任务视为“信息再现”而非“信息中介”,未涉及认识论维度及与不完美信息的交互。本研究提出Polistemics基准,基于公民认识论能动性推导出的规范标准“Epistemic Modesty”,在可控设置中变化信息的清晰度、噪声和一致性,评估LLM作为选举政…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

Pictura 是一个 GPU 加速的多智能体驾驶仿真器,首次实现了从透视视角图像直接进行大规模自对弈强化学习训练,无需特权观测(如精确位姿、遮挡物位置),所得策略在零样本迁移中超越了使用特权向量的同类模型。

传统驾驶自对弈方法依赖特权向量化观测(如遮挡物的精确位姿和速度),并假定感知已解决,导致部署时摄像头输入与训练时观测之间存在“表征鸿沟”。常见做法是将特权策略蒸馏到摄像头输入的学生网络中,但学生可能模仿其自身视角无法支持的决策。为此,研究者构建了 Pictura 仿真器,该仿真器在每个时间步渲染每个智能体的自车视角图像,从根本上消除表征鸿沟。基于 Pict…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

本文表明,在四旋翼无人机低层控制中,采用物理感知的端到端深度强化学习方法,并显式建模执行器动力学(时间常数 0.076 秒)与转子陀螺耦合,能够实现稳定的悬停与平移控制;SAC 和 TD3 算法在稳定性与探索效率上显著优于 PPO。

四旋翼无人机属于欠驱动系统(4 个控制输入对应 6 个自由度),传统控制方法依赖精确建模,且低层控制中执行器滞后与气动力矩常被忽略。本文旨在探索一种物理感知的端到端深度强化学习(DRL)方法,直接输出总推力与体坐标系扭矩(T,τ_x, τ_y, τ_z),并通过高保真 Simulink 环境闭环训练,以评估不同 DRL 算法在考虑执行器动态后的控制效果。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

Relay-OPD 通过让教师模型在学生犯错时短暂“接力”纠正,解决了在线策略蒸馏中因前缀失败导致后续生成持续偏航的问题,在 1.7B 学生模型上平均比标准 OPD 提升 5.73%,且训练轨迹长度减半。

在线策略蒸馏(OPD)在每一步生成时利用教师模型提供 token 级监督,但存在“前缀失败”缺陷:一旦学生模型走上错误的推理方向,后续所有生成都会基于这个偏差继续,导致监督信号不可靠且浪费计算资源。本文试图在不引入额外标注的前提下,自动检测学生偏离时刻并触发教师干预。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

MODUS 是首个仅解码器的任意到任意(any-to-any)多模态模型,对称处理所有模态,无需特定模态头或损失函数,在多个基准上达到与专业模型和多任务基线相当的竞争力。

任意到任意模型能在一个网络内从任意模态组合预测任意其他模态,已用于多模态视觉与视觉-语言模型,并逐步扩展到生态学、天文学等科学领域。现有任意到任意模型通常从零训练,使用编码器-解码器或扩散架构,这限制了性能且无法利用强大的预训练解码器模型作为先验。本文探索仅解码器的任意到任意多模态建模,试图解决上述局限。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

MemLens 提出一种以内存记录为“一等对象”、通过 Shapley 价值评估和交互式仪表板实现价值感知存储与分层查询的长期内存管理系统,提升 LLM 智能体在长程推理、个性化响应和知识复用中的效率与可解释性。

现有 LLM 智能体的内存管理通常采用粗粒度、忽视效用(utility-agnostic)的方式,将各种用户-LLM 交互记录一视同仁,导致冗余和低影响记录长期占用存储,影响响应质量与推理效率。MemLens 旨在解决这一问题,提供端到端的价值感知内存生命周期管理。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

MDTransformer 首次利用模式分集光学数据流与逆设计的多模耦合器件,在单激光连续波 1550 nm 光源下实现四路并行光子张量核,相比现有光子 Transformer 加速器(PTA)在面积、功耗和能耗上分别降低约 40.4%、63.6% 和 40.6%,且延迟相当,为高性能 Transformer 推理提供了一种更实用的光子计算方案。

现有光子 Transformer 加速器依赖昂贵的多波长光源和基于有源移相器的大尺寸点积单元,导致效率低、成本高、可扩展性差。为克服这一困境,作者提出 **MDTransformer**——一种基于模式分集光数据流与运算的软硬件协同设计,**核心思想**是利用空间模式干涉(而非波长分集)来完成矩阵运算,通过逆设计的多模耦合器、交叉波导和马赫-曾德尔 IQ…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

πR² 通过将条件分为快速本体感觉通道和异步慢速视觉语言通道,并结合延迟自适应的流调度,使基于大模型的动作分块策略(如 GR00T-N1.7)具备实时闭环反应能力,在真实平台上达到约 25Hz 的重新规划频率,显著提升动态操作任务的成功率。

现有的通用操作策略(generalist manipulation policies)越来越多地采用基于大型预训练骨架的动作分块流策略(action-chunking flow policies)。这类策略在执行一个动作分块时运行在开环状态,无法对中途到达的感知输入做出反应,牺牲了反应性(reactivity)。提高重规划频率可以恢复反应性,但感知-动作管…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

本研究提出一种由求解器引导的大语言模型(LLM)框架,用于为多仓库库存分配中的每个实例选择最优的混合整数规划(MIP)公式。在京东的真实数据集上,该方法将Top-1命中率从21.45%提升至50.42%,并将分配精度与事后最优解的差距缩小至4.85个百分点,显著优于固定公式和偏好训练的选择器。

多仓库库存分配问题通常被建模为混合整数规划(MIP),但不存在一个通用的MIP公式能适用于所有决策实例。需求集中度、库存不平衡、补货规模、服务约束和预测波动等因素导致实例层面的异质性问题,使得任何单一公式都无法在所有场景下持续取得最优性能。本文将这一问题形式化为实例级运筹学(OR)公式选择任务:为每个分配实例从候选专家库中分配一个求解器可执行的公式。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

LaP-Forensics 通过冻结的 Stable Diffusion DDIM 反演-重建模型生成残差图,将 RGB 语义与重建一致性证据相结合,在跨生成器检测和伪影定位上达到竞争水平,但自由文本忠实度与后处理鲁棒性仍是开放局限。

近期生成模型能够产生几乎没有明显视觉伪影的图像,削弱了仅依赖表面外观的检测器及其解释能力。作者提出一个多模态框架,利用基于重建的法医证据来增强仅依靠 RGB 外观的检测。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

PRISM‑AH 将视频中的矛盾与犹豫(A/H)建模为随时间展开的多模态冲突,通过轻量流式模型量化跨模态失调、生成“犹豫惊奇”信号并发现行为原型,再经知识引导的大语言模型(LLM)依据专家线索分类学进行推理,在 525 个视频的测试集上达到 Macro F1 0.6133,显著优于零样本基线(0.2827)。

Ambivalence and hesitancy(A/H)是阻碍健康行为改变的矛盾情感状态,其信号源自面部、声音、语言和肢体等模态内部及之间的不一致,且个体差异大,使得视频级别识别极为困难。PRISM‑AH 提出一种两阶段框架:第一阶段使用冻结的视觉、音频和文本编码器对齐到短时间窗口,输入轻量流式模型进行跨模态失调评分、下一窗口预测(暴露犹豫惊奇信号)和…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

指令微调后的 Llama 和 Gemma 模型在与人类对话的相邻轮次中,对上下文无关语法(CFG)规则的复用程度超过了被替换的人类回应,且指令微调增强了这种句法趋同,但同时也带来了对无关句法线索的更高敏感度。

句法趋同(syntactic convergence)是人类对话中普遍存在的无意识语言适应现象。本研究探究大语言模型(LLM)在与人类用户交互时是否表现出类似的行为,以及指令微调如何改变这一倾向。研究者使用替换范式,将模型生成的回复插入真实人类对话中,测量相邻轮次间 CFG 规则的复用程度。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

在理想化AI竞赛实验中,不安全开发行为主要源于落后于对手的竞争压力以及对手的行为动态,而非个体风险偏好;政策应侧重降低竞争压力与促进合作,而非仅关注个人风险。

Falling Behind Drives Unsafe Development in an Idealised AI Race Experiment

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

现有多模态大语言模型在真实临床诊断中的多轮推理能力仍然有限,即使最优模型也仅有极少数案例能完全正确诊断;ClinMM-Bench 是目前规模最大的多轮多模态临床诊断评估基准,揭示了五种典型失败模式。

临床诊断过程涉及多模态信息的逐步披露、诊断假设的动态更新和推理的持续修正,但现有评估通常基于单轮或孤立任务,无法反映真实临床复杂性。为弥合这一差距,研究团队开发了 ClinMM-Bench,用于系统评估多模态大语言模型在多轮、多模态临床诊断中的表现。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

所有评估的九种表格基础模型(TFM)在标签偏移、社会经济偏移和地理偏移三种真实分布偏移下均出现系统性性能下降,无论预训练策略如何,偏移差距在 0.003–0.060 之间;高性能模型还存在显著的可扩展性瓶颈。

表格基础模型(Tabular Foundation Models, TFMs)是表格预测任务的新方法,其预测性能可媲美集成树模型。然而,现有研究大多假设训练和测试数据独立同分布(i.i.d.),真实场景中的分布偏移会破坏模型鲁棒性,且目前缺乏对TFMs在分布偏移下的系统评估。本研究首次对九种TFMs(TabPFNv2、TabPFNv2.5、TabPFNv2…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

向 LLM 提供实时集群服务调用图与工作负载绑定信息(拓扑上下文),可将拓扑依赖型安全补丁的正确率从 11.1% 提升至 78.0%,而拓扑无关补丁不受影响,证明该提升来源于上下文而非通用提示丰富。

现有基于 LLM 的 Kubernetes 安全修复系统孤立处理每个 KSPM 发现,假设通用加固知识足以生成补丁。然而,当补丁需保留运行时服务依赖(如调用边、权限绑定)时,此类系统会生成破坏下游服务的补丁。本文提出 KuTIE(Kubernetes Topology Intelligence Engine),从 Istio 调用边、Trivy KSPM…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

本文提出了一种跨模态不一致检测方法(Kontrast),能够自动识别并分类维基百科文本/表格与Wikidata知识图谱之间的知识冲突、粒度差异、时间变化及知识图谱不完整性,揭示了多模态知识间的互补与校正潜力。

维基百科和Wikidata的知识分散在文本、表格和知识图谱三种模态中,当这些模态对同一事实的表述不一致时,如何自动检测并解释冲突成为关键问题。本文将之定义为“模态级不一致检测”(modality-level inconsistency detection),并构建了相应的分类体系和自动化框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

Desktop-Delta Bench(DDB)是一个针对计算机使用智能体(CUA)的离线步骤级基准测试,旨在评估模型对 GUI 状态转换中因果关系的理解能力。初步实验表明,现有模型在该基准上表现不佳,最优非干扰项和干扰项精确匹配率仅约 65%,且存在系统性错误复制给定顺序的问题。

计算机使用智能体通常通过桌面 GUI 执行长周期任务,但现有基准主要衡量最终任务成功率或单帧定位能力,无法单独评估模型能否重建动作产生后的因果、任务相关状态转换。由于推理、远程输入、应用渲染和截图捕获异步,下一个观测可能延迟、遮挡、短暂或无关,易被误读为进展并带入后续规划中。因此,研究者提出了 Desktop-Delta Bench(DDB),构建了一个包…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

本文提出了一种联邦纵向-生存建模框架,通过客户端可分离的离散时间风险目标,使多个机构在不共享原始传感器数据或个体失效记录的情况下协同训练故障预测模型,并在C-MAPSS涡扇发动机退化数据集上验证其性能接近集中式训练。

传统的故障预测模型(如Cox比例风险模型)依赖于全局风险集的非可分离偏似然,难以在标准联邦学习协议下直接优化。而分布式场景中,传感器轨迹和失效时间记录因隐私或专有限制无法集中存储。本文旨在解决:如何在保护数据隐私的前提下,利用分布在不同组织或站点的纵向监测数据协作训练系统故障预测模型。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条