AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1901-1920 条,共 2269 条
第 96 / 114 页
事件日期 2026-07-13

本文提出了一种基于级联低秩适配(LoRA)的多模态融合框架,通过分阶段集成不同模态来提升医疗培训环境中动作识别的性能,且支持参数高效的扩展。

医疗培训环境(如护理技能训练)中的动作与活动识别通常涉及多种数据模态,但现有融合方法大多假定固定融合结构或需重新训练所有组件。本文旨在解决如何以参数高效的方式、灵活地分阶段集成相关或异构模态,且无需重新训练已学习组件的问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

本文提出一种**无需额外训练**的潜在身份调优方法,通过探索预训练冻结编码器的潜在空间中的语义方向,实现对特定身份的细粒度局部面部编辑,并保持跨图像的身份一致性。

人脸生成和编辑要求极高精度,微小的修改也可能显著改变人物身份感知。当前基于通用文本到图像模型的个性化和编辑方法缺乏细粒度面部编辑所需的精度。本文研究的核心问题是:**如何在不重新训练模型的前提下,实现对特定身份的局部、精细且语义一致的面部编辑**,并保持不同生成图像之间的身份一致性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

本文提出一个以人为中心的人工智能(HCAI)框架,主张在词典编纂中AI应增强而非取代词典编纂者,强调通过高自动化结合有意义的人类控制来保障专业自主性、缓解偏见并围绕编纂者需求设计工具。

生成式AI为词典编纂带来显著机会(如加速词条编写、处理大规模语料),但也引发词典编纂者未来角色、语言及文化多样性保护等担忧。本文以HCAI原则为基础,借鉴其他语言职业中AI整合的经验,系统审视AI如何融入词典编纂工作流。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

LLM 作为裁判时的打分偏差并非仅表现为输入-输出层面的噪声,而是可以在隐藏状态的表征几何中找到低维、类型特异的方向。沿该方向进行因果控制可以双向调节评分偏差,且简单线性投影即可提前预测裁判在未见基准上的失败,性能远超基于文本的替代方法。

Inside the Unfair Judge: A Mechanistic Interpretability Account of LLM-as-Judge Bias

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

本文提出Q-DIBA,首个针对量子神经网络的输入感知动态后门攻击方法,通过联合训练经典触发器生成器与受害者QNN、引入集成密度对比损失,在保持高干净准确率的同时实现高攻击成功率和输入特异性,并能抵抗多种现有防御。

量子神经网络在近期量子设备上的机器学习中具有潜力,但其安全风险尚未充分理解。已有研究表明QNN易受后门攻击,但现有量子后门大多依赖所有中毒输入共享的固定触发器,这种设计易被检测。虽然经典神经网络中已有输入感知动态后门攻击研究,但迁移到QNN面临新障碍:测量将后ansatz量子态压缩为有限经典输出,削弱了对触发器生成器的监督;个体密度矩阵随输入波动,导致逐样…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

RAG 框架会将其检索到的意识形态话语传递到 LLM 生成中,且采样温度显著影响该传递强度:中等温度下话语对齐最高,低温度下由于确定性过强而抑制传递。

尽管 RAG 被广泛用于减少幻觉和增强事实性,但检索材料若包含意识形态立场,RAG 可能在其输出中传递、放大或抑制这些话语。现有研究主要关注检索错误的鲁棒性,而忽视了意识形态偏见的影响。本研究旨在考察 RAG 框架(包含意识形态话语)对 LLM 生成答案的影响,并探究采样温度如何调节这一过程。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

HOCT(高阶细胞追踪Transformer)通过边中心架构和3D几何先验,解决了现有细胞追踪图中因细胞分裂导致的节点嵌入纠缠和边标签随机性问题,在不使用深度预训练图像编码器的情况下,在细胞追踪挑战赛和细菌分裂基准上达到最先进水平,并可在人类在环微调中以仅400个标注实现59%的错误降低。

从活体成像显微镜数据重建细胞谱系,需要在时间维度上关联细胞检测结果,包括追踪细胞分裂过程。现有常用方法构建候选图并在帧间关联细胞分割(节点),但忽视了候选追踪图中的两个结构性障碍:(i)细胞分裂使不同的谱系路径在节点嵌入空间中相互纠缠;(ii)共享同一节点的边具有近乎随机的标签一致性,导致候选图拓扑结构对图神经网络聚合无用。该研究提出了HOCT,一种边中心…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

FactorDiff通过将样本分解为更小的因子(如像素),并动态地将每个因子路由至最相关的预训练专家,在需要逻辑一致性和空间解耦的任务上,持续优于现有的基于全局标量加权的专家组合方法。

离散扩散模型通过组合多个预训练专家(compositional generation)来实现超出单个训练数据的泛化能力。最近的理论工作引入了时间依赖的混合权重,以更好地对齐组合扩散动力学与目标分布。然而,这些方法以整个样本为单位工作,将生成的每个状态视为一个整体,忽略了不同专家在空间或功能上的专长。本研究旨在解决这一根本限制,提出逐因子(factor-wi…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

本文通过引入 C-RASP 构造,首次为 Transformer 模型的学习能力(learnability)提供了初步的样本复杂度(sample complexity)界限,将理论分析从表达性(expressivity)推进到可学习性。

大量已有理论工作通过设计人工权重或计算复杂性论证,刻画了哪些任务在 Transformer 的假设类中、哪些不在,但这些分析局限于模型的表达性,极少研究这些最优解是否可被学习(即从数据中高效获得)。本文致力于弥合这一差距,探索学习 Transformer 构造所需的样本量。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

共享意义依赖于人们对范畴的学习与约定。该研究探讨**智能体记忆特性(适应性与遗忘/记忆退化)如何改变共享意义的出现与演化**。现有概念语义模型缺乏协调游戏机制,无法解释群体中共享意义的形成与变化;而已有的协调游戏均假设玩家在合伙(partnership)设定下共享收益。该工作首次将概念对齐建模为**非合伙(non-partnership)协调游戏**,并通…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

本文提出证据支持的视频问答任务(E-VQA),要求模型联合输出语义答案和准确的时空证据(时间片段+密集跟踪分割掩码),并发布首个经过人工验证的像素级基准 ST-Evidence 及 160k 规模的自动化生成数据集 ST-Evidence-Instruct;微调后的 7B 模型在指标上相比同尺寸 UniPixel 基线提升显著(t-mean +27.2,J…

当前视频大语言模型(Video LLMs)在问答任务上表现优异,但本质上是黑盒——仅输出文本答案,缺乏可验证的视觉依据。已有的可解释性工作依赖文本理由或稀疏的边界框,难以处理遮挡、非刚性变形等复杂视频动态。为解决这一问题,作者提出了 E-VQA 任务,要求模型同时输出语义答案和精确定位到像素级别的时空证据,从而让模型的推理过程变得可验证。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

当前需求工程(RE)实践在获取、规约和验证AI系统的可解释性需求时,存在概念模糊、可测试性差、标准碎片化等跨阶段挑战,系统化支持不足。

可解释性是AI系统(尤其是安全关键和受监管领域)的关键需求。尽管已有框架、模式和用户中心方法,但缺乏对工业环境中现有RE实践如何支持可解释性需求的经验理解。本研究通过戴姆勒卡车公司(Daimler Truck)的案例,探索在需求工程生命周期中如何用已有技术获取、规约和验证可解释性需求。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

Cycle-World 在训练和推理阶段同时引入时间反向预测与循环一致性约束,显著抑制自回归视频生成中的误差漂移,在 60 秒长视频合成中达到领先的生成质量和时间一致性。

自回归扩散模型虽能生成高质量视频,但其序列生成方式固有的误差累积问题导致长时视频中结构崩塌与视觉退化。Cycle-World 旨在解决这一长期视频世界模型中的误差漂移(error drift)难题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

当前最强的多模态大语言模型(MLLM)在单视角视频理解上表现良好,但在体育视频的多视角推理中无法有效利用多视角信息,瓶颈在于细粒度视觉感知与视角选择而非逻辑推理;新提出的智能体框架 SportMV-Agent 通过迭代主动视角选择、感知工具执行和基于证据的推理,相对最强基线提升 14.46%。

体育视频存在密集遮挡、快速运动与复杂交互,单一视角难以完整解析。实际比赛中裁判依赖多个摄像机角度提供的互补证据,但现有基准均未评估 MLLM 在**多视角体育视频理解**上的能力。本研究旨在填补这一空白,并提出能够有效融合多视角信息的智能体方案。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

本文提出了一种针对Mamba系列选择性状态空间模型的精确测量工具,能够离线计算任意子集状态模式剔除后的输出误差,并发现训练好的模型会根据输入动态重分配状态资源——称为“输入驱动迁移”,基于此现象的模式剪枝可在半数状态预算下达到未剪枝模型的性能。

An Exact Instrument for State Usage in Selective State-Space Models, and the Input-Driven Migration It Reveals

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-13

REGRIND 提出一种极简的流水线,仅需单次人类演示,通过将手‑物体运动重目标到保留空间与接触关系的机器人参考,结合残差强化学习仿真训练,即可零样本迁移到真实多指手上执行剪剪刀、拧螺丝等工具操作,产出的策略表现流畅且类人。

近期全身人形控制研究已验证“将人类运动重目标到机器人运动学参考,再通过强化学习训练策略跟踪”这一简单配方有效。但该方法是否能迁移到灵巧操作领域尚不明确,因为操作涉及复杂、富含接触的动力学,需要精细调节接触模式和力。本文提出 REGRIND 流水线探索该问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条