AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1201-1220 条,共 2259 条
第 61 / 113 页
事件日期 2026-07-31

RayViT 通过向预训练 ViT 注入以 Plücker 射线图表示的相机几何信息,使视觉模仿学习策略在相机扰动下显著更鲁棒。

视觉模仿学习让机器人直接从图像习得视觉运动技能,但 RGB 观测缺少显式几何线索,导致策略在相机位姿变化时表现脆弱。本文提出 Ray-conditioned Vision Transformer Encoder(RayViT),在预训练 ViT 骨干中注入相机几何信息,以提升对视角扰动的鲁棒性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

QASP 提出一种查询自适应的向量搜索策略:通过一次前馈回归预测每条查询的完整召回进展曲线,再按任意召回目标导出搜索策略,从而在不反复调用模型的情况下降低召回波动和计算成本。

传统向量搜索常使用固定搜索参数,导致不同查询的召回率差异较大;而按平均召回率评估会掩盖这种逐查询差异。QASP 旨在解决“如何在控制计算成本的同时,对每条查询都稳定达到目标召回率”这一核心问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

OASIS 提出了一种面向单张图像手部虚拟化身重建的 3D 高斯泼溅(3D Gaussian Splatting)框架,通过“几何对齐的视觉证据令牌”和“可见性条件点-图像注意力”处理严重自遮挡,并引入“Feature-on-Mesh”表示建模手部非刚性形变,在视觉保真度和效率上优于现有基线,同时支持文本生成化身与纹理编辑等下游应用。

单图 3D 手部化身重建本质上是病态问题:单个视角下视觉证据有限,手部存在严重自遮挡,且高度关节化的手部具有复杂的姿态依赖形变。 现有方法多依赖隐式 NeRF 风格表示,体积拟合计算开销大,且难以保留手部细粒度细节。 OASIS 旨在用 3DGS 实现单图手部化身重建,兼顾质量与效率。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

MOT-SR 是一个面向符号回归的LLM框架,通过外部分析工具提取结构先验,并用动态Pareto前沿进行多目标优化;在40个标准任务和极端质量比旋进(EMRI)轨道建模中,相比现有符号回归方法在准确性、泛化性和效率上表现更优。

符号回归(Symbolic Regression, SR)旨在从观测数据中发现解析方程,是科学建模的核心任务。 现有基于大语言模型(LLM)的方法有两个局限:一是缺乏数据分析机制来揭示变量依赖,导致方程发现效率不高;二是大多只用拟合误差作为单一目标,忽视结构复杂度和泛化性,容易过早收敛到局部最优,限制了对方程空间的探索。 论文提出 MOT-SR(Multi…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

LEMUR 提出了一个无需预定义奖励函数的多目标强化学习框架:它从多个人的偏好反馈中同时学习策略和多个目标各自的奖励模型,从而在竞争性目标之间进行平衡,并在多种基准多目标任务上取得了优于基线方法的表现。

现实世界中的强化学习任务往往涉及多个相互竞争的目标(例如性能与效率),但很难为每个目标都设计一个明确的标量奖励函数。 已有的多目标强化学习(MORL)通常假设每个目标都有可用的奖励函数,这继承了单目标强化学习中的奖励工程难题。 偏好反馈强化学习(PbRL)可以不依赖预定义奖励函数,但大多数研究停留在单目标设定下。 LEMUR 试图弥合这一空白:在多目标任务…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

HierDoc 将多页文档视觉问答中的证据获取建模为“先选页、再从页内选语义区域”的两阶段集合预测,通过在页面与区域两个粒度上分别优化策略,显著优于仅选页面的系统。

多页文档视觉问答需要在页面和区域两级定位稀疏证据。现有方法要么偏重页面选择(区域操作仅作导航),要么假设相关页面已给定而偏重区域选择,导致两个粒度脱节。HierDoc 提出将二者统一为连续的两阶段证据决策。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

GQ-FSL 提出在联邦分割学习中同时引入随机量化与不对称精度配置,在满足目标精度的前提下最小化系统总能耗,论文声称其能效优于量化联邦学习和全精度联邦分割学习。

在无线边缘部署先进深度神经网络(DNN)时,移动设备的能量和资源限制是严重瓶颈。联邦分割学习(FSL)通过将部分计算负载卸载到边缘服务器来缓解设备的计算压力,但设备与服务器之间持续交换切分层数据和子模型,仍会带来可观的能量消耗。GQ-FSL 旨在解决这一通信与能耗瓶颈,并系统刻画精度、能耗与全局收敛之间的权衡。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

FriendBench 论文摘要指出:在从 20 秒双人对话片段推断“熟人还是陌生人”的任务上,最佳多模态大模型与人类总体的准确率在每种模态下统计上不可区分;但人类在两个答案类别上保持均衡,而最强模型系统性地倾向于回答“陌生人”——这被归因于有效先验的差异,而非判别能力的高低。

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

本文提出一种“冻结—然后选择”(freeze-then-select)的偏微分方程(PDE)发现策略:先用结构化场适配器从稀疏观测中重构连续场,再在冻结场后通过稳定性验证弱选择(SVWS)选出正确的微分项;在六个稀疏 MDBench 场景中,该方法取得了最高的精确支持恢复率。

从稀疏观测中发现 PDE,需要同时完成两件事:重构连续场,以及从候选微分项中选出正确的项。作者分析了耦合神经 PDE 发现中的优化路径,发现存在三种行为:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

FlexComposer 将生成式视频合成统一为“轨迹引导的条件生成”任务,在不依赖显式 3D 重建或额外可学习适配器的前提下,同时支持静态图像和预动画动态素材的插入,并在视觉质量、时间一致性和轨迹遵循度上声称超越现有方法。

生成式视频合成(generative video compositing)指将外部资产无缝插入现有视频序列中,是内容创作和视觉特效的重要环节。现有方法存在“控制—保真度”权衡:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

FibVLA 通过对数回溯采样与斐波那契递归推理相结合的方式,在不重新训练大规模视觉编码器的前提下,实现兼顾长上下文时序感知与推理效率的视觉-语言-动作模型,实验显示可提升动作平滑度、成功率及实时响应性(具体数值与实验细节待核实)。

视觉-语言-动作模型(VLA)利用多模态认知推理物理世界动作,是具身智能的通用解决方案。 传统 VLA 主要聚焦当前数字认知,虽然已有工作通过捕获时序信息增强推理能力,但编码长上下文历史会导致效率下降。 FibVLA 旨在解决“捕获时序信息”与“保持推理效率”之间的矛盾。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

ExtractBench 是目前已知首个同时评估“值准确率、大规模记录完整性、证据溯源性和实测成本”的 schema-guided extraction(模式引导抽取)基准;在该基准上,LlamaExtract Agentic Plus 在全部三项指标上排名第一,准确率与 coding agents 相当,但成本大幅更低。

企业工作流越来越多地依赖 agent 完成**模式引导抽取**:给定一份文档和用户自定义 schema,agent 需要忠实遵循 schema,生成正确输出,并附带源证据作为 grounding 元数据。但已有评测缺乏同时覆盖抽取准确性、记录完整性、grounding 和成本的标准。ExtractBench 提出并落地了这一评测框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

在AI生成图像检测中,热力图作为证据需要经过因果检验;该研究显示,压缩历史而非合成本身主导朴素评估,并且通过“检测器盲对照”仍不等于获得忠实解释——作者明确表示没有展示出任何忠实解释。

市场评论照片是平台退款依据,而生成模型将伪造一张“证据照片”的成本降到了接近零。因此,平台需要检测AI生成图像,并让检测结果附带可理解的证据(热力图)。本文围绕两个问题:检测器本身有多可靠?归因热力图是否真正提供了可靠证据?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

在迭代学习模型中,当不同意义的出现频率不均匀时,高频意义可以像自然语言中观察到的那样“逃脱”统辖低频意义的语法压力;但如果频率结构施加在意义的部分组件而非整体意义向量上,语言将无法跨代稳定传递。

本文研究语言演化中的组合性(compositionality)如何受意义频率分布的影响。此前迭代学习模型的关键发现是:语言经过一代代学习者的“学习瓶颈”被反复传递后,组合性会自发涌现。本文进一步追问:当某些意义比其他意义频繁得多时,这种组合性会如何改变?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

DynoDINO 针对多相增强CT(CECT)病灶分割提出统一框架:先进行切片级对齐,再用多相融合模型增强跨相位时序相关性,并在 LiTS、PLC-CECT、WAW-TACE 等数据集上改善边界勾画与结构保真度(具体量化指标待核实)。

多相增强CT(CECT)通过多个采集阶段捕捉病灶随时间变化的增强模式,是局灶性病变诊断的重要依据。但造影剂增强动力学信息分布在不同相位,且解剖结构不一致、呼吸运动、采集不完整会造成相位间错位或时序信息中断。传统分割框架通常逐相位独立处理,或只做简单融合,时序推理能力有限。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

DungeonBench 是一个面向《龙与地下城》战斗场景的规则密集战术推理基准,目前前沿语言模型策略在单场遭遇战中常能获胜,但在跨遭遇战的连续“一日”场景中暴露出资源预算、休息时机和规则意识上的明显不足。

现有游戏与模拟器基准虽然能把决策转化为可测量的结果,但许多基准对“规则密集的战术推理”测试不足。DungeonBench 专门考察模型在几何、时机、资源、目标与规则交互同时起作用时能否做出高质量选择。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

本文首次系统研究严格差分隐私约束下的多变量密度模态恢复问题,提出均值漂移启发的DP-GRAMS方法,并证明其模态估计误差在极小极大意义下接近最优(仅差对数因子)。

密度模态(density modes)是对多峰分布的局部化、可解释的概括,但现有估计方法缺乏严格的差分隐私保障。本文研究在局部光滑性、曲率和分离条件下,如何从私有数据中高概率恢复多变量分布的所有总体模态,并给出可推广到回归与聚类的隐私模态学习方法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

FDD-ON 是一个模块化、可扩展的本体,用于形式化表示变风量(VAV)暖通空调(HVAC)系统的组件、故障类型、症状状态、故障影响及相关属性;论文称,在公开 VAV HVAC 系统数据集上的评估表明,它能作为可扩展、透明、可互操作的故障检测与诊断(FDD)解决方案的语义基础。

该研究针对暖通空调系统故障检测与诊断(FDD)技术部署中领域知识结构缺失的问题。FDD 对提升系统可靠性、能效和维护有效性至关重要,但实际部署需要结构化领域知识来桥接异构数据源、多样设备类型和不同诊断输出。当前 FDD 领域存在数据可解释性与互操作性不足,形成信息孤岛,阻碍了数字孪生 FDD 框架和 AI 驱动的维护决策系统等应用。为此,论文提出 FDD…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

在由随机微分方程(SDE)描述的扩散环境多臂老虎机问题中,采用 logit 参数化的策略梯度更新,在任意常数学习率下几乎必然收敛到最优臂;当常数学习率低于某个与时间无关的阈值时,非渐近遗憾上界为 $O(\log T)$。

该研究面向连续时间强化学习框架下的多臂老虎机问题,环境由扩散过程(SDE)刻画。核心问题是:策略梯度算法在此类扩散环境中能否收敛到最优臂,以及其累积遗憾如何受学习率和环境参数影响。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-31

CoDe-SSM 通过将聚合上下文与聚类残差显式解耦,在超高清(UHD)图像恢复中兼顾跨区域上下文共享与局部细节保持,在五个 UHD 基准和五种退化类型上取得质量提升,同时保持理想效率(具体性能数据待核实)。

UHD 图像恢复需要平衡两类信息:空间上反复出现的退化线索(可聚合共享)与局部化的精细结构(如边缘、纹理,不能被共享聚合充分表达)。现有方法常用下采样、窗口划分或聚类 token 剪枝来控制高分辨率带来的计算成本,但大多没有显式保留那些难以被共享聚合表征的细节。该论文提出 CoDe-SSM,用两条独立通路分别处理聚合上下文和聚类残差,以解决上述问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条