AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 2181-2200 条,共 2269 条
第 110 / 114 页
事件日期 2026-07-06

待核实(无法从元数据确定结论性内容)。

本文介绍了ICME 2026 Grand Challenge,主题为“Cross-Scenario Defect Detection and Fine-Grained Severity Grading for High-Precision Manufacturing”(高精度制造中的跨场景缺陷检测与细粒度严重程度分级)。待核实具体研究问题与挑战设置。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

本文提出一种无需标注数据的无监督方法,通过拟合孪生验证网络输出距离分布的双峰函数并取两峰之间的极小点作为阈值,在四个数据集上达到平均94%的验证准确率,与依赖标注数据的等错误率方法性能相当。

孪生验证网络(Siamese verification networks)广泛用于人脸、车辆、签名等物品的比对。网络学习一个嵌入空间,使相似对象距离更近、不同对象距离更远;当两个嵌入之间的距离低于预设阈值时,判定二者属于同一类别。然而,阈值设定通常依赖标注数据,且在不同部署环境下可能需要重新调整。本文研究如何在无需标注样本的情况下自动确定最优距离阈值。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

Graph Sparse Sampling (GSS) 通过共享采样未来轨迹的图结构,将树形搜索的指数级地平线依赖降为多项式依赖,在连续控制长时域规划中显著优于传统蒙特卡洛树搜索。

在连续状态/动作空间的马尔可夫决策过程(MDP)中,基于树的在线规划方法(如MCTS)面临“地平线诅咒”:最坏情况下采样预算随规划深度指数增长,且无限分支结构使连续空间下的搜索点选择尤为困难。本文旨在设计一种免分支、可并行、具有理论保证的替代方案。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

待核实。论文提出了一种名为GlaKG的知识图谱框架,以生物标志物为中心,旨在实现可解释的青光眼诊断和风险评估。

青光眼是一种常见的致盲性眼病,早期诊断和风险识别至关重要。现有深度学习模型在青光眼诊断中缺乏可解释性。该研究试图通过构建领域特定的知识图谱(GlaKG),将眼底生物标志物与青光眼诊断关联起来,提供可解释的临床决策支持。待核实具体性能与实验设计。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

基于几何互易定理(Geometric Reciprocity Theorem, GRT),首次实现从单目视频自监督学习立体视频生成,无需立体对或合成数据,显著优于无训练和监督方法。

单目转立体(monocular-to-stereo)从2D视频合成立体内容以提供沉浸式3D体验。现代基于深度图像渲染(Depth-Image-Based Rendering, DIBR)的方法中,立体修复(stereo inpainting of disocclusions)是关键瓶颈。基于训练的方法质量高,但依赖稀缺的立体对或存在域差距的合成数据。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

GaP(Graph-as-Policy)是一种多智能体代码编排框架,通过生成带感知、规划和控制节点的有向计算图,并结合内部仿真迭代优化,使机器人在变体自动化任务上显著超越现有基线方法。

机器人要在商业和工业应用中可靠工作,能否将近期智能体编码系统的进展与可解释机器人编程、无模型策略的开放世界适应性相结合?该研究聚焦“变体自动化”(VA)——一类对象几何形状和位姿变化大于固定自动化的任务。无模型策略在需要持续、可靠执行的VA任务上常难以弥合可靠性差距。受任务与运动规划(TAMP)和机器人操作系统(ROS)启发,提出GaP。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

本文提出了一种测试时迭代优化框架,旨在提升图像生成与参考图像之间的一致性(待核实)。

该论文探讨了如何从传统的“开环”(Open Loop)图像生成方式转向“闭环”(Closed Loop)的测试时迭代优化,以解决生成图像与给定参考图像之间一致性不足的问题(待核实)。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

CamVLA 通过让策略自主推断相机位置(而非被告知),仅依靠单目 RGB 图像和任务指令,即可在训练时未见过的相机视角下稳定执行操作任务,且无需相机外参标定或深度信息。

真实世界中的机器人部署很难保持训练时的相机设置——相机常因实际场景而被重新摆放或安装。现有的视角鲁棒视觉-语言-动作(VLA)策略只在明确提供相机外参的情况下才能容忍相机变化,这使得它们在视角鲁棒性关键时变得脆弱且难以使用。本文认为策略不应被告知相机在哪里,而应自己弄清楚。因此提出了 CamVLA。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

本文提出了一种名为FormalRx的方法,用于在自动形式化过程中修正和检查语义错误,具体效果和结论待核实。

研究问题:自动形式化(autoformalization)中存在的语义失败(semantic failures)问题,如何系统性地修正和检查这些错误。 研究目标:开发FormalRx框架以提高自动形式化的可靠性和准确性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

本文提出 **FORE (Fitted Occupancy-Ratio Evaluation)**,一种不需要 Bellman 完备性假设的离线策略评估方法,仅要求折扣占用率本身的可实现性(realizability),并通过 KL 投影递归达到收敛。

离线强化学习中,占用率(occupancy ratio)用于修正行为策略与目标策略之间的分布偏移,是离策略评估的核心工具。现有的原始-对偶(primal-dual)和极小极大(minimax)方法通常通过在评论家类上强制占用平衡矩来估计这些比率。本文提出一种新的拟合定点方法(FORE),旨在避免传统拟合 Q 评估所需的 Bellman 完备性或投影算子稳定…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

通过直接因果审计,发现归因分数在识别语言模型中因果重要的神经元行方面优于传统基线,但高度秩稳定的选择器可能是因果有效性最低的;拒绝行为存在于冗余子空间,不同归因方法通过不相交的行集安装拒绝。

研究归因分数(attribution scores)能否真实识别出语言模型中因果重要的神经元行(用于剪枝、可解释性、安全编辑)。现有方法缺乏直接因果验证,作者通过两种基于一次性神经元行归零的配对审计来检验。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

待核实。本文提出一种新方法,旨在通过角色感知的联合训练和模态解耦去噪来提高生成视频中的物理一致性(如物体运动、碰撞、重力等物理规律),但具体效果和结论需从原文确认。

待核实。论文针对当前视频生成模型在物理规律模拟上存在的不一致问题(例如物体穿透、运动轨迹不自然),提出一种结合角色(role)感知的联合训练策略和模态解耦去噪框架,以改善视频的物理真实性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

该论文提出一种名为“Elastic Gang”的方法,在大语言模型(LLM)推理场景中实现硬屏障同步组内成员按token动态变更,并与操作系统进程协同调度。**(待核实具体结论)**

研究背景:LLM推理通常采用“组”(gang)调度机制,组内所有线程需同时执行且同步(硬屏障),但在与OS进程共享资源时可能导致效率低下。 核心问题:如何在不破坏硬屏障约束的前提下,允许推理组在每次token生成时动态调整成员组成,从而提升资源利用率或降低延迟? 标题关键词:Elastic Gang(弹性组)、Per-Token Membership Ch…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

该研究尝试区分视觉语言模型(VLM)的错误类型:是模型未能感知到视觉信息(“看不见”)还是缺乏相关知识(“不知道”),但具体结论因缺乏正文内容而待核实。

研究聚焦于视觉语言模型(VLM)在任务中产生错误的原因归因,提出一种诊断框架,用于判断错误是由于视觉感知不足还是知识推理缺陷导致。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

该论文探讨了视觉-语言-行动(VLA)模型在具身推理任务中是否真正“言出必行”(faithfulness),但具体结论因无法获取完整正文而待核实。

研究聚焦于基础模型在具身智能中的应用,尤其是视觉-语言-行动模型。 核心问题:VLA模型在生成语言指令或行动计划时,其内部推理是否忠实于输入的外部世界状态和环境约束?即模型是否真的“说到做到”? 待核实:具体实验设定、评估方法及模型清单。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

待核实。该论文标题表明提出一种名为DiCE-CIR的方法,用于零样本组合图像检索,但具体结论无法从元数据确认。

待核实。根据标题推测研究问题为:如何通过直接组合学习实现高效零样本组合图像检索(Zero-Shot Composed Image Retrieval, CIR)。具体研究背景、任务定义和方法细节需查阅原文。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

Deform360 是目前最大的真实世界可变形物体交互数据集,包含 198 个日常物体、1980 个交互序列和超过 215 小时的观测数据,用于系统评估 2D 像素空间与 3D 几何空间两种世界模型范式的优劣,并为可变形物体机器人规划提供基准。

预测物体动力学(即世界建模)是机器人操作的基本挑战,而可变形物体因其高维状态空间和复杂材料特性尤其困难。现有世界模型分为两种范式:在 2D 像素空间学习动力学,或在更显式的 3D 几何空间学习。但由于缺乏多样、大规模的真实世界数据,对两者相对优势和局限性的系统理解仍然缺乏。为此,研究者构建了 Deform360 数据集。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

该论文提出了一种贝叶斯网络分解方法,支持局部推理与并行推理,具体细节因无法获取原文而待核实。

研究问题:如何将贝叶斯网络分解为可独立进行局部推理和并行推理的子结构,以提高推理效率。 待核实:具体分解策略、算法复杂度及对比基准。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

Cortex 是一个双向对齐的具身智能体框架,通过将操作子任务标准化为 32 种规范技能基元并注入可执行性原理,显著提升了长时域操作任务的性能,并实现了零样本完成未见过的真实世界复杂任务。

当前视觉-语言-动作(VLA)模型在长时域操作任务中表现不佳,因其马尔可夫性质仅依赖当前观测;层次化双系统方法虽能缓解该问题,但存在高层规划语义与底层执行运动学之间的鸿沟。Cortex 旨在通过定制化的规划接口弥合这一鸿沟。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

CompactionRL是一种将上下文压缩融入强化学习的训练策略,能够使长程智能体LLM从压缩后的历史轨迹中学习,在编码任务上显著提升Pass@1指标,并已部署到GLM-5.2模型的训练管线中。

长程智能体LLM在执行任务时,交互轨迹可能超出固定上下文窗口的长度,导致任务无法完成。上下文压缩通过总结之前的交互状态并在压缩后的上下文中继续生成,是一种自然的解决方案。然而,如何将上下文压缩有效整合到强化学习训练中,此前尚未被充分探索。本文提出CompactionRL,旨在解决这一空白。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条