AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1621-1640 条,共 2269 条
第 82 / 114 页
事件日期 2026-07-21

本研究通过极简设计(IMLE目标 + 中等规模卷积网络)挑战了“多步迭代去噪”的必要性,实现了单步生成模型(ROMS-IMLE),在ImageNet 256×256上达到FID 2.56,同时保持高精度与召回率。

**背景**:生成模型从VAE/GAN发展到扩散模型与流匹配,技术日益复杂。业界普遍认为“将噪声分布通过多个小变换逐步转化为数据分布”是高性能的关键。 **核心问题**:该多步变换是否真正必要?能否用极简的单一训练目标和简单模型实现竞争性生成? **方法**:从“裸机”出发,仅保留训练目标(IMLE)和模型(卷积网络),刻意避免变分推理、对抗训练、数值积分…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

该博士论文构建了统一黎曼深度学习框架,从可复用神经模块、流形特定网络架构和底层几何设计三个互补角度,将批量归一化、多项逻辑回归等核心组件推广到李群、陀螺群、SPD流形等一般黎曼流形,并引入可学习的高效黎曼度量,实验验证在视觉、信号处理、图学习和基因组学中有效。

黎曼深度学习(将深度神经网络扩展到流形值表示)近年备受关注,但许多基础组件仍局限于特定流形、依赖欧几里得近似,或需要昂贵且数值不稳定的几何操作。该论文旨在解决这些痛点,提出了一个统一的理论与实现框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

本文提出一种基于浅层循环解码器网络的降阶建模方法(SHRED-ROM),仅利用少量传感器读数即可实现对高维参数化动力系统的实时闭环最优控制,并在三个高维案例中验证了有效性。

传统最优控制方法要求对多种场景进行多次系统仿真,而高维时空动力学导致计算开销巨大,难以满足实时控制需求。本文研究如何在有限传感器数据下,通过降阶模型实现快速、自适应的闭环控制。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

本文提出PDDIM算法,通过对标准DDIM更新进行轻量坐标方向修改,显式融入测量模型,在理论上证明其能收敛到给定测量的贝叶斯后验,并在图像恢复任务上取得优于现有扩散后验采样器的性能。

扩散模型在逆问题求解中取得了显著的实证成功,但现有的后验采样器要么缺乏严格的理论保证,要么计算开销巨大。本文针对线性逆问题(如去噪、超分辨率、修补等),提出一种简单高效的算法PDDIM,旨在结合计算效率与理论可证明性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

OmniReasoner 是一个针对全模态大语言模型(omnimodal LLM)的后训练框架,让模型学会在回答前自主决定是否调用“缩放”(zoom-in)工具对长音频-视频中的关键时间段进行高保真度检查,从而在降低计算成本的同时提升答案准确性和时间定位能力。

长音频-视频推理对全模态大语言模型而言非常困难,因为决定性证据往往稀疏、跨模态,且在全流上保持统一高保真度输入的代价过高。现有方法要么对所有帧均匀处理(浪费计算资源),要么无法灵活聚焦于关键片段。OmniReasoner 旨在让模型通过工具调用(tool-use)来动态选择高保真度区域,实现“先全局预览,再局部放大”的推理策略。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

Off-Context GRPO(OC-GRPO)通过在训练时向模型提供解答前缀等特权指导来生成“异上下文”轨迹,并利用重要性校正避免分布偏移,在数学推理基准上平均取得3.9%的绝对提升(13.8%相对提升),且几乎不增加额外成本。

**问题背景**:使用可验证奖励的强化学习(RLVR)能提升大语言模型的推理能力,但在困难问题上,当模型无法生成任何正确解时,获得的奖励全为零,导致学习信号缺失(“学习悬崖”)。 **核心思路**:在训练阶段,向模型提供特权信息(如部分解答前缀),引导模型生成正确解并获得非零奖励。这类轨迹称为“异上下文”(off-context)rollout,因为其生成…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

通过测试时多次推理与自纠正,无需额外训练即可显著提升视觉语言模型(VLM)在无人机导航任务中的轨迹规划安全性与准确性,达到当前最优(SOTA)性能(待核实具体指标)。

传统无人机视觉语言导航(VLN)方法依赖单次推理生成轨迹,在复杂环境中容易产生次优或危险路径。本文探索了一种简单有效的测试时缩放方法:在不改变底层模型的前提下,通过迭代精炼过程让冻结的VLM自我纠正初始计划,从而提升导航鲁棒性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

Masked Visual Actions (MVA) 提出一种像素空间控制接口,通过部分显示视频中任意实体的轨迹来表达机器人动作或期望物体运动,使同一个视频模型既能正向预测物理响应,也能逆向恢复机器人行为;仅用 15 小时掩码示例微调即可在多种场景和多种具身形态上实现高视觉保真度和可控性。

Masked Visual Actions for Unified World Modeling

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

不完美的LLM检测器可能反直觉地导致人类增加LLM使用量,甚至降低输出质量;检测到的属性(如语言模式)则呈现“先升后降”的清晰规律。

随着LLM被广泛采用,检测LLM生成内容(如通过检测工具或基于语言模式的启发式方法)的兴趣日益增长。然而,检测器作为一项干预措施,不仅影响被检测的属性本身,还会影响下游指标(如LLM使用量和输出质量)。本研究展示了不完美的LLM检测器如何通过扭曲用户激励(即用户策略性地选择如何使用LLM以及如何后处理内容以减少检测到的属性),对下游指标产生反直觉的影响。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

InstructMixup 是一种**仅在单个样本内部**进行数据增强的方法——通过指令引导生成模型编辑显著补丁并注入分形结构,在不跨样本混合的前提下构造具有挑战性且标签一致的训练样本,在多个视觉骨干和基准上全面超越现有混合方法。

**背景**:基于混合(mixup)的数据增强是当前视觉模型提升泛化性的主流方法,但计算信息性混合区域开销大,且不同图像内容的混合常破坏语义完整性。 **问题**:能否在设计数据增强时避免跨样本混合,同时保留混合策略的挑战性与多样性? **本文方案**:InstructMixup 所有操作限制在单个样本内:先提取多尺度显著补丁,再用指令引导生成模型编辑该补…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

本文提出一种名为GUIDED(Geometrically Unconstrained Inductive Demand EmbeDding)的网络无关初始化层,通过将出行需求作为标量属性注入辅助虚拟链路,有效解决了图神经网络(GNN)在交通分配问题中因空间拓扑绑定而无法跨城市迁移的难题,并在单网络任务上保持最先进精度,在跨网络迁移和少数据场景下显著优于基线。

**研究问题**:交通分配问题(Traffic Assignment Problem)是交通规划的核心但计算成本高昂的环节。基于GNN的数据驱动替代模型虽然速度快,但存在严重的空间泛化差距:标准模型采用直推式(transductive)特征初始化,将出行需求绑定在固定网络拓扑上,从而阻碍了模型向新城市环境无缝迁移。 **核心挑战**:如何设计一种与网络无关…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

随着企业级 AI 系统从单次问答转向长时间运行、有状态的多步骤流程,需要一种显式的工作流抽象。本文不将 LangGraph 视为模型质量基准对比目标,而是作为低层次编排框架,回答“何时以及如何使用图式工作流路径”来解决真实业务问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

本文证明:在特定高斯设定下,仅用 \(O(\log K)\) 个简单超平面二分类器即可组合成 \(K\) 类分类器,并给出了该范式下分类性能的严格理论界限,仿真结果与理论一致。

Fundamental limits of distributed multiclass classification from simple binary decisions

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

本文提出将建图与运动规划联合围绕有符号距离函数(SDF)进行协同设计,通过Octree REsidual Network(OREN)实时重建SDF,并搭配基于距离的Bubble$^\star$搜索规划器,实现无人机在杂乱环境中的自主飞行,SDF估计精度提升22%,运动规划速度相比基线快3-10倍。

传统方法将建图与运动规划视为独立阶段,碰撞检测常依赖二元占用信息。作者认为两个阶段应围绕单一表示——有符号距离函数(SDF)进行协同设计。SDF编码到最近障碍物的距离,为规划和轨迹优化提供比占用信息更丰富的线索。如何在机载低算力条件下实现实时SDF建图并结合距离信息加速运动规划是核心问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

ExpertVerse 是一个以能力为中心的基准,用于评估多模态生成模型在知识密集型视觉合成中的专家级推理能力,发现当前主流模型存在严重的推理缺陷。

近年来,基于指令的图像生成已从语义操作迈向知识驱动的视觉推理。然而,现有方法主要依赖显式常识推理、浅层因果理解和直接知识回忆,在知识密集型生成任务(如需要特定学科专业知识的图像编辑/合成)中表现不佳。为此,研究者构建了 ExpertVerse 基准,并配套提出了 KnowThinker 推理引擎和 BPPO 优化方法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

论文提出一种无需标签、仅需单次前向传播的视觉丰富度度量指标——有效秩(ERank),该指标与人类复杂度判断高度相关(r=0.72),并能指导特定任务的数据筛选:去掉低ERank样本提升超分辨率,去掉高ERank样本提升OCR。

如何在不依赖人工标注的条件下,快速、定量地评估单张图像的视觉复杂度或丰富度?现有方法要么需要标签,要么计算成本高。论文从深度学习特征图的通道协方差矩阵出发,定义有效秩作为每张图像的“激活通道方向数”,试图用一个标量刻画图像的丰富程度。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

CodeRescue 提出一种预算校准的恢复路由方法,通过在编程智能体失败后利用执行反馈决定是继续使用廉价模型还是升级到昂贵模型,并借助保形风险控制层在不同预算下自动调整决策,无需重新训练即可控制期望成本。

编程智能体通常会在可执行环境中运行,一次失败的尝试会产生可操作的反馈,而不仅仅是错误答案。现有成本感知系统多采用级联决策:先用廉价模型,失败后再升级到更强(更贵)的模型。但在编码场景中,执行反馈可能使继续使用廉价模型进行恢复依然有价值。因此需要回答一个预算约束下的部署问题:何时应该让智能体花费更多廉价计算资源,何时应该立即升级?本文将失败后的决策形式化为异…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-21

CircuitKIT 是一个开源的 Python 库,通过统一的类型化可序列化表示,将电路分析中的发现、评估与下游干预(剪枝、编辑、引导、选择性微调)全流程连接起来,旨在降低该领域工具碎片化带来的比较与应用门槛。

当前,对神经网络进行电路分析(circuit analysis)虽能支撑模型解释与下游干预,但研究人员需手动拼接多个独立实现来完成任务,且许多发现方法需要手工编写对比提示(contrastive prompts)。这种碎片化的现状使得不同方法难以比较,也限制了电路分析在经典任务之外的应用。为此,作者团队推出了 CircuitKIT,一个源代码可用的工具包,…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条