AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 2161-2180 条,共 2269 条
第 109 / 114 页
事件日期 2026-07-06

SynCity 3000 提出通过微调图像到3D生成器,使其作为卷积算子应用于整个场景的等轴测图,从而生成任意大小、全局一致且可精细控制布局的3D场景。

现有图像到3D生成器能够从单张图像生成复杂3D资产,但扩展到整个场景时面临数据稀缺(真实的3D场景训练数据不足)以及难以保持全局一致性与细粒度布局控制的问题。SynCity 3000 旨在解决这些挑战,实现场景级3D生成。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

通过控制扩散U-Net中的捷径路径和早期噪声暴露,可以将训练导向“解缠优先”的优化轨迹,从而在保持图像质量的同时获得更优的潜在表示;提出的SteeringDRL方法在多个解缠基准上提升了表示质量并降低了种子敏感性。

扩散自编码器在不同训练中可能学到截然不同的潜在结构,但生成图像质量却相近。本文探究这一现象背后的优化动力学,发现训练早期存在两种不同轨迹:**重建优先**(早期注重图像保真度)和**解缠优先**(逐步提升重建与解缠)。研究旨在揭示如何主动调控训练轨迹,使模型朝着更强表示能力的方向优化。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

现有的流式语音到语音语言模型在信号质量和自动语音识别(ASR)误差上表现良好,但在响应延迟、话语重叠、方言保留、情感适应以及人际立场动态等方面仍与人类对话行为存在差距;SPEARBench 提供了一个多维度的基准来系统评估这些自然度缺失。

流式语音到语音语言模型旨在用合成语音直接回答语音查询。然而,标准的语音和文本基准无法评估这些系统在对话中的自然度,包括时机、话轮转换、韵律、人际立场、语言与方言一致性以及关系感知的恰当性。为此,研究者提出了 SPEARBench,一个从问答交互中评估语音到语音语言模型自然度的基准。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

SovereignPA-Bench 是一个用于评估用户拥有的个人代理(Personal Agent)在演化意图、平台中介和同意约束下是否保持“用户主权”的可执行基准,实验表明“完全主权脚手架”策略在主权评分、隐私泄露、同意违反、过度让步和操纵捕获等指标上均优于现有基线。

个人代理正成为持久的用户拥有的中介:它们记忆偏好、过滤平台中介信息、使用工具并与服务协商。现有基准评估工具使用、网页导航、桌面控制、个性化、推荐和演化上下文,但很少问及代理是否维护用户主权——即推进用户当前利益的同时尊重隐私、同意、证据、用户负担,并且抵抗操纵性激励。本研究引入 SovereignPA-Bench,专门填补这一评估缺口。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

现有大语言模型多比特水印方法无法选择性地披露信息,本文提出的层次化词汇路由(HeRo)框架首次实现了细粒度的访问控制,允许不同验证者仅解码与其权限对应的水印部分,同时保持文本质量和高检测精度。

大语言模型生成文本的水印技术可分为两类:零比特方案(区分机器生成与人类写作)和多比特方案(嵌入元数据)。现有多比特方案的一个关键缺陷是不支持选择性披露——验证水印的任何部分都必须揭示整个嵌入信息,导致不必要的隐私泄露。作者针对此问题提出了HeRo框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

该论文提出名为 Retroactive Chain-of-Thought (RetroCoT) 的方法,利用法医重构式提示对基础模型进行安全诊断,并声称该方法可跨模型世代使用。具体结论和效果待核实。

论文关注基础模型(Foundation Model)的**安全性诊断**问题,尝试通过“事后思维链”(Retroactive Chain-of-Thought)重构推理过程,以检测模型在不同世代版本中可能存在的安全漏洞。详细研究动机与具体问题定义待核实。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

REDDIT是一种轻量级后训练框架,能有效纠正自回归ASR系统在长非语音段上的时间戳漂移,且不会导致灾难性遗忘,在Whisper-tiny上仅更新1.6%参数便大幅提升时间对齐精度。

现代自回归ASR系统可以解码输出时间戳令牌,无需帧级对齐器或推理后处理即可获得带时间戳的转录。然而研究发现在长非语音段(间隔)中,模型生成的时间戳会发生漂移:转录文本可能依然合理,但解码出的时间轴逐渐偏离真实音频。该问题在15个时间戳生成ASR和音频语言系统上均有体现。简单的时间戳纠正微调虽能改善对齐,但会严重破坏其他ASR行为(如词错误率剧增),暴露出灾…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

ReCal3R是一种无需重新训练即可应用于已有模型(如CUT3R)的校准规则,通过评估场景状态中每个token的可靠性来调整学习率,从而在长序列流式3D重建中显著降低姿态误差(ATE降低3.7倍),同时保持相近的运行时间和内存消耗。

流式3D重建依赖紧凑的循环场景状态(recurrent scene state)以线性时间和有限内存处理长图像序列。然而,重复更新会逐渐腐蚀该状态,导致可靠的历史信息被噪声或模糊的观测所覆盖。如何在不破坏已有信息的前提下,高效地融合新观测是核心挑战。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

PixWorld 通过将三维重建与生成统一到像素空间扩散范式中,消除了潜在空间方法的信息损失与对预训练自编码器的依赖,在生成任务上超越此前潜在空间方法,在重建任务上达到当前最优水平。

传统上三维重建采用基于像素的回归(回归像素值),三维生成采用潜在扩散模型(在潜在特征上做扩散)。近年虽有工作尝试在潜在空间统一二者,但存在根本缺陷:扩散目标定义在潜在特征而非底层三维表示上;潜在编码引入信息损失;且必须依赖预训练的变分自编码器(VAE)或表示自编码器(RAE)。为此本文提出在像素空间统一两类任务的范式,并设计单模型 PixWorld 同时处…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

本文提出了一种名为PAST-TIDE的立场检测方法,该方法通过原型锚定(Prototype-Anchored)语句微调与话题不变归一化(Topic-Invariant Normalization)来提升模型在跨话题场景下的泛化能力。**(待核实:论文结论及效果来自标题推测,具体实验结果未知。)**

研究问题:立场检测(Stance Detection)任务中,训练数据与测试数据的话题分布不一致时,模型性能下降严重。现有方法难以学习到话题无关的立场表征。 提出方法:PAST-TIDE(Prototype-Anchored Statement Tuning with Topic-Invariant Normalization)。**(待核实:论文背景、具…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

OptiAgent 是一个多智能体框架,能够将运筹学问题的自然语言描述自动转化为求解器可读的数学公式和可执行代码,在 3/4 的基准测试上达到最先进性能。

运筹学问题的数学建模通常需要专家手动完成,从自然语言描述到求解器可用的公式和代码的过程耗时且易错。OptiAgent 旨在通过多智能体协作和迭代精化,实现端到端的自动建模,降低人工门槛并提高建模准确性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

MV-Forcing 是一个结合时间与视角双向自回归的框架,通过引入4D几何桥接,使单个扩散模型能够生成任意长度、多视角一致的动态场景视频,并利用分布匹配蒸馏(DMD)与时空自强迫缩小训练与推理之间的曝光偏差。

现有视频扩散模型要么通过时间自回归生成**长单视角**视频,要么通过双向注意力合成**短多视角**视频,但生成**长且多视角一致**的动态场景视频仍未解决。MV-Forcing 旨在解决这一空白。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

本文提出了第一个能够处理多玩家(四玩家)实时交互的高动态环境世界模型,该模型在《火箭联盟》游戏中以20帧/秒的速度生成稳定长达数小时的游戏帧序列,并且物理理解能力超越了单纯视觉外观的评估。

传统单玩家世界模型将其他智能体视为环境的一部分,无法区分场景变化是由哪个玩家的行动导致的。本文研究如何在高度动态、物理交互复杂的多人环境中,构建一个**条件于多个玩家动作流**的世界模型,使其能够正确归因场景变化并保持多动作组合下的连贯性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

本文基于待确认的元数据,提出了一种原创的昼夜节律评分方法,并将其应用于机器学习驱动的抑郁症筛查与干预。由于未能获取全文,所有结论均需对待核实。

该研究旨在利用机器学习技术,结合一种原创的昼夜节律评分(Circadian Rhythm Score),改善抑郁症的筛查与干预流程。具体研究问题、数据集和实验设计待核实。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

LLM-as-a-Verifier 是一种无需额外训练的通用验证框架,通过计算评分 token logits 分布的期望值生成连续分数,实现细粒度反馈,在多个智能体任务基准上达到最优性能,并可扩展为强化学习的密集奖励信号。

当前提升大语言模型能力的主要范式包括扩展预训练、后训练和测试时计算。本文则识别出**验证(verification)**——即判断解决方案正确性的能力——作为一个新的可扩展维度。现有的 LM 裁判通常通过提示 LLM 对候选方案输出离散分数,缺乏细粒度和可扩展性。作者提出了 LLM-as-a-Verifier 框架,旨在不进行额外训练的前提下,为智能体任务…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

本文提出一种利用设备与观看条件分布来提升视频质量评估模型泛化性能的方法,但具体内容因缺少原文无法确认。

待核实:根据标题推测,研究问题是如何使视频质量评估模型能灵活适应不同设备与观看条件(如屏幕分辨率、观看距离、环境光照等),但正文未获取。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

本文提出一种无需人工标注数据的深度学习框架,通过模拟瞬变源注入与污染数据训练双网络模型,实现了鲁棒的真实-虚假分类,并提供了校准的不确定度量化,能够直接迁移至即将开展的时域巡天项目。

时域巡天产生大量瞬变候选体,真实-虚假(Real-Bogus)分类是自动化发现管道的关键步骤。但可靠的人工标签成本高昂,社区标签则存在噪声且依赖于巡天。本研究目标是开发一个无需人工标注训练数据的分类框架,在强类别污染(虚假类占主导)下保持稳定,并提供经过校准的不确定度量化。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

本文提出了一种将神经编码器与贝叶斯广义线性混合模型结合的方法,用于多模态数据分析,但具体细节因无法获取正文而待核实。

待核实:论文旨在解决多模态数据(如文本、图像、数值等)的联合建模问题,通过引入神经编码器提升传统贝叶斯广义线性混合模型的表示能力。 待核实:可能涉及基础模型(Foundation Model)的融合应用。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-06

InFlux++ 通过大规模合成视频数据集(441K+帧)和扩展的真实世界基准(514K+帧),显著提升了基于 RGB 图像对动态相机内参(尤其是焦距)的估计精度,证明合成数据监督是一种有前景的训练策略。

大多数 3D 视频算法假设整段视频的相机内参(焦距、主点等)固定不变,但现实场景中相机常变焦、对焦,内参实际动态变化。现有方法因训练数据不足(缺乏内参多样性)以及基准场景和相机运动多样性有限,导致预测精度低。InFlux++ 旨在同时解决训练数据和评估基准两大缺口。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条