AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 2001-2020 条,共 2269 条
第 101 / 114 页
事件日期 2026-07-09

本文提出一种与原有动作代理并行的主动记忆代理,它通过结构化记忆库和选择性干预机制,在长时程任务中有效缓解“行为状态衰减”问题,显著提升任务成功率。

在长时程任务中,决策相关的状态信息常常散布在不断扩展的动作轨迹中。随着轨迹增长,任务需求、环境事实、先前尝试、诊断结果和未完成的子目标可能被埋没在上下文窗口中,甚至被推出窗口,导致无法在需要时影响决策。作者将这种失败模式称为**“行为状态衰减”**(behavioral state decay)。现有方法多依赖被动检索,未能主动干预。本文旨在将内存作为主动…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

ProjAgent 提出将**程序相似性**作为显式检索信号,结合代理工作流与静态分析反馈循环,在仓库级代码生成任务中以 41.14% Pass@1 超越了现有基于检索的基线方法。

仓库级代码生成需要实现目标函数,同时考虑复杂的跨文件依赖和项目特定约定。现有检索方法主要依赖词法、结构或语义相似性,往往忽略了仓库中那些标识符或应用领域不同但实现相似程序逻辑的函数。本文提出 ProjAgent,旨在利用程序相似性填补这一检索维度空白。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

OpenCoF 通过构建专门的推理视频数据集(OpenCoF-17K)并微调视频生成模型(Wan-CoF),证明了多样化的时序监督能显著提升模型在视频推理任务上的表现,同时引入视觉和文本推理令牌可进一步组织中间推理状态。

大型模型需要具备理解逻辑后果的推理能力。现有视频生成模型主要训练于通用视频语料,缺乏针对“帧链式推理”(Chain-of-Frame, CoF)的多样化监督和专用设计。为此,论文提出 OpenCoF 框架,旨在研究如何通过视频生成来实现推理。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

LingBot-VA 2.0 是一个从头为具身智能构建的视频-动作基础模型,通过语义视觉-动作分词器、因果预训练、稀疏 MoE 骨干和增强异步推理四项核心设计,实现了在真实世界中复杂操作任务的少样本泛化。

现有的视频-动作模型多为数字内容创作的视频生成模型改造而来,这对物理环境本身并不适合。本文提出 LingBot-VA 2.0,旨在弥合这一差距,打造一个原生面向具身控制的视频-动作基础模型。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

本文通过理论分析与分层机器教学算法证明:在逆向强化学习中,结合多模态反馈(特别是比较反馈)并在多个环境间主动选择信息互补的环境进行教学,能够显著提升奖励函数的泛化鲁棒性,降低部署在新环境中的遗憾值。

自主智能体需要在多种运行环境中保持行为与人类意图一致,但现有的逆向强化学习(IRL)教学分析仅关注单环境、仅演示(demonstration)反馈场景,忽略了不同反馈模态与环境动态如何联合约束奖励函数。单环境MDP中的演示会将奖励信息与该环境的具体结构纠缠在一起,导致训练出的奖励函数在新环境中泛化失败。本文旨在解决:**如何利用异构反馈模态和多环境动态联合…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

MPFlow 利用深度图强化学习,在预算约束下为比特币闪电网络节点选择最优通道以最大化路由容量(最大流),并在真实网络快照上优于强启发式基线,且已部署于生产环境。

研究问题:在比特币闪电网络中,给定固定预算,节点应打开哪些通道以最大化其路由容量(routing capacity)? 作者将这一问题建模为预算约束的组合优化问题:在图上选择 k 条边添加,使得 s-t 最大流(理论驱动的路由容量度量)最大化,并通过图强化学习求解。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

本文提出一种利用陈旧数字高程模型(DEM)作为几何先验的多模态地形重建框架,通过物理驱动的像素‑像素对齐大幅降低计算复杂度,在野火灾区快速生成高保真深度图,且保持实时性能。

野火应急响应需要精确的3D地形图,但高风险区域通常面积广阔,常规重建方法效果不佳。机载LiDAR系统昂贵且更新频率低,基于图像的方法成本低却受限于稀疏视觉特征和有限的图像重叠。研究旨在解决:如何利用已有的陈旧DEM数据,以低成本方式从图像中高效重建大范围高精度地形。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

MAESTRO 是一种专为稀疏激活混合专家(MoE)语言模型设计的有结构剪枝框架,通过将自回归专家激活轨迹建模为遍历马尔可夫链,利用其平稳分布编码跨层依赖关系,从而获得全局重要性启发式,在50%压缩率下平均性能保留比现有最优方法高最多10.61%,且跨任务方差更低。

稀疏激活的MoE语言模型每次只激活一小部分参数,但所有专家始终驻留在内存中,带来巨大的部署瓶颈。现有的有结构剪枝方法大多针对稠密Transformer设计,使用局部启发式评估专家重要性,忽略了MoE路由的相互依赖性。MAESTRO旨在解决MoE架构剪枝中的全局依赖建模问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

现有AI系统在科学思想的谱系推理任务上表现很差,最强模型仅达27.3%的精确准确率,且结构化的谱系上下文会重新排序系统排名而非均匀提升所有参与者,暴露出组合瓶颈。

科学研究很少从空白页开始,而是继承机制、修复已知局限、重组前期工作,类似生物基因组。然而现有基准很少评估AI系统能否理解这种继承结构。作者提出IdeaGene-Bench(IG-Bench),用于科学谱系推理和基于谱系的创意生成。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

HumanForge 是一个大规模、多范式、以人为中心的深度伪造视频数据集,通过自动化的多智能体流水线 Gen2Anno 生成超过 18K 高保真视频片段及结构化对比注释,现有检测器和大型多模态模型在其上表现出零样本泛化和细粒度推理的显著困难。

视频扩散模型和时间编辑工具的快速发展可以生成高度逼真的人为中心视频,对数字内容取证构成前所未有的挑战。现有基准主要关注换脸或全局文生视频,忽略了人-物或人-人交互以及多模态对齐等关键维度。为此,研究团队提出 HumanForge 数据集,旨在填补这一空白,构建统一的、涵盖多种伪造范式的人为中心视频伪造基准。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

在自利代理人社会中,不加约束会导致合作崩溃;而**调解(Mediation)机制**能够在对抗性攻击下维持市场稳定——虽然会被削弱(最优攻击使诚实代理效用降低13.3%),但不会崩溃,具有“可弯不可断”的鲁棒性。

研究通过一个多代理市场模拟实验,探索在自利代理人(LLM代理)社会中,哪些**正式机制**(即建立在无限制通信之上的规则)足以维持市场稳定,并评估这些机制面对**对抗性攻击**时的鲁棒性。具体场景:18个具有互补生产特长的DeepSeek-V3 LLM代理在受限社交网络中进行交易以获取效用,模拟中逐步注入捣乱者(troll),观察不同机制的效果。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

EdgeRefine 通过基于 Jaccard 相似度的自适应边细化框架,在强隐私预算(如 ε=2.5)下实现了与无噪声基线相当的图学习精度,同时显著优于现有差分隐私方法,并对图重建攻击具有很强的鲁棒性。

图神经网络(GNN)在处理图结构数据时取得显著成功,但在隐私敏感场景(如社交网络、医疗关系图)中,图的边可能泄露敏感链接信息。为满足边级差分隐私(Edge Differential Privacy),传统方法向邻接矩阵所有元素注入噪声,但更强隐私需要更多噪声,严重损害模型效用。隐私-效用平衡成为实际应用的主要障碍。本文提出 EdgeRefine 以改善这一…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

在深度研究系统的引用质量验证任务中,较便宜的LLM评判模型(如GPT-5-mini)在源相关性和事实支持两个维度上与前沿模型表现相当;校准评判模型不需要最昂贵的模型,但必须关注方向性偏差,因为标量F1分数会掩盖这一问题。

强化学习越来越多地依赖LLM评判模型来对每个评分标准打分,该评判模型在训练中充当奖励模型。在信任该信号之前,需要知道评判模型必须具备多高的能力以及它有多大的偏差。本研究针对深度研究系统中的引用质量校准问题——搜索增强型LLM必须为每个写出的声明提供引用来源。引用质量是一项结构化的评分任务,每个归因-引用对沿两个需要LLM判断的维度进行评分:源相关性(sou…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

本文提出GenRes和GenRes++框架,通过神经张量网络建模原始图像与变换图像之间的细粒度关系特征,结合PE-Core特征提取器,在多个基准数据集上实现了优于现有方法的AI生成图像检测性能,尤其对未见过的生成方法具有良好泛化能力。

生成式AI的快速发展使得高度逼真的深度伪造媒体被大量制造,带来了虚假信息、数字身份盗用、欺诈和舆论操纵等重大威胁。由于生成方法的多样性以及它们留下的伪影非常细微,AI生成图像(AIGI)检测面临可靠挑战。现有方法往往难以泛化到未见过的新生成方法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

BiSCo-LLM 提出一种无需码本的二进制球形编码框架,将大语言模型权重压缩至极低比特(目标约 2 比特/权重),通过球形二值化、残差编码和分类恢复蒸馏,在避免显式码本和索引查找的前提下实现高效压缩。

大语言模型(LLM)在部署时受限于内存容量、权重带宽和检查点存储。现有低位压缩方法主要有两个方向: **标量/组量化**:简单且兼容低精度内核,但当目标预算接近 2 比特/权重时表示能力受限。 **向量量化(VQ)**:提供更丰富的块级表示,但通常引入显式码本、索引查找和额外存储开销。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

松弛标准推测解码的无损保证可带来额外加速或能力提升,但需要仔细评估能力损失,且许多方法依赖于高质量的语言模型作为草稿模型,不适合轻量专用多令牌预测器。

该研究针对自回归大语言模型(LLM)的采样加速技术——推测解码(Speculative Decoding)。标准推测解码使用较快的辅助模型(草稿模型)生成候选令牌,由LLM并行验证,并通过拒绝和重采样步骤保证精确保持LLM的采样分布(无损)。最近有工作认为放松这一严格保证可以进一步加速、实现可控的能力-速度权衡,甚至带来能力提升。本文对训练无关的松弛推测解…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-08

2026年6月4日,1X宣布成立1X世界模型实验室,这是一个专门从事具身AI前沿研究的新组织,核心方向是通过大规模具身世界模型预训练推动完全自主人形机器人。该实验室建立在1X世界模型突破的基础上——该模型已使NEO机器人能够以零样本执行完全未见过的任务。1X CEO Bernt Børnich表示:“世界模型将使机器人摆脱静态环境中的狭窄任务陷阱……为了最…

产业观察 · 原始来源:1x.tech · spatial-intelligence, generative-model
事件日期 2026-07-08

OpenAI的一份新分析指出,流行编码基准SWE-Bench Pro存在可靠性问题,引发了对AI模型评测准确性的担忧。

据OpenAI官方博客(URL见下)发布的分析,研究团队对SWE-Bench Pro这一广泛使用的编码能力评测基准进行了审查,发现其中存在信号与噪声混淆的问题,可能影响模型能力的真实评估。

产业观察 · 原始来源:OpenAI · benchmark-evaluation
事件日期 2026-07-08

微信小程序成长计划将大模型Token额度从1亿提升至10亿,AI生图额度从1万张增至10万张,全面升级至混元Hy3与Hy Image 3.0,并自动为已参与开发者补发差额资源。

腾讯研究院于2026年7月8日发布AI速递,其中宣布微信小程序成长计划再度升级。核心调整包括:大模型Token额度从1亿提升至10亿,AI生图额度从1万张增至10万张;底层模型全面升级至混元Hy3与Hy Image 3.0;资源包有效期设定为6个月。已参与开发者无需重复申请,系统从7月1日起分批自动补发9亿Token与9万张生图额度。同时,云开发个人版升级…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
每页 20 条