AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 281-300 条,共 2259 条
第 15 / 113 页
事件日期 2026-08-27

汤道生把大模型竞赛比作马拉松,认为现在才跑完头一公里,“起得早不如熬得久”;AI下半场刚开始,格局与价值分配未定,腾讯会靠长期投入穿越周期,并用技术解决真实问题。

本卡片内容来自腾讯研究院AI速递 20260827 收录的一段观点摘录。汤道生回顾腾讯AI两年实践,回应了大模型竞赛是否已分胜负、腾讯混元是否掉队、Agent产品如何落地等问题。核心判断是:AI落地是算法与工程的结合,场景是腾讯最厚的底牌;AI原生需要重构组织。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-27

WikiSkill 提出将智能体执行经验持续沉淀为可复用的持久知识库(wiki),并使技能与知识库协同演化,从而在多种基准与模型上稳定超越现有技能演化方法。

智能体技能(agent skills)将专门知识与工作流打包为可复用资源,扩展智能体能力;近期工作可自动从智能体经验中发掘技能,使其在交互中逐渐适应。然而,指导技能开发的洞见通常散落在优化历史中,难以跨迭代系统复用。WikiSkill 针对这一问题,提出技能与持久知识库共同演化的框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

HarnessLens 提出一种预算感知的自动化智能体框架(harness)演化方法,通过行为相关的选择性验证,在三个智能体框架和四个基准上使平均留出性能提升 7.6%–13.6%,同时显著减少评估预算消耗。

智能体框架决定了语言模型智能体如何使用指令、工具和运行时组件,但调整这些框架通常需要昂贵的验证。现有“提出再验证”(propose-and-verify)方法往往在固定任务集上对每个候选方案进行评分,既把 rollout 浪费在与目标行为无关的任务上,又可能因聚合分数掩盖特定能力回退。HarnessLens 针对这一问题,提出在有限交互预算下更可靠、更节省…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

当前多模态大语言模型(MLLM)智能体在单点视觉识别和短程空间推理上具有可用能力,但在真实尺度城市中进行持续目标导向探索时,局部感知无法组合成可靠行动,朝向判断、行人感知运动以及错误校正仍然是明显短板。

论文提出一个核心问题:MLLM 能解读街景,但当智能体开始移动后,这种局部视觉证据是否仍能转化为可靠的城市行动? 为解决这一问题,论文提出 UrbanGround,一个据称是首个可在“受物理约束的香港真实尺度复制城”中测试上述问题的沙盒环境。 研究按空间问题的复杂度递进,设置三个研究问题: 1. 智能体在主动观察后,能否充分 grounding 局部场景并…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

本文证明:用椭球拟合随机向量时,存在一个由坐标分布的四阶矩决定的尖锐阈值;当样本数低于阈值时,几乎必然存在正定椭球穿过所有数据点,高于阈值时则不存在半正定拟合,并进一步刻画了不可满足区的最优平方拟合误差。

研究问题:给定来自高维随机向量的数据点,何时存在一个椭球恰好穿过所有点?论文考虑坐标独立、次高斯、均值为零、方差为一、具有共同四阶矩的随机向量,采样数量与维度的平方成正比。此前关于椭球拟合的猜想(标准高斯数据阈值为 1/4)被本文解决。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

论文通过理论分析和实验揭示,进化策略(ES)作为大语言模型(LLM)推理的后训练范式,能带来比 GRPO 更广的推理覆盖(broader reasoning coverage):不同于 GRPO 表现出的熵坍缩,ES 在提升 Pass@1 的同时可获得比 GRPO 更高的 Pass@K,因此不应只被看作内存高效但效果较弱的 GRPO 替代方案,而是一个有独…

ES 最近被用于 LLM 推理的后训练,具有内存高效的特点,但它的优化行为仍缺少系统研究,导致难以界定其相比 GRPO 等主流后训练范式的优势范围。本文通过系统考察 ES 的动力学与机制,试图回答:ES 的优化行为是什么?它在什么方面优于 GRPO?以及如何设计超参数以发挥其作用?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

TTPO(Test-Time Policy Optimization)提出了一种无需标签的测试时策略优化方法:用多数投票伪标签代替真值,并采用“不对称”更新——对与伪标签一致的采样结果做同策略自蒸馏(OPSD),对不一致的采样结果用 Grouped RL 进行惩罚,从而在无人工标注条件下提升大模型数学推理能力(据候选摘要,待核实)。

背景:近期强化学习(RL)和同策略自蒸馏(OPSD)等后训练方法显著提升了大语言模型的数学推理能力,但这些方法依赖真值标签,因此无法直接用于测试时训练(Test-Time Training, TTT)。 问题:用多数投票伪标签替代真值是一种自然替代方案,但存在脆弱性——如果投票结果错误,错误伪标签会污染教师信号,并误导后续所有 token。 核心观察:这种…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

LAMA 是一种将广告主影响力直接嵌入大模型生成过程的 token 级广告拍卖机制,在满足激励相容和个体理性的前提下,可接近最优的 KL 正则化社会福利,并在商业搜索查询上初步证明能提升平台福利与收入而不损害回复质量。

传统广告机制依赖预定义广告位,而生成式 AI 正在改变人们获取信息的方式,广告需要转向“生成原生”(generation-native)形态。研究问题:如何在文本生成过程中按 token 分配广告影响,并设计同时满足激励性质与福利最优性的拍卖机制?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

SWE-Prime 提出一种多粒度、两阶段的监督微调(SFT)数据选择方法,通过对轨迹级和片段级的质量筛选,仅使用完整已解决数据集中10%的轨迹进行训练,即可在SWE-Bench Pro和SWE-Bench Verified上取得优于全量数据训练的模型性能。

先前工作倾向于构建大规模智能体轨迹数据集,并在成功轨迹上进行SFT。但任务成功并不等于轨迹质量高:成功轨迹仍可能包含无效、冗余甚至危险的步骤。直接用这些轨迹训练会引入噪声监督,使模型模仿不良问题解决行为。本研究旨在回答:如何从成功轨迹中进一步筛选高质量子集,以提升大语言模型解决真实软件问题的能力。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

JEPA 世界模型中的视觉 Transformer 编码器不必预先分配最大容量,可以从极小的初始结构出发,根据任务复杂度逐次进行宽度或深度扩展,在提高计算与数据效率的同时保持表示质量。

Joint-Embedding Predictive Architectures(JEPA)用于世界建模时,通常采用固定大小的 Vision Transformer 编码器。这种固定设计对简单任务容量过剩,对复杂任务容量不足,而且注意力头之间存在显著冗余。本文提出 Successive Capacity Growth(SCG,连续容量增长)方法,让编码器随…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

本研究提出一种基于无放回重采样与逆包含概率加权的随机估计算法,用于计算转导语言模型(Transduced Language Models, TLMs)的目标前缀概率,相比阈值剪枝的束求和可大幅降低计算成本,并得到无偏估计。

转导语言模型将一个预训练的源语言模型与一个函数式有限状态转换器组合,从而在目标字符串上诱导出新的语言模型。计算目标前缀概率需要汇总所有能被转换器映射到该前缀的源字符串的概率之和,而这一集合可能指数级增长甚至无限,导致精确计算不可行。已有方法利用源前缀概率的捷径,再通过阈值剪枝的束求和近似,但只能给出误差未知的下界。本研究旨在改进这一近似过程,提供无偏估计并…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

eBay 提出一个两阶段 XGBoost 模型 Stageboost,用于在商品详情页(View-Item, VI)上智能选择要展示的“信号”(简短文本或视觉片段),在线实验显示整体 GMB(Gross Merchandise Bought)提升 0.08%,其中 Parts and Accessories 类目 GMB 提升 0.58%。

在 eBay 商品详情页上,信号是展示给用户的简短文本或视觉片段,旨在提供与当前商品相关的额外上下文信息,以促进智能购买和提升用户参与度。研究问题是如何从候选信号中选出最优组合,填充到 VI 页面,从而最大化交易相关指标。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

在大型企业后台员工中,生成式AI使用的“成熟度”与员工资历及职能领域明显相关;战略、数字创新和项目管理三个职能领域的成熟度最高。同时,观察期内未发现成熟度随时间自然提升,正式AI培训也未带来持久改善。

这项研究关注一家大型企业后台员工在实际工作中如何使用生成式AI,核心问题是:GenAI使用的成熟度在不同员工和不同职能之间如何分布?哪些因素能解释这种差异?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

在生产级社交图谱(1.94亿用户、280亿条边)上,将多哈希ID嵌入作为主要节点表示,并用按时间戳排序的CSR存储加二分查找实现时间邻居采样,使推荐带来的好友添加量提升16%、去重后的添加用户数提升11.5%,同时将ID嵌入表规模压缩超过98%。

Scaling Graph Neural Networks for Friend Recommendation: Multi-Hash User Embeddings and Temporal Neighbor Sampling

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

视觉语言模型(VLM)中存在一类数量很少的注意力头,称为 **Visual Retrieval Heads (VRHs)**,它们负责将文本描述锚定到图像区域,并从图像中提取相应视觉证据;仅屏蔽约 20 个这样的头即可使指代表达定位准确率下降最多 80 个百分点,而屏蔽同样数量的随机头几乎没有影响(待核实)。

大语言模型(LLM)中已有“检索头”(retrieval heads)的发现,即少数注意力头负责从上下文中检索信息。 该研究提出对应问题:**VLM 是否也有类似机制,用于完成“视觉检索”?** 即当文本提示指向某个图像区域时,模型如何找到并路由对应视觉证据。 作者将这类机制命名为 Visual Retrieval Heads(VRHs),并研究其因果作用…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

本文通过将音乐家表示为80个低层 Essentia 声学描述符的经验分布,并用边际最优传输(Wasserstein)距离衡量两两声学距离,证明专家批评文字中形成的“批评邻接”关系在冷启动、艺术家不相交的划分下可被声学内容部分恢复(样本外 AUC=0.767),且批评共识越强越可恢复(多源共证边 AUC=0.865)。

音乐推荐通常依赖两类信号:用户–物品交互(冷启动失效)和内在音乐内容(任何录音可用)。 论文提出第三类信号:**批评邻接**,即专家评论家在长文评论中明确将两位音乐家联系起来的成对关系。 已有工作证明了其内部效度:能恢复连贯、可解释的社区,并在无用户数据的用户满意度模拟中媲美协同过滤;但缺少外部效度验证。 本研究的构念效度问题是:这种源于批评的关系到底扎根…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

MILO 利用大型重建模型(LRM)从单张图像生成几何脚手架,再将该网格分割为人体与物体部分,并分别拟合参数化人体模型和(可选的)物体模板,从而在多个基准上取得优于现有基线的 3D 人-物交互重建精度。

3D 人-物交互(3D HOI)估计是 3D 计算机视觉的基础问题,应用方向包括 AR/VR、机器人和具身 AI。由于深度模糊、遮挡和物体形状多变,从单张图像重建三维交互仍具挑战。现有方法主要依赖重投影和接触约束,将参数化人体模型与物体模板拟合到 2D 图像;本文提出不同路径:先使用 LRM 重建中间网格,再把问题转化为对该网格的“解释”。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

有影响力的公共话语会影响公众信念,也可能产生误导——这种误导不仅源于陈述的事实,还源于信息的框架、省略、情境化与沟通方式。然而,已有研究较少关注误导性如何产生并影响读者形成的解读。RCMN(Reader-Centric Misleadingness Understanding)为此提出了一个以读者为中心的误导性理解框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

RATIO 是一个大规模科学文献检索基准,用 Address、Broaden、Specify 三种“创意动作”(ideation moves)重新定义相关性,用于训练和评估能帮助人类与 AI 科学家从文献中获得灵感的检索系统。

检索到的科学文献既可以给人类科学家,也可以给 AI 科学家提供灵感。 灵感可能以不同形式出现:先前工作可能直接提示如何解决某个问题,也可能在不同抽象层级上给出方向——向上概括到更一般的表述,或向下具体化为某个可实现的实例。 现有检索基准通常只区分“相关/不相关”,没有区分灵感的不同类型;RATIO 试图填补这一空白。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条