AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 2081-2100 条,共 2269 条
第 105 / 114 页
事件日期 2026-07-07

Claude Fable 5 于 2026 年 7 月 1 日重新在 Cognition 的 Devin 产品中上线,此前曾因美国政府指令暂时移除;该模型在 Devin 的 Ultra agent(最强智能体)、Desktop 和 CLI 中可用,并在 FrontierCode 基准测试中取得最高分。

2026 年 6 月 9 日:Claude Fable 5 在 Devin Cloud、Desktop 和 CLI 中首次上线。 2026 年 6 月 12 日:因 Anthropic 最新公告及美国政府指令,Cognition 产品中移除了对 Fable 5 的访问权限;其他模型(如 Claude Opus 4.8、GPT-5.5)仍可使用,Devin…

产业观察 · 原始来源:Windsurf 博客 · agent
事件日期 2026-07-07

Agentic MapReduce 通过将搜索与推理分离,用确定性选择器保证全代码库覆盖,用并行代理处理有限分片,解决了传统搜索驱动代理在大型代码库中开销高、上下文瓶颈、覆盖无界的问题。

传统编码代理擅长局部任务(修复 bug、添加端点、重构模块),但面对需要**考虑整个代码库**的任务(安全扫描、代码质量检查、破坏性变更检测)时,会暴露出三个问题: 1. 代理大部分预算花在**查找**代码而非执行任务上(数据:探索消耗 >50% 工具调用、~46.5% 主代理 tokens)。 2. 上下文成为共享瓶颈:随着运行时间增长,无关证据争夺注意…

产业观察 · 原始来源:Windsurf 博客 · agent
事件日期 2026-07-07

Mastering Agentic Techniques: AI Agent Reinforcement Learning

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-07-07

AI先驱Andrej Karpathy认为当前行业最大的错误是急于让Agent(智能体)投入实际应用,而忽视了底层大模型的基础能力建设;他主张Agent产品的成熟需要十年积累,基础能力本身就是产品。

Karpathy公开批评当前AI领域“急于逼Agent干活,却未先搞懂底层大模型”的倾向,并以2016年他参与失败的“World of Bits”项目作为教训。他强调Demo容易但产品难,Agent产品成熟需要长期积累,并建议从业者向神经科学学习以理解智能本质。同时他指出,大厂在Agent领域并没有五年的深厚积累,真正站在能力前沿的是灵活敢试的独立开发者与…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-07

腾讯正式发布Hy3大模型,通过扩大后训练与强化学习算力规模,在推理、智能体、长上下文任务上比肩参数量2至5倍的旗舰模型,同时大幅降低幻觉率和多轮问题率,并以Apache 2.0协议开源,API输入价格低至每百万Token 1元。

2026年7月7日(根据腾讯研究院AI速递),腾讯正式发布Hy3大模型。该模型在扩大后训练与RL(强化学习)算力规模的基础上,实现了推理、智能体、长上下文等任务上对参数量更大(2至5倍)旗舰模型的竞争力。同时,模型在生产力场景中进步显著,可靠性大幅改善,并宣布以Apache 2.0协议开源,降低API价格。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-07

传闻谷歌 Gemini 3.5 Pro 将于7月17日发布,其前端与视觉代码生成能力显著超越 Fable 5,但在硬核推理、仓库级工程和长程 Agent 任务上仍不及 Fable 5 与 GPT-5.6。

根据泄露信息,Gemini 3.5 Pro 的 UI 设计、SVG 生成等前端能力明显跃升,被指超越竞品 Fable 5。 模型的主要短板集中于推理与编码领域,尤其在需要深度推理、大型仓库工程和长时间自主运行 Agent 的场景下表现不如 Fable 5 和 GPT-5.6。 谷歌此次模型延期是由于更换了底层底座并重新进行预训练。基于同一底座,谷歌还计划推…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-07

本文介绍了一个基于 NVIDIA NeMo 工具包、Nemotron 开放模型和 OpenShell 安全运行时的“单报警分析 AI 代理”,它能够自动从结构化与非结构化数据中收集证据、执行专业分析并生成操作建议,大幅加速工业报警处理流程。

工业机器互联产生大量报警(每小时数百条),技术人员需要人工跨多个数据源(历史记录、规程手册、传感器读数)核实报警原因、确定应对措施并撰写工单。这一过程重复、耗时且需要广泛经验。研究问题为:能否构建一个 AI 代理来自动化上述步骤,在数秒内给出证据包(观察、根本原因假设、补救措施、推荐行动),从而释放人力处理更复杂问题。

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-07-07

XRFormer 通过多尺度卷积分词器为 X 射线荧光(XRF)光谱定制了 Transformer 架构,在颜料识别和混合分解任务上显著优于 ViT、SpectralFormer 和 1D-CNN 基线,同时参数效率更高。

XRF 光谱是文化遗产材料分析的关键模态,但其自动学习面临挑战:XRF 光谱是复杂的一维信号,包含尖锐的元素峰、较宽的结构和背景变化,现有基于学习的模型并未充分考虑这些特征。本文提出 XRFormer,专门针对 XRF 光谱设计。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

WristMimic 通过将无接触的身体运动与接触丰富的手指操控明确分离,仅利用手腕的关节运动学目标引导全局控制,在物理仿真中实现与全手指姿态监督方法相当或更优的物体操控效果,并支持跨不同手部形态的指部无关重定向。

将人体与物体交互演示重定向到物理仿真时,不仅需要再现身体运动,还需复现物体运动和接触力才能成功操控。然而,仅基于位置的双手轨迹无法指定操控所需的接触力,直接跟踪手部姿态会过度约束接触丰富的手指行为。现有方法面临“手指姿态监督导致的冗余约束”与“缺乏接触力信息”之间的矛盾。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

WorldDirector 通过将语义运动编排与视觉生成解耦,并利用大语言模型协调3D轨迹与相机运动,实现了对复杂、长时间视频事件的高可控性生成,且能保持动态物体在长时间离场后重新出现时的外观一致性。

现有世界模型通常将物理动态与像素渲染混为一体,依赖连续视觉观察来维持运动,导致难以控制长时间视频中的物体外观稳定性和物理逻辑。研究提出如何构建一个既能实现自由视角探索、又能保持动态物体持久记忆的高度可控视频世界模型。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

WordVoice 通过构建大规模双语标注数据集 WordVoice-5A 并提出显式“声学规划”机制,首次实现了在基于大语言模型(LLM)的文本到语音(TTS)系统中对词级时长、边界、能量、音高、语调五个维度的精细、解耦控制,同时保持了零样本合成的稳定性。

**现状**:现有 LLM 驱动的 TTS 系统虽然自然度极高,但依赖隐式端到端生成范式,只能实现粗粒度控制,无法在需要精确风格干预和时间对齐的场景(如有声书旁白、视频配音)中对词级声学属性进行显式操控。 **核心瓶颈**:缺乏精细标注的数据集,以及将多维控制信号整合到离散自回归生成架构中的设计挑战。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

SenseNova-Vision 将计算机视觉任务统一表示为多模态生成问题,在单一模型中通过自然语言指令和视觉提示完成多种视觉任务,无需专用架构,且性能可匹配专用系统。

传统计算机视觉需要为不同任务(检测、分割、深度估计等)设计专用架构和预测头,缺乏统一性。本文提出将视觉任务形式化为统一多模态生成(Unified Multimodal Generation),让模型在文本和图像的原生生成空间中输出结果,从而将各类视觉能力整合到通用基础模型中。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

该研究通过引入新数据集(MIDV-DynAttack)、新验证方法及公开基准,首次系统评估了自动系统对身份文档全息图动态攻击的检测能力,并提出了无需动态攻击样本即可训练的最新方法。

身份文档上的光学可变器件(全息图)为人眼提供了强安全性,但远程自动验证面临挑战。现有方法可应对静态伪造(如复印),但因缺乏公开数据集,从未评估过对真实动态伪造(如手工制作的全息图)的检测能力;且多数方法只能检测已知攻击类型,难以泛化到未知攻击。本文旨在弥补这一空白。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

通过结合无监督域适应(风格迁移模型 AdaIN 和 CycleGAN)与 Swin Transformer V2 分类器,该框架在跨站点乳腺X线数据集上有效提升了钙化良恶性分类性能,将外部验证集的 AUC 分别从 0.68 提升至 0.72(EMBED)和 0.73(Duke Calcification Dataset)。

深度学习计算机辅助诊断系统在乳腺X线摄影分类任务中表现出色,但多站点数据集之间的域偏移(domain shifts)仍是模型泛化的主要挑战。本研究提出一种钙化分类框架,旨在改善跨站点乳腺X线数据集中恶性与良性乳腺疾病的分类。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

TILDE 将文本到图像扩散模型中的概念遗忘形式化为一个分布对齐问题,通过能量倾斜的目标分布(在遗忘约束下最小偏离预训练模型的分布)和残差 ∇-GFlowNet 训练,在高效移除目标概念的同时显著提升了良性生成的保留质量与分布保真度。

文本到图像扩散模型在部署时面临隐私、版权、商标和安全等监管要求,需要在训练后抑制(遗忘)特定概念。现有方法虽能有效移除目标概念,但往往忽视遗忘后模型对良性生成的质量、多样性和语义覆盖的保持。理想的黄金标准是从头训练一个不含目标数据的保留模型(retain-only model),但常见遗忘目标并未指定遗忘后分布应如何逼近这个参考分布,导致保留效果仅作为更新…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

LCA 是一个模型无关的编排框架,通过将多模态数据摄入与特征推断解耦,为肿瘤学临床决策支持提供了高度模块化、可扩展且鲁棒的基础架构。

当前肿瘤学中的多模态深度学习模型受限于单体设计——数据摄入、临床路由和 AI 推理三者紧密耦合,缺乏灵活性。LCA 旨在通过后验编排框架解决这一刚性限制,实现可扩展的临床决策支持。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

RSF-GLLM 提出将可微图推理与答案生成解耦,利用循环软流模块传播连续相关分数并通过结构线索跨越语义不相似的桥接节点,在 WebQSP 和 CWQ 数据集上取得与基于 LLM 的昂贵方法相当的性能且推理效率更高。

多跳知识图谱问答(Multi-hop QA over Knowledge Graphs)面临关键挑战:传统“检索-读取”流水线破坏了可微性,导致检索器无法学习弥合中间节点与查询之间缺乏词汇重叠的语义鸿沟。本文旨在解决该问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

引入大规模真实世界多变量时间序列数据(RMISC语料库)可以显著提升时间序列基础模型在零样本泛化方面的表现,效果优于仅使用合成多变量数据训练的模型。

近年来,时间序列基础模型(TSFMs)在多变量建模中实现了先进的零样本泛化能力。然而,现有主流多变量TSFMs主要基于合成多变量数据进行预训练,合成数据易于规模化,但可能无法捕捉真实时间序列中复杂的时序动态和跨变量关系。核心研究问题是:使用真实世界语料库训练的领先TSFMs是否以及能在多大程度上优于使用合成数据训练的模型?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条