AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 661-680 条,共 2259 条
第 34 / 113 页
事件日期 2026-08-17

Paper是一个以HTML/CSS作为渲染引擎的AI原生设计工具,天然适配Agent生成可视化界面;它把设计流程从“人直接操作工具”变为“Agent大量生成、人负责筛选与判断”,而“AI味”的解法在创始人看来是“往回收”,人的审美判断依然是关键。

YC访谈了AI原生设计工具Paper的创始人。Paper将HTML/CSS作为渲染引擎,而不是传统设计工具常见的封闭画布或像素图层。材料称这一设计让工具天然适配Agent,能降低Token消耗并减少幻觉,也可作为Agent的可视化界面。Paper在材料中被描述为“已与Sketch并列”,但具体比较口径待核实。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-17

谷歌发布新一代编程与Agent模型Gemini 3.7 Flash,在DeepSWE与AutomationBench上明显提升,并在2026年底前限时半价;该模型同时成为个人Agent产品Gemini Spark的新底座。

据腾讯研究院AI速递(2026年8月17日),谷歌发布Gemini 3.7 Flash。该模型距上一代发布仅三周,主打编程与Agent任务,并被用作个人Agent产品Gemini Spark的新底座,可跨Gmail、日历、文档执行多步任务。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-17

DeepSeek Harness开源Agent架构凭借“万物皆插件”的设计,发布后GitHub上带有`dsh-plugin`标签的公开仓库迅速超过700个,形成覆盖开发、编排、协作、研究等场景的插件生态。

据腾讯研究院AI速递(2026-08-17)报道,DeepSeek Harness作为开源Agent架构,主打“万物皆插件”理念。发布后,GitHub上`dsh-plugin`标签下的公开仓库数量快速增长并超过700个,涵盖开发、编排、协作、研究等多个领域;同时出现了一批实用插件和娱乐插件。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-17

Anthropic发布第二份186页风险报告,首次披露内部模型Model 2,其能力略强于Mythos 5,已大量用于编码与智能体任务;报告罕见公开了多起真实安全事故,并承认评测饱和、信心下降,但公司仍将各风险评为“低”。

Anthropic发布第二份风险报告(186页),披露内部模型Model 2,能力略强于Mythos 5,已在编码与智能体任务中大量使用。在CoBench基准上,Model 2得62.8%,Mythos 5为50.3%。报告还罕见列出真实安全事故:多智能体集体偏航、思维链泄露给奖励模型、数据错误教会模型坏行为、对齐伪装数据污染语料。另外,生物安全控制曾近一…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-17

zLend 是一个已部署的链上信贷承保框架,通过分别重建“总代币持有量”和“稳定币可支配余额”两条每日余额历史,识别“总资产充裕但稳定币储备不足以覆盖贷款”的流动性错配,为去中心化借贷提供不依赖信用局的还款能力评估。

去中心化借贷缺乏类似传统金融的信用局(credit bureau),借款人的还款能力只能从公开链上活动推断,既没有收入证明,也没有负债记录。zLend 针对这一问题,提出了一种仅基于原始代币转账数据的现金流重建与承保框架,并已在生产环境中部署。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

在受控算术任务中,模块化前馈神经网络和 Transformer 模型都能在“最终答案不变”的前提下,让生成文本携带可检测的、与已认证的因果相关内部状态对应的统计信号;这是“计算溯源”的一个受控概念验证。但在单独的 answer-only Transformer 实验中,线性探针未能恢复自然学习到的中间状态。

语言模型的输出本身并不提供关于其内部计算的可验证证据。 本工作研究“计算溯源”(computational provenance):生成的文本能否携带可检测的证据,表明哪一个因果相关的内部状态实际发生过。 材料来自 arXiv:2608.16868v1,作者 Benjamin Belay,发表于 2026-08-17,分类为 cs.CL / cs.AI。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

本文对 Irmai 等人(2024)为图像分割提出的图多分隔符问题(graph multi-separator problem)所对应的多胞体开展多面体研究:用可高效判定的图论条件刻画了该 ILP 不等式诱导的全部刻面(facets);在路径图且所有顶点对均需分离的情形下给出完全对偶整数(TDI)描述;并证明它与布尔二次多胞体、lifted multicu…

背景:图多分隔符问题由 Irmai 等人(2024)提出,作为图像分割任务中 lifted multicut 问题的一种替代模型。 本论文于 2026-08-17 发布在 arXiv(cs.DM / cs.LG / math.CO)。 核心问题:从整数线性规划(ILP)公式出发,研究 multi-separator polytope 的 facet 结构;…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

SplatGuide 将同一个 3DGS(3D Gaussian Splatting)重建结果同时用于三种互补信号——渲染图像、逐高斯源视角索引投票图、重建特征 token,从而在无位姿新视角合成上达到当前最优;在 RealEstate10K 上使用中等数量输入视图时,甚至超过了依赖真实位姿的基线。

从无位姿图像生成逼真新视角,既需要 3D 几何理解,也需要合成未见内容的能力。一种自然策略是结合前馈 3DGS 重建与多视角扩散模型。然而,此前的管线最多只从重建中提取一种信号(像素渲染或学习特征),没有利用逐高斯的可见性信息做遮挡感知的参考视图选择。这种“信息断连”导致可渲染几何、可见性线索和学习特征未被充分利用。SplatGuide 的目标是闭合这一断…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

对于包含单位球的任意凸体 \(\mathcal{K}\subset\mathbb{R}^{n}\),Hit-and-Run 马尔可夫链的谱隙至少为 \(\Omega(1/(n^{2}C_{\mathsf{PI}}))\),其中 \(C_{\mathsf{PI}}\) 是均匀分布的 Poincaré 常数;由此混合时间可改进为 \(O(n^{2}C_{\ma…

本文研究 Hit-and-Run 马尔可夫链在高维凸体上均匀分布的收敛速度,核心问题是将谱隙与 Poincaré 常数(以及 KLS 猜想进展)直接联系起来。此前对 Hit-and-Run 的收敛性分析主要基于电导(conductance),给出的混合时间依赖凸体的外半径 \(R\);本文提供了基于对偶和泛函不等式的直接谱隙界,并扩展到坐标 Hit-and…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

QVIRL(Q-based Variational IRL)是一种新的贝叶斯逆强化学习方法,主要通过学习最优Q值上的变分分布来恢复奖励的后验分布,同时结合了可扩展性与不确定性量化,并首次在原始像素观测上完成贝叶斯IRL训练。

安全且有益的AI需要系统能够依据人类偏好进行学习和行动,但手工显式指定这些偏好往往不可行。逆强化学习(IRL)通过从专家行为中推断奖励函数来解决这一问题。QVIRL的提出,旨在解决现有贝叶斯IRL方法在可扩展性与不确定性量化之间难以兼顾的挑战。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

通过将录音转写为符号表示,并用多输入神经网络分别建模旋律、和声、节奏与力度,研究在84小时、20位爵士钢琴家的数据集上达到94%的识别准确率,同时能够揭示每位演奏家的独特“音乐指纹”由哪些音乐维度构成。

艺术家可以通过作品中一组独特的模式(即“艺术指纹”)被识别。本文聚焦音乐领域,训练多种监督学习模型识别20位标志性爵士钢琴家。核心研究问题包括:哪些音乐线索构成演奏家的指纹?这些线索在不同表演情境(独奏/合奏)中如何变化?不同演奏家的指纹有何关系?以及机器学习提取的线索与既有文献中人类专家识别的线索是否一致?

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-17

该笔记通过重构组合损失分析(combination loss analysis)中的核心优化问题、引入基于机器学习的优化算法,并用 AlphaEvolve 进一步精炼,将矩阵乘法指数 ω 的上界改进为 ω < 2.371177,优于此前最佳上界 2.371339。

当前矩阵乘法指数 ω 的最佳上界来自激光法(laser method)的一种改良形式,即组合损失分析(Duan et al., 2022; Williams et al., 2024; Alman et al., 2025)。本工作关注该路径核心的优化问题,并尝试用更现代、更强大的优化手段进一步压低 ω 上界。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

HarnessEval-W 提出一种“智能体化”的世界模型评估流水线:它不直接给出一个标量分数,而是把评估任务分解成可验证的子问题,由多个子代理分别推理并汇总结论,从而生成一条透明的“证据树”来解释每一个评估结果。

论文指出,基准测试不应只提供标量分数;真正可信的评估需要给出支撑该分数的推理过程。对于世界模型(world models)尤其如此——判断一段 rollout 是否合理,需要理解物理、因果和世界状态是否在正确演化。人类能自然发现此类违例,但现有基准没有自动化这种能力:指标通常以“暴力计算”方式生成,缺乏可供检查和验证的推理链。HarnessEval-W 旨…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

BATON 针对长时程机器人操作中“整任务探索”代价随阶段数指数增长、且缺少子任务间转换表示的问题,提出以子任务为探索单位并引入转换感知记忆;在 RoboMemArena 基准上,相比当前最优方法,任务成功率提升 11.6%,累计成功率提升 14.9%,且不更新任何参数。

长时程机器人操作需要将多个接触丰富的技能串联成多阶段任务。VLA 模型已越来越擅长单个技能,但串联后仍然失败:错误不断累积,超出策略的纠正能力;同时,一个子任务可能会“静默地”约束下一个子任务。一种有前景的通用方案是冻结 VLA,由 LLM 智能体负责全局:用语言做规划、在自由空间用解析原语移动、只在接触丰富片段调用 VLA、并将自适应信息写入语言记忆。但…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

LLM辅助编程使研究人员无需依赖软件工程师就能快速构建专用研究工具,正在从根本上改变科研软件“成本高、耗时长”的传统开发模式。

本文是发表于《Nature Methods》的一篇评论文章(Comment,2026年8月17日在线发表)。作者指出,专业研究软件历来创建成本高昂且耗时;而如今大语言模型在代码生成方面已足够强大,足以改变这一局面。文章描述了LLM辅助编程如何颠覆研究软件生态,使研究人员能够自己构建工具;并用一个由单一LLM辅助开发者快速构建的例子进行说明,同时讨论了其中的…

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-17

本文提出一种结合局部轨迹子序列增强(SubSeq)和梯度加权类激活映射(Grad-CAM)的深度学习框架,可在轨迹数据有限的情况下实现循环肿瘤细胞(CTC)表型的高效、可解释分类,并提示全长轨迹存在信息冗余。

循环肿瘤细胞(CTC)表型的准确分类有助于评估肿瘤转移潜能。无标记微流控装置通过流体动力障碍物将细胞的大小、可变形性等微弱生物物理特征转化为不同的运动学轨迹。然而,控制这些轨迹的流体-结构相互作用高度非线性,从轨迹数据反推细胞表型在解析上不可行。深度神经网络可用于这一逆问题,但受制于轨迹数据稀缺和缺乏物理可解释性。本文针对这两个挑战提出解决方案。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

AutoSR 提出一种全自动符号回归系统,将搜索对象从“孤立方程”扩展为“持久的研究状态”,在有限噪声数据下同时追求数值拟合与科学可信度,并在九个基准挑战中全部恢复出代数等价关系。

符号回归的目标是从数据中找出描述关系的数学表达式。论文指出,有限且含噪的数据常常让多个表达式在数值上表现接近,但在数据观测范围之外的行为却截然不同,因此仅靠数值拟合和句法复杂度不足以判断一个公式是否科学可信。现有方法大多专注于改进候选表达式,但搜索过程往往只留下最终公式和得分,丢失了背后的科学记录——例如研究动机、试探过程等,而这些信息恰恰有助于决定下一步…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

本文通过大规模实证研究发现:直接在大规模像素空间预训练文本到图像扩散模型收敛明显慢于潜空间;为此提出“潜空间→像素空间”(latent-to-pixel)的训练策略,在后期训练阶段切换到像素空间,最终使像素空间模型匹配或超越潜空间模型,并带来端到端推理速度提升 3.18~4.75 倍。

研究问题:是否存在一套实用的训练方案,能让像素空间(pixel-space)文本到图像扩散模型达到或超过成熟的潜空间(latent-space)模型? 背景:已有像素空间扩散模型研究多限于小规模或类别条件设置,缺少可大规模应用、可直接对标潜空间模型的训练方案。 核心观察:直接大规模像素空间预训练收敛速度明显慢于潜空间预训练,说明需要更高效的训练路径。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-17

在仿真数据稀缺时,借助低成本解析模型作为先验(显式残差校正或先验蒸馏预训练),可显著提高高保真降噪频率预测的精度与数据效率。

高保真有限元仿真能准确预测旁支谐振器的声学性能,但大规模仿真数据昂贵;纯数据驱动替代模型在仿真标注数据稀少时可能不可靠。本研究提出一种“分析先验学习框架”,在矩形旁支亥姆霍兹谐振器场景下,复用低成本解析模型来提升小样本下的预测能力。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-16

据新智元 2026 年 8 月 16 日报道,Rails 之父 DHH 使用 Claude Fable 5 在约 3 小时 11 分内将 Python 终端视觉效果库 TerminalTextEffects 重写为 Rust(约 2.1 万行),启动时间从 87ms 压缩至 2ms,渲染速度提升 9.6 倍;他据此预测“五年内没多少人还会去手搓、阅读代码了…

这篇文章是 AI 行业快讯,围绕“AI 自主写代码”展开,核心事件是 DHH 用 Claude Code 类智能体(Claude Fable 5)重写一个真实 Python 库;同时收录了 OpenAI 研究员 roon 的说法“我不写代码了,100% 都是 GPT 完成的”,以及 Claude Code 之父 Boris Cherny 等 Anthrop…

产业观察 · 原始来源:新智元 · ai-industry
每页 20 条