AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 801-820 条,共 2259 条
第 41 / 113 页
事件日期 2026-08-12

2026年8月12日至13日,腾讯探元计划NextGen AI考古赛道开放日在山西大同云冈石窟举行,6个AI考古共创项目集中展示阶段性成果,覆盖石窟寺、汉画像石、甲骨文、冶金微遗物、陶瓷碎片与水下题刻等场景,核心共识是:AI不应只用于“看见”和验证已知,而要锚定真问题,从“复现”走向“突破”。

探元计划NextGen AI考古赛道由山东大学考古学院(文化遗产研究院)负责运营,致力于推动AI技术与考古、文物保护及文化遗产研究深度融合。开放日汇聚来自文博机构、高校院所、创新企业、孵化项目的70余位嘉宾,通过实地调研、成果展示、开放研讨与工作坊共创,将AI引入文化遗产保护研究一线。8月12日上午,专家走进云冈石窟第16—20窟及第38、39窟实地调研,…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-12

智谱针对GLM深度优化的Coding Harness ZCode完成升级,新增Goal、Subagents、Remote Control与闲时任务四大功能,其中Goal模式可自动拆解任务、修改代码、运行测试并判断是否达标,使复杂编码任务可自主跑完。

据腾讯研究院AI速递20260812报道,智谱ZCode迎来升级,面向GLM Coding Plan用户上线多项新能力,并将用户额度统一重置。此次升级的核心是Goal模式,让Agent从“辅助写代码”进一步走向“端到端自主交付任务”。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-12

腾讯 WorkBuddy 推出多端同步,打通 PC、APP、小程序三端;登录同一账号即可实时同步任务、对话记录与产物。用户可在手机上远程查看并操控电脑端 Agent 任务,电脑锁屏时 Agent 仍继续运行。

本卡片基于腾讯研究院AI速递(20260812)中的“生成式AI”条目。该条目报道,腾讯 WorkBuddy 上线多端同步,核心变化是 Agent 任务可从电脑端延伸到手机端,并可远程授权、急停、切换项目。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-12

NVIDIA Nemotron 3.5 Lightning 是一个专为“始终在线”AI 代理的高频执行层设计的开放 30B Mixture-of-Experts(MoE)模型,仅激活 3B 参数,在保持较高准确率的同时可提供相比同类模型最高 4 倍的输出速度,并支持本地部署与模型路由。

长时运行 AI 代理的大部分时间花费在高吞吐执行任务上,例如工具调用、结果验证和子代理委派。如果每一步都用前沿推理模型处理,成本和延迟都很高。NVIDIA 于 2026 年 8 月发布 Nemotron 3.5 Lightning,目标是在代理工作流中承担“执行层”工作,让更小的高效模型处理高频、低延迟任务,而像 Nemotron 3 Ultra 这样的前…

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-08-12

扎克伯格发布万字长文,将Meta战略定义为“面向每个人的个人超级智能(Personal Superintelligence)”,主张通过开源模型、智能眼镜和大规模算力投入,把AI能力从少数机构下放给普通人,并瞄准下一代计算平台入口。

据腾讯研究院AI速递(2026年8月12日)收录,扎克伯格发文提出Meta要构建“个人超级智能”。核心判断是:AI能力不应集中于少数机构,而应下放给普通人,形成权力制衡。文中设想未来每个人身边都有一个长期存在的智能体,能够理解用户的个人工作与健康目标;同时提供一种Meta也无法查看的完全私密模式。该路线将开源模型、智能眼镜与大规模算力投入串联起来,目标指向…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-12

蚂蚁百灵开源的Ling-3.0-tiny是一款总参数7.9B、激活参数仅1.3B的轻量混合推理MoE模型,可在MacBook等端侧设备运行,FP8精度下MacBook输出约86–90 tokens/s,8K上下文峰值内存仅8.34GiB,且数据全程本地留存。

腾讯研究院AI速递(2026-08-12)报道,蚂蚁百灵开源轻量混合推理MoE模型Ling-3.0-tiny,提供BF16、FP8、INT4三个版本,支持MacBook、Mac mini、DGX Spark等设备运行。该消息属于“生成式AI”板块。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-12

OpenAI 发布的企业调研显示,企业正从将 AI 用于辅助性工作转向使用 Agentic AI(智能体)来直接执行任务,前沿企业在这一轮采用中已明显拉开差距;具体数据与案例细节待核实。

本卡片基于 OpenAI 官网文章《From assistance to execution: How enterprises put AI to work》(来源 URL 见下)。 研究问题:企业如何实际采用 AI?尤其是以 ChatGPT 和 Codex 为代表的工具,如何从“辅助人类”走向“自主执行”?哪些企业在采用中走在前列?

产业观察 · 原始来源:OpenAI · agent
事件日期 2026-08-12

Anthropic 给尚未发布的 Claude 研究版本布置“攻克黎曼猜想”的任务。Claude 提出的 650 个思路均失败,却意外将 ζ 函数临界线上零点比例下界从 41.6% 提升到 67.2%,并提供了 Lean 形式化证明;但该方法预计无法直接导向最终证明。

研究对象:黎曼 ζ 函数的临界线零点下界问题。 事件:Anthropic 使用未发布的 Claude 研究版本尝试攻克黎曼猜想;Claude 提出 650 个思路均失败,但意外获得了一个数值下界上的显著提升。 结果性质:不是“证明黎曼猜想”,而是将临界线上零点比例下界从 41.6% 提高到 67.2%。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-12

VAKRA 是一个面向企业级代理的可执行基准,将结构化 API 调用与文档检索结合在同一评测中,并引入自然语言工具使用策略约束。评测发现当前最强模型在组合 API 任务上仅约 50% 准确率,在策略约束下的不可回答查询上最低仅有 2.4%。

现有基准通常分别评估 API 调用能力和知识检索能力,但企业代理实际部署中需要同时跨结构化 API 和文档集合进行推理,并遵守工具使用策略。该论文提出 VAKRA 基准来填补这一评估空白。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-12

在干细胞来源的皮质类器官中,放射状胶质前体(radial glial progenitor, RGP)的谱系进展出现时间解耦:增殖过程高度可塑,克隆来源的神经元多样性降低;这提示非细胞自主微环境线索的缺失,是导致皮层谱系进展无法忠实按时间控制的关键因素。

该论文于2026年8月12日在线发表于《Nature》(doi:10.1038/s41586-026-10916-7)。研究通过干细胞来源类器官中的RGP谱系追踪(lineage tracing),探究皮质发育过程中神经元生成的时间顺序为何在类器官模型中不能像体内那样精确重现。具体研究背景、假设和实验问题表述待核实。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-12

StateFlow 的核心主张是:预可视化(previsualization)缺少的是一个显式、持久的可编辑 3D 世界状态;相比一次性文生视频,把生成过程组织为“构造世界状态—演化世界状态—访问世界状态”三个阶段,能提供更强的控制能力和迭代编辑支持。

在影视、游戏、建筑和城市设计等领域,预可视化是“想法”与“最终制作”之间的中间层,创作者需要迭代调整场景、动作、相机以及时空动态。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-12

本文提出 RCI 框架,将安全离线强化学习中的轨迹级稀疏“停止反馈”转化为稠密逐步成本,在理论上保持可行策略集和最优拉格朗日量不变的前提下,改善成本评论员的学习条件,并在高速驾驶和机器人操作任务中显著降低违规率。

安全离线强化学习通常假设有稠密的逐步成本标注;但在实际中,监督者往往只能提供轨迹级停止反馈:在第一个不安全转移处给出一个二元信号,没有逐成本归属。 作者将该问题建模为时间信用分配问题,并提出基于再分配的成本推断框架 RCI。 论文的核心问题:如何只利用稀疏、无逐项归因的停止反馈,训练出安全且性能可用的离线策略。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-12

SpaHybGen 是一个“学习+优化”混合机器人抓取框架:先用神经网络从噪声深度观测中提取与具体机械手无关的空间接触特征,再用可微优化器为关节型多指手计算稳定抓取;一次训练后可在零样本条件下驱动 7 种不同机械手(2–5 指),在半杂乱场景中的抓取成功率为 94.3%–98.0%,并实现密集杂乱场景下 20 Hz 动态抓取和多手协调。

机器人学的长期目标:通用智能体能够学习跨硬件、跨环境的基础技能。 现有操作学习存在根本错配:深度学习策略数据效率高但硬件绑定;解析式规划器硬件无关但抗感知不确定性差。 本文提出的 SpaHybGen 通过“习得的通用接触表示”统一二者优势,用共享接触界面把感知与动作解耦,为通用机器人操作提供一条路径。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-12

在 Russell 2000 小盘股组合构建中,将“纯 alpha”和“纯 beta”分开触发通常比要求两者同时触发更好;摘要报告的最强保守配置为“纯 beta + GPT-4o mini 情绪 + Student-t 目标 + 40 天持有期 + 风险平价”,在 100 bps 交易成本下 Sharpe 达 2.33。

Large Language Model-Driven Small-Capitalization Trading: Integrating Financial News Sentiment, Macroeconomic Indicators, and Technical Signals

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-12

DreamFly 是一个基于扩散模型的航空视觉-语言导航(Aerial VLN)框架,通过“因果对齐的历史记忆 + 滚动时域扩散规划 + 轻量显式停止预测”三项设计,在 OpenFly 基准的 seen/unseen 测试集上均取得当前最优的成功率(SR)和路径加权成功率(SPL),并实现最低导航误差。

航空视觉-语言导航要求智能体在部分可观测条件下,随时间整合视觉证据、规划未来动作,并判断是否到达导航目标。虽然现有视觉-语言-动作(VLA)模型提供了感知到动作的端到端范式,但在航空导航中仍面临三个挑战:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-12

CAZO 是一种面向测试时适应(TTA)的改进零阶优化方法:通过滑动平均估计对角 Hessian 构造协方差矩阵,用各向异性扰动采样降低零阶梯度估计的方差,从而只用前向传播即可更新少量适配器参数,在节省内存的同时提升 TTA 性能(性能提升幅度待核实)。

测试时适应(TTA)希望利用无标注测试数据提升预训练模型的跨域表现。 现有 TTA 大多依赖反向传播(BP)微调模型,内存开销大;零阶(ZO)方法只靠前向计算估计梯度,更适合设备端部署,但梯度估计方差显著高于一阶方法。 本文要解决的问题是:如何在不做反向传播的前提下,降低 ZO 梯度估计方差,使基于 ZO 的 TTA 在精度和内存之间取得更好平衡。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-12

本研究提出并验证了一种利用检索增强生成(RAG)与大语言模型(LLM)自动构建动态主逻辑模型知识图谱(KG-DML)的框架,可在大型复杂系统上实现可重复的稳定重建,将技术文档转化为可执行的功能模型。

动态主逻辑(DML)提供了一种层次化框架,将系统功能目标与底层结构元素关联起来,从而表示系统行为。然而,DML的构建通常依赖专家对技术文档的解读,难以扩展到复杂系统。本研究的核心问题是:如何从系统描述中自动构建DML模型,并以知识图谱形式表示,以支持后续的诊断与可靠性分析。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-12

本文是对2016年以来57篇以方法为中心的类激活映射(CAM)视觉解释文献的系统综述,识别出该领域从单层CNN类别得分解释向对比式、多层、概率化、token感知和基础模型感知解释的总体趋势,同时指出评估协议仍然碎片化。

研究问题:CAM类方法如何从最早的全局平均池化CNN分类器解释演变为覆盖Transformer、CLIP、DINO、SAM及特征分布比较等基础模型时代的方法?现有方法在归因机制、架构依赖和评估目标上如何分类?各方法贡献和遗留缺口是什么? 综述范围:严格筛选的57篇以方法为中心的论文,时间范围从2016年CAM首次提出至今。 方法覆盖:包括基于梯度的后验解释…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-12

AVA-Encoder 提出了一种“智能体原生”的视频表示学习框架,将视频转化为知识图谱、再重建回视频,从而让创意智能体能够从高质量电影中学习,并在可控条件下大幅超越人工设计的策略。

研究问题:创意智能体缺乏从高质量电影中有效学习的表示方法,现有视频表示难以同时满足“忠实于影片内容”和“可供智能体直接推理、查询与编辑”的需求。 核心思路:提出 Agentic Video Auto-Encoder(AVA-Encoder),通过“智能体自编码”机制学习面向智能体的视频表示,而非仅面向人类观看或常规下游任务。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条