AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 961-980 条,共 2259 条
第 49 / 113 页
事件日期 2026-08-06

FDE(Forward Deployed Engineer,前线部署工程师)模式兴起的核心原因,是 AI 落地的矛盾正从“模型能不能做”转向“组织怎么用”;其本质不是新岗位,而是一种把前线经验沉淀为可复用资产的交付模式,从而显著降低下一个同类客户的交付成本。

腾讯研究院发布报告《前线共创,双向赋能:FDE 模式行业观察与实践》,首次系统分析 FDE 模式为什么在当下爆发、解决了什么问题、能否规模化,以及中国市场的特殊路径。报告指出,大模型能力每季度都在跃升,但超过 60% 的企业 AI 试点仍停留在实验阶段;瓶颈不在 Demo 演示,而在于系统对接、权限梳理、流程改造、合规审计、组织适应,以及客户是否想清楚“到…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-06

马斯克认为源代码正变成“下一个汇编”,主张让AI直接生成高效的二进制文件,彻底摒弃源代码;但《代码整洁之道》作者Bob大叔、UML之父Grady Booch等业界元老集体反驳,指出只要需要精确、可重复地描述意图,就仍属于编程语言。

腾讯研究院AI速递20260806报道,马斯克在X上发文称,源代码正变成下一个汇编语言,下一步应彻底摒弃源代码、让AI直接生成高效的二进制文件。该观点引发软件工程界多位元老反对。争论的核心在于:编译器是确定性翻译,而AI是概率性生成;人类能否信任一套自己看不懂的工程体系,成为根本问题。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-06

智能体正从“能聊天”走向“能干活”,执行权从人转向智能体;企业管理的成本结构、组织设计、绩效评估与安全治理都需要因此重构。

本文作者刘琼(腾讯研究院,首发于《企业管理》杂志)观察2026年前后的智能体浪潮:开源智能体平台OpenClaw上线两个月,GitHub星标数超过Linux内核;Mac Mini因被大量购买用于运行OpenClaw而断货;中国每日AI运算量从2024年初约1000亿Token增至2026年3月约140万亿Token,两年增长1400倍。文章认为这不是单纯效…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-06

腾讯混元Hy3模型已接入创意智能体Miora,作为“画布背后的思考模型”理解需求并统筹图像、视频、3D和界面设计;Miora借此更擅长把模糊中文需求拆解为完整品牌视觉项目并规划多交付物,减少返工与成本。

这条信息来自“腾讯研究院AI速递 20260806”中的生成式AI新闻。报道称,腾讯混元Hy3正式接入创意智能体Miora,定位为“画布背后的思考模型”,负责理解需求并统筹图像、视频、3D与界面设计。同时公布的Hy3技术要点包括MoE架构、总参数295B、单次激活21B、最大支持256K上下文。官方评测称,部分能力可达两至五倍参数旗舰模型水平。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-06

Claude Code创始人Boris Cherny提出“一人军队”概念:未来最高效的开发者更像CEO,带领数十个AI Agent把产品从想法做到上线;工程实现不再是瓶颈,好想法与推向市场的能力成为新的稀缺资源。

腾讯研究院AI速递(2026-08-06)援引观点称,Claude Code创始人Boris Cherny认为,AI Agent将彻底改变软件开发的组织方式。最高效的开发者不再是亲写代码的程序员,而是像CEO一样统筹多个Agent,完成从想法到产品的全过程。他同时指出,仅在编辑器中增加AI按钮不足以提升生产力,Anthropic通过逐个清理瓶颈,使人均代码…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-06

UQ-Loc 通过在 LightLoc 架构上增加各向异性高斯协方差头,让 LiDAR 场景坐标回归(SCR)模型输出逐体素的不确定性,从而在提升 6-DoF 定位精度的同时给出良好校准的协方差估计。

LiDAR 场景坐标回归(SCR)直接将点云映射到 3D 场景坐标,无需显式地图检索即可实现精确的 6-DoF 定位。但现有方法只输出确定性预测,丢弃了可能有助于鲁棒性和下游决策的偶然不确定性(aleatoric uncertainty)。UQ-Loc 旨在显式建模这种不确定性,并将其用于定位求解流程。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

TYTAN 将符号化的数据库分析与 LLM 语义推断结合,并只在证据不足时向用户追问,从而自动从关系数据中构建分析语义模式;在摘要报告的评测中,覆盖率和检索指令可执行率均达到 100%(1,678/1,678),语义角色与参考模式的一致性为 92–100%。

从自然语言查询接口到自动报告生成,数据分析工具都需要一个关于数据的“语义层”描述:数据涉及哪些真实世界实体、哪些列是度量或标识符、表之间如何连接成分析单元。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

TS-RAG 提出了一种将检索增强生成(RAG)用于时间序列预测的新框架,通过专门的 reference tokens 融合输入序列与检索到的相似序列,并在多个真实世界预测基准上宣称取得了一致的先进性能(具体数值待核实)。

尽管基于 Transformer 的深度学习模型在时间序列预测中表现亮眼,但 RAG 在该领域的应用仍然有限。RAG 在大型语言模型中已被证明能通过引入相关外部信息增强能力,因此研究者想验证:检索相似时间序列作为参考,是否也能提升时间序列预测的准确性?然而,大多数时间序列模型受限于训练数据规模小、参数规模小,缺乏大语言模型那样的生成能力,简单地把参考序列拼…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

TrajDebug 提出一种按“错误生命周期”追踪 LLM 智能体长轨迹的新框架,通过区分局部错误与真正导致最终失败的关键错误,在多个智能体基准上取得最优总体性能,并配套构建了 486 条人工标注的失败轨迹基准 TrajErrBench。

LLM 智能体在复杂领域表现强大,但长轨迹中容易出现级联错误且难以调试。关键错误检测的目标是定位失败轨迹中“导致最终失败的最早错误步骤”。该任务面临两大挑战:第一,长轨迹中判断某一步是否出错的证据可能分散在相距很远的指令、观察和上下文中;第二,失败轨迹往往包含多个局部错误,但它们对最终失败的影响不同,只有其中一部分真正对失败负责。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

Nimblemind多智能体系统(nMAS)能够在心力衰竭电子健康记录(EHR)数据上自动生成可审计、可追溯的特征,使HFrEF表型分型的held-out AUROC从0.895提升到0.963,HFpEF从0.870提升到0.910。

EHR特征工程是临床研究和AI开发的主要瓶颈,约占数据科学家工作量的39-45%。心力衰竭影响约670万美国成年人,其EHR数据分散、碎片化,需要结合疾病特异性和基于指南的临床推理,因此特征工程尤其困难。现有基于规则和基于大语言模型(LLM)的方法只能部分自动化,且可维护性和证据可追溯性有限。本研究提出并评估了一个自动化的心力衰竭特征工程流水线。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

本文发布了一个专家验证的孟加拉手语(BdSL)图像数据集 RSBdSL38,并提出了一个仅 298,470 参数的轻量注意力卷积网络。该模型从零训练在 RSBdSL38 上达到 96.37% 准确率(五种子均值 95.72% ± 0.54%),性能接近九种 ImageNet 预训练高效架构的最优水平,但参数量和计算量低一个数量级以上;量化后可在普通智能手机…

孟加拉国聋人和听障人士主要使用孟加拉手语(BdSL)交流。若能在个人设备上自动识别 BdSL,有望扩大教育与服务的可及性。现有系统使用的数据集多来自受控环境、缺乏专家验证,且依赖重量级预训练骨干网络,不适合端侧部署。本文构建了专家验证的 RSBdSL38 数据集,并提出一个轻量级从零训练的注意力卷积模型,以弥合基准性能与实际部署之间的差距。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

本研究提出并外部验证了一个基于 Mask R-CNN 的牙齿定位与编号模型(TLNM),仅用智能手机拍摄的口腔照片即可实现牙齿级别的检测、编号和分割;在内部测试集和独立外部数据集上均取得较高性能,且以开源容器化 API 形式提供推理管线。

口腔健康问题影响全球数十亿人,但专业牙科护理的成本和可及性限制了预防性口腔保健的推广。已有研究多依赖临床级放射影像或口内相机图像,普通公众无法用于自我筛查。本文针对这一缺口,开发并验证一个可使用消费级智能手机照片进行牙齿定位、编号和分割的模型。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

GEM-3 提出了一种可配置时间步长的概率全球天气预测模型,用同一套权重在推理时选择不同时间步长,从而在短期精细预报与长期误差累积之间取得平衡。

现有机器学习天气预报模型依赖预先固定自回归时间步长(如 1–6 小时或 24 小时)。较短时间步长能精细刻画日循环内的大气动力学,但在给定预报时效内会累积更多误差;较长时间步长能减少误差累积,却限制了日以下尺度高可预报性的短期预报可用性。GEM-3 旨在通过显式多时间步推断来解决这一权衡。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

SG-TULA 是一种直接使用次梯度并借助驯化(taming)技巧的显式 Langevin 采样算法,适用于势能同时非光滑、具有超线性梯度增长且非凸的目标分布;它在 Wasserstein-2 距离下给出非渐近收敛界,并在 GPT-2 谱系语言模型的正则化预训练势能上验证了假设,其坐标式增强变体在以预训练任务对比微调后的 AdamW 与 Muon 时具有竞…

研究问题:如何从势能(potential)同时满足非光滑、超线性梯度增长、非凸的分布中高效采样。 传统 Langevin 类算法的非渐近分析通常依赖光滑性;当势能非光滑时,常见做法是引入计算代价高的光滑化步骤。本文提出绕过光滑化程序的次梯度方法。 目标包括:获得显式的、所有常数随维度和逆温度跟踪的非渐近收敛界,并为相应优化问题提供超额风险(excess r…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

视频语言模型在看似简单的视频事件计数任务上存在系统性时间推理失败:即便是低频事件,模型也可能完全无法可靠计数;提高采样率可以提升最终答案的分数,却无法带来忠实的事件级恢复。

真实世界视频基准虽然覆盖广,但固定片段将事件数量、频率、持续时间和视觉复杂度纠缠在一起,难以隔离失败原因;已有程序化基准虽有更好控制,但只对最终答案评分,没有根据可执行的真值轨迹来审计模型报告的事件。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

“用图像思考”让多模态大模型调用裁剪/缩放等视觉工具来“看图”,但因果审计发现:即使聚合准确率有提升,视觉工具使用在大范围 rollout 中并不因果有效;提升集中在少数校准良好的轨迹上,因此存在“视觉工具使用的幻觉”。

研究问题:模型调用视觉工具后返回的观测证据,是否真的因果地影响了最终答案? 背景:已有“thinking-with-images”模型使用工具后,相对直接推理往往只有边际甚至负收益,而 token 成本高得多;模型还可能反复裁剪无关区域,并在直接推理能答对的问题上失败。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

将工具调用从“原生 JSON 调用”改为“程序化工具调用(Programmatic Tool Calling, PTC)”,在 BFCL v4 基准上对 14 个语言模型的评测中,多数情况下能匹配甚至超越原有基线,并在并行与上下文退化条件下表现更稳定;但部分细节因未能抓取论文正文而待核实。

本文系统评估了“工具即代码”这一范式:让模型通过代码(而非固定 JSON)来调用外部工具,从而把工具调用扩展为可自然链式组合、并行执行的脚本。研究问题主要有两个:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

Surv-IPTB 提出了一种基于注意力机制的框架,将生存数据中的个体治疗获益概率(IPTB)估计转化为二元分类问题,并在非线性合成数据集上相比传统 meta-learner 基线表现更稳健。

在生存分析中,医生需要知道“某个具体患者接受治疗后,生存时间是否比不接受治疗更长”。传统方法通常估计平均或条件平均治疗效果,难以直接给出个体层面的概率。该研究提出 Surv-IPTB,直接估计个体在治疗 vs 对照下获得更长生存时间的概率。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

本文提出一个强化学习框架,在持久图(Persistence Diagram, PD)空间上定义可控制的随机动力学,使持久图可以通过拓扑感知的局部编辑逐步演化,并能在保留主要拓扑结构的同时降低图的复杂度。

Stochastic Dynamics on Persistence Diagram Space via Reinforcement Learning

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条