AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1321-1340 条,共 2259 条
第 67 / 113 页
事件日期 2026-07-28

NVIDIA 推出的 GPU 原生医疗物理仿真框架(Medical Physics Simulation)通过经典物理求解器和生成式世界模型,解决了医疗机器人领域数据稀缺、泛化困难与开发周期长(4–7 年)三大核心挑战,为大规模强化学习训练提供了实时、高保真的仿真基础设施。

医疗机器人开发无法像自动驾驶或工业机器人那样依赖互联网规模的数据收集或无限的真实世界实验,每一条演示都需要专业设备、临床专家和患者/实验室环境。这导致三个根本问题:数据缺口(通常仅有数百条演示)、泛化困难(长尾临床场景难以覆盖)和开发速度慢(依赖顺序性的台架模型、动物实验等,迭代需要数月)。NVIDIA 于 2026 年 7 月 28 日发布博客,介绍了其…

产业观察 · 原始来源:NVIDIA 博客 · ai-industry
事件日期 2026-07-28

宇树科技发布轮足机器人 As2-W,仅 25 kg 的机体可实现 150 kg 站立负载,具备高速滑行、长续航和复杂地形适应能力,并可选配 AI 大模型完成自然语言指令理解与自主巡检。

宇树科技于 2026 年 7 月发布轮足机器人 As2-W。该机器人在四腿末端加装 7 寸轮毂,通过锁死关节实现平地滑行,速度超过 6 m/s;整机连电池约 25 kg,却搭载工业级关节模组,站立负载达 150 kg。续航超 3 小时,单次行程可达 33 公里,官方演示视频在 X 平台浏览超 600 万次。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-28

英伟达CEO黄仁勋发起开源模型公开信,获得包括微软纳德拉、Meta杨立昆等70余家机构签署,OpenAI也加入,唯独Anthropic未签约,其员工以反讽方式回应;该倡议被认为暗含巩固英伟达推理算力护城河的商业博弈。

黄仁勋发起一份呼吁支持开源AI模型的公开信,迅速获得科技界广泛响应。截至报道时间,已有70余家机构或个人公开签署,包括微软CEO萨提亚·纳德拉、Meta首席AI科学家杨立昆等。OpenAI也加入了签署行列,而AI安全公司Anthropic是唯一明确未签署的知名机构。该帖子的阅读量超过6000万次。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-28

一份新报告表明,科学家正在利用AI编程智能体(coding agents)来推动科学计算的现代化,从而加速基因组学等领域的软件开发和发现进程。具体细节需从完整报告获取。

OpenAI 发布了一份行业报告(field report),主题为“智能体AI时代下的科学计算”。报告展示了研究人员如何借助AI编码智能体来更新传统科学计算软件,提升开发效率,并促进包括基因组学在内的多个科学领域的突破性发现。目前仅知元数据,完整报告内容待核实。

产业观察 · 原始来源:OpenAI · agent
事件日期 2026-07-28

Sam Altman在近期公开发言中指出,AI能力已沿着指数曲线进入“奇点”状态。他观察到,小型团队借助Coding Agent仅用数周就能完成过去需要一整年才能做出的产品原型,开发节奏被彻底改变。但他同时批评多数创业公司的应对方式仍然“太像十年前”——仅仅减少招聘人数、增加Token使用量,这远远不够。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-28

美团开源了总参数1.6T、平均激活约48B的万亿参数模型LongCat 2.0,原生支持100万超长上下文,是首个在五万张国产算力卡上完成全流程训练推理的万亿模型;同时上线全场景AI Agent平台CatPaw,已覆盖美团内部9万员工、搭建3万个Agent,并融入本地生活全链路认知与专家技能。

美团于2026年7月28日正式开源LongCat 2.0模型,并上线搭载该模型的AI Agent平台CatPaw。LongCat 2.0采用MoE架构,总参数量达1.6T,每个token平均激活约48B参数,原生支持100万token的超长上下文。该模型是业界首个在五万张国产算力卡上完成从训练到推理全流程的万亿参数模型。CatPaw平台支持移动端与PC双端…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-28

蚂蚁集团inclusionAI团队开源的千亿参数MoE扩散语言模型LLaDA2.2,首次让扩散模型在长程Agent任务中能力接近顶尖自回归模型,且吞吐量更高(BF16平均为自回归模型的1.64倍),真正实现了“边行动边纠错”。

LLaDA2.2是全球首个大规模Agentic扩散模型,原生支持128K上下文。它通过Levenshtein编辑范式、基于环境反馈的强化学习(L-EBPO)以及BlockRouting架构,解决了扩散模型在Agent场景中结构刚性和模型崩溃两大痛点。该模型在七大Agent基准上的平均分为53.83,与顶尖自回归模型Ling-2.6-flash(55.74)…

产业观察 · 原始来源:量子位 · agent
事件日期 2026-07-28

VetClaw 将摄像头等边缘感知设备与云端视觉-语言模型(VLM)结合,通过分离智能体交互与工作流编排,实现零样本的兽医疾病初筛;仅依赖图像时 VLM 性能有限,而结合症状描述的多模态输入可提升零样本分类效果。

针对早期兽医疾病筛查场景,现有静态图像分类方法缺乏与环境交互、工具调用及安全处理的能力。VetClaw 提出一种边缘-云多模态智能体系统,旨在将静态预测模型转化为可协调工作流、处理故障并生成诊断支持警报的安全感知系统。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

MILD 是一种将自驱动网络的意图保证从被动漂移检测转向主动故障预测的框架,通过教师增强的混合专家架构实现多意图故障预测与根因归因,并在模拟/微服务/SDN测试床中验证了高检测率和长预警提前量。

自驱动网络依赖监控、分析、执行三大宏意图的紧密耦合,但一个宏意图内的单一故障会像“共漂移”一样传播,引发其他意图的级联症状异常。现有反应式方法难以区分真实根因意图与表现症状意图,且阈值检测无法提供足够时间进行主动修复。本研究提出**MILD**,将意图保证从反应式漂移检测重构为主动故障预测。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

GARFIELD 通过一个统一的潜在表示同时实现未来轨迹的快速采样和运动概率密度的直接估计,在运动规划性能与大型视频生成模型相当的情况下,轨迹采样速度快 97 倍,密度估计比蒙特卡洛采样快两个数量级。

从部分观测(如单张图像或稀疏时空约束)预测场景如何演变,需要推理多种可能的未来,而非只输出一条轨迹。现有方法要么生成外观主导的视频预测,要么采样少量轨迹,但未显式建模运动分布,导致无法系统量化不确定性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

Reinformed Dreamer 通过一种新的非对称表征学习目标(潜在引导)改进了基于模型的强化学习,相比之前的非对称方法(如 Informed Dreamer)在多个基准上更稳定地超越 Dreamer 基线。(待核实具体改进幅度)

强化学习算法除了奖励信号外,是否还能利用额外的监督信息来学习更好的表征与行为?非对称强化学习(Asymmetric RL)在部分可观测(额外状态信息可用)和完全可观测(更精细状态信息可用)的设置下都已被证明有效。本文聚焦于基于模型的强化学习,研究非对称学习对观测表征和特权信息表征的影响,并指出 Informed Dreamer 在特权信息表征上存在局限性,…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

通过三阶段改造(优化测试集与校准沙箱、组合正确性与速度的奖励设计、适配稀疏噪声环境的GRPO训练),强化学习可成功从代码正确性扩展至代码优化,在DMC-Optim上使top‑50% pass@1提升约13个百分点,且保持纯正确性分数不变。

将强化学习从代码正确性(生成通过隐藏测试用例的程序)扩展到代码优化(同时追求更快的执行速度)看似简单——只需在奖励中加入执行时间。但实际中,测量噪声、奖励稀疏以及GRPO不稳定会淹没信号,导致生成的解速度提升极小且失败率升高。本文系统性地解决了这三个障碍,使执行时间变得可学习。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

Quasi-SVD通过仅强制一个因子矩阵严格正交(李群参数化)、另一个因子通过软约束恢复的非对称设计,实现了完全并行的GPU矩阵分解,在医学成像任务中达到3-20倍加速和超过25 FPS的临床实时吞吐量,同时保持SSIM 0.89-0.94的重建保真度。

奇异值分解是计算成像中矩阵分解任务的基石,但传统SVD算法本质上是顺序执行的,这限制了在GPU上的实时吞吐量,难以部署于临床在线工作流。本文提出并验证了Quasi-SVD框架,旨在替代经典SVD,实现**实时图像引导医疗流程**所需的即时矩阵分解。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

现有最先进的大语言模型(LLM)在充当政治信息中介时,高聚合得分掩盖了系统性失败:它们在信息清晰时表现可靠,但在信息缺失、模糊或矛盾时频繁崩溃,同时会扁平化政治语言强度,且失败可能受政党先验和输出语言影响;目前没有模型能一贯可靠地完成这一中介任务。

随着LLM越来越多地中介公民所依赖的政治信息,缺乏标准化方法来评估其是否负责任地承担这一角色。已有研究将任务视为“信息再现”而非“信息中介”,未涉及认识论维度及与不完美信息的交互。本研究提出Polistemics基准,基于公民认识论能动性推导出的规范标准“Epistemic Modesty”,在可控设置中变化信息的清晰度、噪声和一致性,评估LLM作为选举政…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条