AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1701-1720 条,共 2269 条
第 86 / 114 页
事件日期 2026-07-17

小米发布具身基座模型 Xiaomi-Robotics-1,利用 10 万小时真实操作数据和约 1 万小时跨本体数据训练,验证了机器人策略模型的 Scaling 效应,以每任务不足 10 小时数据即可适配复杂新任务,并在多个仿真基准排名第一。

小米推出具身基座模型 Xiaomi-Robotics-1(英文名称)。该模型基于 10 万小时 UMI(Universal Manipulation Interface)真实世界操作数据预训练,并结合约 1 万小时跨本体数据进行后训练,能够“开箱即用”执行移动操作任务。研究人员通过实验验证了机器人策略模型的 Scaling 效应:预训练数据量与模型规模扩大…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-17

Mira Murati 创办的 Thinking Machines Lab 发布首款自研混合专家模型 Inkling(总参数 9750 亿、激活 410 亿),100 万 token 上下文,完整开放权重;同时推出集成 RGB 指示灯和摇杆/旋钮的实体硬件,用于可视化多 Agent 工作流状态。

Thinking Machines Lab 发布其首个自研基础模型 Inkling,采用混合专家架构,总参数 9750 亿、每步激活 410 亿,支持最长达 100 万 token 的上下文窗口。模型使用 45 万亿 token 的多模态数据预训练,原生支持文本、图像、音频跨模态推理。同步推出轻量版本 Inkling-Small 预览版,完整权重已在 Hu…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-17

MiniMax 正式更新 Code 2.0 桌面端,基于开源框架 Pi Agent 重构底层架构,改善长程任务执行稳定性,并针对金融场景实现多源数据原生接入,即将上线远程控制与浏览器操控功能。

MiniMax 发布了 Code 2.0 桌面端更新,核心变化是底层架构基于开源框架 Pi Agent 全面重构,重点解决长程任务执行中出现的模型中断、卡死以及上下文衔接问题。同时产品在原有效能基础上增强了图表查看(全屏、缩放、下载)、文件预览(框选编辑并直接保存)等功能,并在金融模块打通了恒生金融数据库和企查查 MCP,实现多源数据原生接入。官方计划本月…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-17

腾讯元宝通过接入京东AI Agent,实现了用户在对话中直接完成商品搜索、推荐到购买的完整闭环,标志着AI助手从“回答问题”向“解决问题”演进的关键一步。

腾讯元宝(AI助手)与京东AI Agent达成合作,京东成为首个接入元宝的电商垂域伙伴。用户在元宝内搜索商品时,回答中会智能匹配商品卡片,点击即可跳转至京东购物小程序,覆盖数码、家电、服饰、美妆、生鲜等全品类,无需退出对话即可完成购物闭环。元宝负责信息反馈,京东依托供应链与电商体系提供商品推荐、履约及售后服务。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-17

昆仑万维天工短剧工作台通过“Agent智能分镜+无限画布”双轨模式将导演思维拆解为六个可视化环节,有效解决AI短剧中的角色变脸、站位漂移等一致性问题,上线三部AI短剧7天均实现百万美元级营收。

2026年7月17日前后,昆仑万维宣布天工短剧工作台升级,引入“Agent智能分镜+无限画布”双轨创作模式,将导演思维具象化为六个可视化环节,旨在解决AI生成短剧中常见的角色变脸、站位漂移等镜头一致性问题,并支持企业级多账号管理和英文短剧全流程生成,助力内容出海。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-17

Keep Yelling Assistant (KYA) 通过结合视觉感知(YOLOv8)与情感自适应的大语言模型,实时检测危险驾驶行为并生成符合用户偏好的情绪化语音反馈(如中性、幽默、分析性),在用户研究中最高评分达 4.29/5.00(YOLOv8s + ChatGPT-4o 组合)。

现有自动驾驶/辅助驾驶中的视觉语言模型虽已具备感知和推理能力,但几乎不考虑情绪维度或真实用户体验。本研究旨在填补这一空白,开发一个能实时检测高风险驾驶行为(如突然切入)并生成具有情绪表达力、可适配驾驶员偏好的语音反馈系统。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

VideoTreeSearch(VTS)通过将长视频组织成自适应时间树,并训练智能体使用 zoom_in、zoom_out、shift、answer 四种操作进行迭代自纠正搜索,在定位长视频问答任务上显著超越现有智能体方法,同时其学得策略可泛化至通用长视频问答。

现有基于智能体的方法仅依赖单一 **crop_video(start, end)** 动作进行多轮探索,只能从粗到细缩小范围,缺乏从细到粗的回溯原语。这导致智能体容易过早收敛,无法从早期错误中恢复。VTS 将定位长视频问答(Grounded LVQA)重新建模为在自适应时间树上的迭代自纠正搜索。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

PagedWeight 通过运行时动态量化 MoE 大语言模型的专家权重,在保持 FP16 等效精度的同时,最高可节省 72.0% 的 GPU 内存并提升 1.94 倍吞吐量;在相似内存预算下,模型质量比现有量化方法提升高达 39.3%,吞吐量损失不超过 4.1%。

Mixture-of-Experts(MoE)是大语言模型中一类流行的架构,兼具高效率和准确性。然而在 KV 缓存密集的服务场景中,模型权重的 GPU 内存需求与不断增长的 KV 缓存之间存在竞争。传统的静态量化方法无法动态适应负载变化,导致精度–内存–吞吐量之间的折衷难以最优。PagedWeight 提出一种运行时动态量化管理方法,实时调整 MoE 各专…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

MotionForesight 仅使用 4 万段人类-物体交互的日常单目视频,通过冻结大型视频预测模型并训练轻量适配器,实现了对操作物体未来 3D 轨迹的预测,在多种分布外场景下超越使用百万级视频训练的更大模型。

人类能通过被动观察推断物体可能的运动方式(如杯子被拿起、抽屉被滑动、盖子旋转闭合),这种预测能力对于物理交互和具身智能至关重要。本文研究如何从普通的单目视频(记录人类与物体交互)中学习这种预测能力。给定一小段观察到的视频上下文,MotionForesight 预测被操作物体上各点的未来 3D 轨迹,将交互预测转化为以物体为中心的 3D 运动预测,且不对物体…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

ShellFlow模型在仅使用壳条件和不变质量公式作为物理先验的情况下,从约10⁹个真实LHC对撞事件中学习到了标准模型的多方面结构,包括共振质量、弱混合角、W和顶夸克质量以及未在训练目标中出现的粒子间关联。

传统对撞机数据分析依赖蒙特卡洛模拟来生成标准模型过程,但单一模拟样本无法覆盖从亚GeV到TeV连续谱的五个数量级的不变质量范围。本研究旨在回答:能否直接从记录的对撞数据中学习标准模型的结构,而不需要模拟器作为中介?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

UAV-DualCog 是首个联合评估无人机自身状态推理与外部环境状态推理的基准,测试表明当前最强多模态大语言模型(MLLM)在该双认知任务上远未达到可靠水平,尤其在视角转换、精确定位和时间区间定位上存在严重瓶颈。

现有无人机(UAV)场景下的 MLLM 基准主要评估场景理解、事件识别或导航完成,缺少对 UAV 智能体所需“双认知”能力的联合测试——即同时对无人机自身状态(视角、姿态、运动轨迹)和外部环境(地标、目标、时空关系)进行推理。本文提出 UAV-DualCog,从双认知视角出发,构建面向无人机多视角时空推理的基准,要求模型不仅给出离散答案,还需提供空间或时间…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

FVAttn是一种无需训练的稀疏注意力系统,通过运行时负载均衡和松弛感知稀疏增强,在多GPU序列并行下实现了自适应稀疏注意力的高效分布式执行,在Wan2.2 I2V模型上获得4.41倍注意力加速和2.02–2.11倍DiT推理加速,同时保持有竞争力的视频质量。

视频扩散Transformer处理长时空序列,自注意力成为高分辨率视频生成的主要计算瓶颈。无训练稀疏注意力可以降低计算开销,但自适应Top‑p路由在多GPU序列并行下导致各个注意力头的工作负载不均衡,从而将稀疏注意力转化为一个“秩级拖后腿”(rank-level straggler)问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

开源大语言模型(4B–120B参数)在将自动驾驶车辆漏洞描述自动转换为结构化威胁信息(STIX)方面表现良好,单项任务F1最高可达0.99,但完整映射MITRE ATT&CK仍具挑战;多智能体设置下效果有所下降。

联网自动驾驶车辆(CAV)的软硬件组件(传感器、ECU、车载娱乐系统、远程信息处理单元)存在多种漏洞,这些漏洞通常以纯文本形式记录于CVE数据库。安全从业者需要结构化信息(受影响资产、弱点类型、攻击行为)才能有效缓解风险。本研究评估开源大模型能否自动将CAV相关CVE描述转换为STIX(结构化威胁信息表达)格式,包括STIX领域对象(SDO)、关系对象(S…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

CLIFE 提出一种在单个边缘设备上运行的无目标在线标定与轻量级晚期融合的相机-激光雷达框架,在 12 个实际交叉口部署验证,实现在 Jetson AGX Thor 上 53.2 FPS 的高吞吐率,为边缘侧实时路边感知提供了可行的基础方案。

背景:在遮挡、光照变化和恶劣天气下,可靠的路边易受伤害道路使用者(VRU)感知仍具挑战,现有的多传感器融合系统多依赖云端或服务器级基础设施,难以在真实交叉口边缘部署。 目标:设计一种完全在单个嵌入式设备上运行、无需云端卸载的边缘原生相机-激光雷达融合框架,兼顾实时性、低延迟与部署可行性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

AutoModSAT 利用大型语言模型(LLM)自动发现并优化 SAT 求解器的启发式策略,在多个基准测试中性能相比基线求解器提升 40%,相比当前最优求解器提升 30%。

SAT 问题(可满足性问题)是计算复杂性理论的基础问题,并广泛用于工业应用。现代 SAT 求解器架构复杂,传统自动配置框架需要人工定义搜索空间,难以自动适应新问题的启发式策略。本研究提出 AutoModSAT,用 LLM 替代手动设计过程,实现启发式策略的自动生成与优化。

学术前沿 · 原始来源:nature.com · foundation-model, benchmark-evaluation
事件日期 2026-07-17

将推断出的家庭行为结构嵌入神经过程(Neural Process)的预测机制中,比仅用作外部分组信号更有效:在SGSC数据集上,最佳变体相比无行为标签的ANP基线平均降低MAE 7.9%、CRPS 6.9%,且在有限上下文场景下增益最大。

住宅短期负荷预测(STLF)因家庭用电模式的异质性、时间波动性及行为习惯多样性而极具挑战。该研究提出一种行为条件化的注意力神经过程(Behaviour-Conditioned Attentive Neural Process)框架,将每个负荷曲线视为一个预测任务,通过离散潜变量建模行为结构、连续潜变量捕获跨异质用户的功能不确定性,并使用聚类信息在训练时提供…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

当前最强的多模态大语言模型(MLLM)在需要主动、循环的视觉观察任务上大幅落后于人类(人类平均96.1%,最佳模型GPT-5.5仅10.6%,Claude Fable 5仅3.5%),表明这些模型缺乏鲁棒的主动视觉观察能力。

人类视觉是一个闭环过程:注视点会根据中间假设持续重定向,而非一次性快照。数十年的心理物理学和认知科学认为,这种主动观察对于广泛任务至关重要。然而,当前的多模态大语言模型(MLLM)是否具备主动观察能力?现有的视觉语言基准无法回答这一问题。本文提出了ActiveVision基准,以量化MLLM的主动观察能力。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-17

本文提出了一种基于物理硬件中随机模拟过程(朗之万动力学)的节能快速热力学计算蓝图,通过可调能量势构建参数化能量基模型,并利用概率图模型框架训练主流机器学习模型;初步实验使用热噪声驱动的超导电路实现了该硬件原型,为概率机器学习的节能硬件指明了方向。

A Blueprint for Equilibrium-Based Differentiable Continuous-Variable Thermodynamic Computing

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16 信息日期 2026-07-23

对于任意有限维度 \(n \geq 4\),存在一个非空开集(因而具有正勒贝格测度)的严格凸二次优化问题及初始点,使得长步 Barzilai–Borwein (BB1) 方法收敛,但**不能达到根超线性收敛**(root-superlinear convergence)。其梯度范数、能量范数和目标间隙均被几何序列从上下两方界定,从而排除了超线性收敛的可能性。

Barzilai–Borwein (BB) 方法是一类经典的无标量步长梯度下降法,在实践中表现出强劲性能,但其收敛动力学(尤其是否能在“几乎所有”严格凸二次问题和初始点上实现超线性收敛)长期悬而未决。本文通过对 BB 动力学在四维投影空间中的第七周期吸引子进行计算机辅助证明,构造了一个反例族,否定了上述猜想。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条