AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1941-1960 条,共 2269 条
第 98 / 114 页
事件日期 2026-07-10

通过迭代式生成-去重闭环,使用NVIDIA NeMo Data Designer、NeMo Curator和Nemotron模型,可以在单台8路NVIDIA B200节点上,在约6天内生成超过50万条高质量、类别均衡的金融新闻标题数据集(FinHeadlineMix),有效缓解真实金融数据分布不均和稀有事件缺失的问题。

微调大语言模型(LLM)用于金融自然语言处理受到数据有限且不平衡的制约。真实金融新闻过度代表盈利报告和股票波动,而信用评级变化、产品审批、劳工问题等稀有事件难以大规模获取。合成数据生成可以填补这些缺口,但多样性需要超越单次大规模生成。本工作提出一种迭代式流水线,结合结构化生成、语义去重和高通量合成,最终产出502,536条唯一金融新闻标题,覆盖12个主题加…

产业观察 · 原始来源:NVIDIA 博客 · ai-industry
事件日期 2026-07-10

OpenAI发布实时语音模型GPT-Live作为“前台”专攻低延迟自然对话,复杂任务委派后台GPT-5.5处理,对话流畅度评分从3.80大幅跃升至4.96,初步破解了语音AI“要快还是要聪明”的长期矛盾。

OpenAI于2026年7月10日前后发布了实时语音模型GPT-Live,采用前后台分离架构:GPT-Live前台负责低延迟自然对话,而搜索、推理、计算等复杂任务则委托给后台的GPT-5.5模型处理。该产品上线初期暂不支持视频与屏幕共享功能,API定价尚未公布,预计成本不低。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-10

Meta正在秘密研发一款代号“超级感知”的AI眼镜原型,可持续录音并每隔几秒自动拍照,实现全天候无死角感知;原始音视频不上传,仅提取元数据供云端AI查询,但LED指示灯计划关闭,引发严重隐私争议。

据《金融时报》报道,Meta秘密推进一款代号为“超级感知”的AI眼镜原型。该设备能够持续不断录音,并每隔几秒自动拍照,旨在实现全天候、无死角的周围环境感知。用户可通过语音询问过往信息,相关数据将传输至Meta服务器进行处理。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-10

蚂蚁灵波发布的 LingBot-VA 2.0 是全球首个从架构、数据到训练目标均为机器人量身定制的“具身原生”预训练 VA(Video-Action)基座模型,通过因果 DiT + 稀疏 MoE 实现 93.6% 双臂任务成功率与 225Hz 异步控制频率,让机器人学会“预判物理世界”而不是简单“看到就反应”。

传统机器人视觉-动作模型多基于通用视频生成模型改造(如从双向注意力改为因果),存在预训练知识被破坏、对物理动态预测能力弱等问题。蚂蚁灵波于 2026 年 7 月 10 日发布 LingBot-VA 2.0,从零开始采用因果架构训练,使模型天生具备“只能看过去、不能看未来”的时序约束,匹配机器人闭环控制的物理现实,并融合语义视觉-动作分词器、因果预训练、稀疏…

产业观察 · 原始来源:量子位 · ai-industry
事件日期 2026-07-10

LingBot-VA 2.0 是业界首个从物理世界交互需求出发、原生设计的具身世界动作模型,通过自回归预训练和四大核心设计,在真机测试中实现了单卡 150 Hz 的实时推理效率,标志着机器人基础模型从“数字世界模型嫁接”向“面向物理世界原生设计”的关键转变。

2026 年 7 月 10 日,蚂蚁灵波发布了业界首个具身原生世界动作模型 LingBot-VA 2.0。该模型不依赖外部拍摄设备即可完成与人类的多轮随机对打等复杂交互任务。此前,蚂蚁灵波已在同一周内连续发布和开源了多款模型(包括空间感知、多机控制、实时交互、视频生成等方向的模型),LingBot-VA 2.0 作为集大成者正式开启了具身原生新阶段。

产业观察 · 原始来源:新智元 · ai-industry
事件日期 2026-07-10

GPT-5.6 是 OpenAI 迄今最强模型,分 Sol、Terra、Luna 三档,引入 ultra 多 agent 并行模式和 ChatGPT Work 智能体功能;Anthropic 在发布后连夜重置了 Claude 的 Fable 5 额度。

2026 年 7 月 10 日,OpenAI 正式发布 GPT-5.6,同步推出 ChatGPT Work(由 Codex 和 GPT-5.6 驱动),并完成产品架构合并(Chat / Work / Codex 三种模式)。Anthropic 在发布会后宣布重置 Claude Fable 5 额度。

产业观察 · 原始来源:量子位 · ai-industry
事件日期 2026-07-10

Epoch AI 的数据洞察以简洁的快照形式,分解复杂的人工智能趋势,涵盖训练计算、硬件进步、推理成本、数据中心规模等关键指标。

该页面汇集了 Epoch AI 发布的一系列数据洞察(Data Insights),旨在将复杂的 AI 趋势转化为聚焦、易读的摘要。内容覆盖 AI 进步、扩展定律、软件进展、开源模型、能力评测、数学、产业、领先公司、财务、地缘政治、基础设施(芯片、数据中心、能源)、以及影响(采用、经济、未来 AI)等多个主题。每条洞察通常围绕一个量化发现展开,例如“全球…

产业观察 · 原始来源:epoch.ai · ai-industry
事件日期 2026-07-10

蚂蚁灵波科技开源了新一代实时交互世界模型LingBot-World 2.0,支持丰富动作及文本驱动的环境事件,内置Agent机制与多人同世界互动,可在720p/60fps低延迟下稳定生成数小时不衰减画质,适用于游戏、自动驾驶仿真与具身智能训练。

蚂蚁灵波科技发布了LingBot-World 2.0,这是一个实时交互世界模型,能够支持施法、攻击、跳跃等动作,以及文本驱动的环境事件。模型内置Agent机制,支持多人同世界互动。技术方面采用因果预训练与混合双向自回归注意力掩码机制,有效抑制长时漂移,可实现小时级稳定生成且画质不衰减。经过蒸馏与工程优化,实现了720p/60fps的低延迟高清交互。14B模…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-10

马斯克旗下 SpaceXAI 与 Cursor 联合推出的旗舰模型 Grok 4.5 专为编码和智能体设计,在 SWE Bench Pro 和 Terminal Bench 2.1 上表现优异,以更低 Token 消耗和更快的推理速度实现了接近 Opus 4.8 的性能,被称为性价比之王。

2026 年 7 月 10 日前后,马斯克旗下 SpaceXAI 联合代码开发平台 Cursor 发布了最新旗舰模型 Grok 4.5。该模型专注于代码生成与智能体长任务执行,训练数据包含数万亿 Token 的 Cursor 真实开发数据,采用“单 Token 智能度”策略和异步训练栈。发布时宣称其编码性能整体打平 GPT-5.5,逼近 Opus 4.8。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-10

谷歌量子AI团队首次利用强化学习智能体实现逻辑量子比特的实时容错优化,在持续漂移下将计算稳定性提升约3.5倍,并在专家优化基础上进一步将错误率降低约20%。

谷歌量子AI团队在《自然》杂志发文,针对量子计算中逻辑量子比特因环境漂移导致错误率升高、传统纠错方法难以实时适应的问题,提出了一种基于强化学习的实时纠错方案,首次实现量子纠错的实时容错优化。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-10

腾讯微信团队于2025年6月集中上线8项AI能力,包括: 1. 微信开放平台发布开发者接入AI生态指引; 2. 微信支付升级AI接入工具箱2.0(文档转Mermaid格式,Token消耗直降50%); 3. QQ邮箱内测专为Agent设计的"Agent Mail"; 4. 企业微信灰度原生AI助理"大圆"; 5. 微信输入法上线语音智能整理; 6. 微信读…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-10

VEXAIoT 是一个基于大语言模型(LLM)的多智能体框架,可在受控 IoT 环境中实现最高 100% 的攻击成功率,平均执行时间低于 2 分钟,展示了 LLM 智能体在 IoT 漏洞自动化利用方面的巨大潜力。

IoT 系统因硬件受限、固件过时和不安全的默认配置而天生脆弱,亟需可扩展、自适应的安全测试方法。现有 LLM 智能体在渗透测试和 CTF 比赛中已展现潜力,但尚未用于 IoT 特定漏洞的发现与利用。本文提出 VEXAIoT,旨在填补这一空白。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-10

本文设计并实现了一个硬件感知的流式句子级手语翻译系统,在保持可接受翻译质量(测试集BLEU 15.9)的同时,将平均响应延迟从1.873秒降低至1.354秒(降幅27.71%),并验证了该架构可在树莓派4B等低功耗客户端上运行。

现有手语理解系统大多针对孤立词汇级手势,难以服务自然对话中的连续句子翻译。本文的目标不是提出新的翻译架构,而是**以实时部署为首要目标**,研究句子级手语翻译(Sentence-Level Sign Language Translation, SLT)在实际系统中的可行性与延迟瓶颈。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-10

在相同语料上,直接对视觉文档(不提取文本)进行无监督视觉预训练,在多种骨干网络和基准上一致优于纯文本预训练,为语言智能提供了一条可扩展的新路径。

当前的预训练方法在处理文档、网页等视觉丰富来源时,会将其转换为纯文本,从而丢弃图表、排版方程、页面布局等视觉信息。本文质疑语言模型必须依赖纯文本训练的默认假设,系统性地研究了直接利用视觉文档的无监督视觉预训练范式。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-10

PanoWorld首次利用全景表示的旋转等变性来解决世界模型中的长程记忆问题,并在自建的World360数据集上显著超越现有方法。

全景世界模型在模拟大范围空间变化与多样光照条件时,需要高效处理长程记忆(long-range memory),即从远距离的历史观测中恢复当前帧的物理一致性。现有方法受限于固定视角或无法处理旋转导致的视角偏移。本研究提出利用全景图像固有的旋转等变性(rotation-equivariant property),将旋转视为隐式几何变换,从而简化相机轨迹并提升记…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-10

LLM有望作为统一智能接口,驱动电子设计自动化(EDA)从前端设计的局部辅助走向自主智能体执行,但集成仍面临关键挑战。

随着芯片复杂度增加和上市时间压力增大,前端设计已成为芯片开发的关键瓶颈。本文系统探讨了大语言模型(LLM)在EDA中的应用潜力,重点分析其从规范理解扩展到硬件描述语言(HDL)生成、测试台构建和设计空间探索的能力,并讨论以OpenClaw为代表的智能体AI如何为下一代EDA提供战略路线图。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条