AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 821-840 条,共 2259 条
第 42 / 113 页
事件日期 2026-08-12

在不更新弱模型参数的前提下,更强的 builder 模型可以在测试时为其构建推理 harness,从而显著提升任务表现;摘要报告在四个 Theory-of-Mind 基准上,弱模型平均性能从 0.49 提升到 0.91(待核实)。

传统蒸馏通常发生在训练时:通过 teacher forcing、on-policy distillation 等方法,把大模型能力迁移到小/弱模型,往往需要更新后者的参数。 本文研究的问题是:这种能力迁移是否也能发生在测试时? 具体研究“强到弱脚手架”(strong-to-weak scaffolding):强 builder 模型能否构建 inferen…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-12

AbdomenNet 是一个基于平扫CT的急腹症基础模型,在外部验证中对5种紧急情况的宏平均AUROC达到0.919;AI辅助可将放射科医生平均AUROC从0.812提高到0.924,并将每例中位阅片时间减少52.5秒。

A foundation model for acute abdomen diagnosis stratification and triage on noncontrast computed tomography

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-11 信息日期 2026-08-18

根据 OpenAI 官方页面信息,ChatGPT Ads 正在扩展至 31 个欧洲市场,使广告主能够在用户探索、比较和决策时触达他们。(具体细节待核实)

OpenAI 发布了题为“ChatGPT Ads expands across Europe”的页面,宣布 ChatGPT 广告业务进入更多欧洲国家。页面摘要称,广告主可以借此在用户探索、比较选项和做出决策的过程中与之接触。由于原始页面未能抓取正文,本次扩展的具体市场名单、上线时间和广告形态均待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-11

英伟达开源端到端全双工语音模型 VoiceChat 11B,整合ASR、LLM与TTS,平滑轮换延迟约448毫秒,并设计独立工具调用通道,把等待外部工具API的时间纳入对话话术;但工具调用的参数准确率仅44%,且部署门槛高、工具执行期间无法打断。

据腾讯研究院AI速递(2026-08-11)消息,英伟达开源全双工语音模型 VoiceChat 11B。该模型为端到端语音到语音架构,训练使用约55万小时音频。与常见级联方案不同,它在一个模型中整合自动语音识别(ASR)、大语言模型(LLM)和文本转语音(TTS),实现低延迟平滑轮换对话。模型核心特点是独立的工具调用通道:通过TOOLCALL脚本配合预设“…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · foundation-model, agent
事件日期 2026-08-11

Arena 评测平台上出现了一个代号“mona-lisa-1”的神秘图像模型,多方线索指向 OpenAI,它可能是 GPT Image 2 的后续版本或测试分支,在真实感和“去 AI 味”上有提升,但 OpenAI 尚未官方回应。

据腾讯研究院AI速递 20260811 报道,Arena 平台出现一个名为「mona-lisa-1」的神秘图像模型。经 SynthID 水印验证、命名风格及模型自曝等线索,社区普遍判断该模型来自 OpenAI,或为 GPT Image 2 的后续版本或测试分支。OpenAI 尚未官方表态,业界认为正式官宣只是时间问题。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · benchmark-evaluation
事件日期 2026-08-11

据腾讯研究院AI速递转述的爆料,OpenAI可能于8月发布代号Astra的GPT-6,参数或达10万亿,是GPT-4的五倍以上;年底还可能推出代号Doug的更大规模预训练模型。目前均未获官方证实。

爆料称OpenAI将于8月发布代号Astra的GPT-6,参数或达10万亿,预训练规模空前(待核实)。 年底还将推出代号Doug的迄今最大规模预训练模型,或采用英伟达下一代Vera Rubin芯片(待核实)。 消息称OpenAI两年来首次突破预训练瓶颈;Anthropic拟以Fable 5.1对标截击,“御三家”现仅剩OpenAI与Anthropic角逐(…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-11

根据新智元转述的X平台爆料,OpenAI可能在2026年8月发布代号为Astra的GPT-6,传闻参数达10万亿;另有一个年底发布的更大规模模型“Doug”。所有参数与发布时间均为未经证实的传闻。

2026年8月11日,新智元报道称,AI内幕记者ChrisGPT在X上爆料:即使面临政府审查压力,GPT-6(Astra)仍将在8月发布。 报道称,GPT-6就是前一天(8月10日)OpenAI紧急暂停发布的模型Astra;9个月前OpenAI开始重新分配计算资源,以应对Anthropic在预训练上的领先。 还有爆料称,年底将发布代号Doug的“史诗级巨兽…

产业观察 · 原始来源:新智元 · ai-industry
事件日期 2026-08-11

苹果已启动对中国长鑫存储(CXMT)DRAM芯片的测试,拟用于iPhone和MacBook;测试不等于采购,但反映出AI数据中心挤占产能后,消费级DRAM供应紧张已达到新节点。

苹果启动对长鑫存储(CXMT)DRAM芯片的测试,计划用于iPhone和MacBook。 测试不等于采购,但被视为衡量存储器市场紧张度的“压力表”和前置信号。 因AI数据中心大量吸收产能,三大DRAM厂将先进制程转向HBM与服务器DRAM,消费级DRAM供应收紧。 一季度合约价环比涨逾九成;库克称当前定价为“百年一遇的洪水”,并呼吁引入第四家供应商。 涨价…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-11

根据现有元数据,OpenAI 与 AWS 正在将 Daybreak 网络安全能力通过 Amazon Bedrock 提供给企业安全工作流。由于原始网页正文未能抓取,具体技术细节与产品信息均需以“待核实”处理。

本条是产业发布而非学术研究。所给 URL 的页面标题为 “Daybreak models are now available on AWS”,候选摘要显示:OpenAI 和 AWS 正在通过 Amazon Bedrock 提供 Daybreak 网络安全能力,以支持企业安全工作流。具体发布内容、合作背景与可用范围待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-11

据腾讯研究院AI速递转述,Anthropic 新一代 Sonnet 5.5 遭泄露,内部代号「Fennec」,据称已进入最后阶段,最早或于下月发布,直接对标 DeepSeek V4 Flash;核心升级包括 200 万 token 上下文、更快推理与更低延迟、长上下文与多步规划增强,以及浏览器与终端等工具调用改善。

泄露对象:Anthropic 新一代 Sonnet 5.5,内部代号「Fennec」。 当前状态:据称已进入最后阶段,最早或于下月发布。 对标产品:DeepSeek V4 Flash。 信息性质:来自泄露与业界推测,Anthropic 尚未官方确认(待核实)。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-11

NVIDIA NeMo Switchyard 通过“模型路由”机制,让 AI Agent 在任务执行过程中按需选择最合适的模型,在模型能力、成本与延迟之间取得平衡,从而避免“所有请求都发给最大模型”带来的浪费,也避免“一律使用小模型”造成的质量下降。

本材料来自 NVIDIA 技术博客,发布于 2026 年 8 月 11 日,介绍 NeMo Switchyard 这一模型路由解决方案。文章指出,构建 AI Agent 并非选定一个模型就结束,不同模型各有优缺点与成本特征,且同一工作负载的不同步骤可能需要不同能力的模型。NeMo Switchyard 提供了一套“系统化模型池”的编排思路,使开发者可以在不…

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-08-11

ARA(Agent-Native Research Artifact)是一种面向AI阅读、复现和延伸研究的“Agent原生”科研知识格式,主张用包含探索过程、可执行代码和原始证据的知识包取代传统论文PDF。实验显示,AI基于ARA的理解和复现表现明显优于传统PDF加代码仓库,但ARA距离全面取代PDF仍有较大距离。

传统科研论文以PDF为最终载体,呈现的是“从问题到答案”的线性成功叙事。ARA团队认为,真实的科研过程充满失败、试错和放弃,而传统论文在写作中会把这些信息剪掉,形成“叙事税”;同时,论文只要说服审稿人即可,不需要让AI完整复现,导致模型版本、超参数、环境等关键细节缺失,形成“工程税”。

产业观察 · 原始来源:量子位 · agent
事件日期 2026-08-11

JetPack 7.2.1 首次为 Jetson 带来 PyNvVideoCodec 2.2 的 Python 硬件加速视频编解码支持,并以统一 `jetson-videosdk` 智能体技能将开发者意图转换为可执行、可测量、可复现的视频流水线;同时支持在 Jetson T5000 模块上仿真 Jetson T3000 性能,便于提前开发面向低功耗、紧凑型…

NVIDIA 于 2026 年 8 月发布博客,介绍 JetPack 7.2.1 新能力。视频是 Jetson 应用的核心数据通路,覆盖机器人、智能视频分析、工业自动化、医疗、媒体处理和远程操作等场景。JetPack 7.1 已为 Jetson Thor 引入 NVIDIA Video Codec SDK,提供 C/C++ 开发者访问 NVENC/NVDE…

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-08-11

Meta宣布重回开源路线,发布Muse Spark 1.2,并开源300亿参数Agent模型Muse Glimmer;后者采用Apache 2.0协议,经4bit量化后仅需24GB显存即可运行,面向端到端任务、工具调用、多步推理等Agent场景设计。

Meta宣布开源发布Muse Spark 1.2,扎克伯格发表长信《The Future is for Everyone》,主张超级智能应赋能每个人而非集中于少数机构。同时,Meta开源了300亿参数Agent模型Muse Glimmer,权重已上Hugging Face,采用Apache 2.0协议。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-11

Erik Brynjolfsson将AI重新定义为“放大意图”——AI放大行动能力,但方向仍取决于使用者;下一代开发者的核心能力将从“写代码”转向“调度Agent集群”,并从被动接工单转为主动发现和定义问题。

该观点来自“腾讯研究院AI速递 20260811”中引述的斯坦福AI经济学家Erik Brynjolfsson的论述。他提出,AI的价值不只是自动化执行,而是放大使用者的意图;开发者正在面对一种新的工作方式:同时调度一群Agent并行工作,并且需要把少数高手的经验转化为Agent可调用的上下文。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-11

VidForensics-M1 首次将“元检测”(meta-detection)引入 AI 生成视频检测,通过强化学习同时优化预测标签与支撑证据,并利用时间定位作为可验证证据来源,从而提升对未知场景和新兴视频生成器的泛化能力。

视频生成模型的快速发展使得合成视频与现实内容的界限愈发模糊,带来虚假信息风险。现有基于多模态大语言模型(MLLM)的检测器多依赖监督微调或仅标签级强化学习,这种粗粒度监督限制了模型对未见场景和新兴生成器的泛化能力。作者提出一种新的检测范式:在强化学习框架内联合优化标签预测与证据生成,并引入可验证的时间定位证据,以增强检测可靠性与可解释性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

本文提出一个“测试时自进化”框架,让GUI智能体在部署后无需人工标注真值,通过“探索—评估—反思—内化”闭环持续改进视觉定位能力,在六个基准上平均准确率相对基座模型提升7.4%。

GUI视觉定位(GUI Visual Grounding)是GUI智能体的基础能力。现有模型部署后通常冻结参数,难以适应未见过的界面;近期虽有方法尝试用测试时强化学习进行适应,但这些方法无法对失败的探索进行反思。为此,本文提出一种测试时自进化框架,在无人工标注真值的条件下,让模型在部署后继续自我改进。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

在固定动作标注示范预算下,先利用无动作内窥镜视频预训练手术视觉动态、再微调联合动作预测的 Surgical WAM,将四个模拟手术操作任务的平均成功率从 63.5% 提升至 77.8%,说明无动作视频可以为手术机器人闭环控制提供可迁移的视觉动态先验。

手术机器人策略学习的一个主要瓶颈是动作标注示范稀缺:遥操作手术机器人(如 dVRK)的同步视频-运动学轨迹采集成本高,而手术任务又要求精确接触处理、长程推理和双臂协调。内窥镜视频相对廉价且丰富。已有手术世界模型虽然利用视频,但大多用于仿真或策略评估,很少把学到的动态转化为闭环控制。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条