AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1061-1080 条,共 2259 条
第 54 / 113 页
事件日期 2026-08-05

BnBERT-iPET 是一种面向孟加拉语的稀疏少样本语言建模方法,通过彩票假设剪枝将模型剪至 10% 的边(即 90% 稀疏度),在少样本下游任务上可与 Bangla Electra、Indic-BERT、XLM-RoBERTa 等大模型“并驾齐驱”。

大型预训练语言模型(如 BERT)在 NLP 任务中表现优异,但其训练和推理成本高、耗时、碳足迹大,且在低计算能力设备上难以部署。对于孟加拉语等资源受限语言,训练复杂模型存在额外障碍。作者提出 BnBERT-iPET,探索能否用极稀疏的少样本模型在挑战性任务上接近大模型性能。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

待核实(目前仅有论文元数据,无法确认研究结论)。

根据论文标题,本研究关注在拥挤公共空间中,行人如何评估和回应自主移动机器人(autonomous mobile robots)与个人移动机器人(personal mobility robots)。具体研究设计、实验场景、样本来源等均待核实。

学术前沿 · 原始来源:science.org · foundation-model
事件日期 2026-08-05

Argus 是一个持久化、自进化的通用智能体运行时,在不改变模型权重的前提下,通过持久项目状态和控制策略实现自我进化,并在软件工程、数学研究、论文流水线等长时程推理任务上取得显著提升。

长时程推理需要一个智能体运行时:当证据支持当前方法时能够持续执行,当测量显示失败、隐藏约束或目标设定错误时能够转向。Argus 针对这一问题,提出由 Manager(管理者)、Planner(规划者)、Engineer(工程师)、Reviewer(评审者)四种角色在持久项目状态上执行有界任务的框架,并将稳定的用户意图与操作目标、约束和验证标准分离。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

ABSeeker 提出 Answer-Backtracked Credit Assignment(ABC)框架,利用从最终答案回溯出的中间线索,将稀疏的轨迹级结果转换为稠密的步骤级奖励,从而训练长程搜索智能体;在 4B 参数规模下,其 BrowseComp 得分可从 37.3% 提升至 55.3%(配合上下文管理),接近约 30B 参数的大模型表现。

长程搜索智能体需要依次执行搜索、检索、验证、整合证据等多个步骤才能得到最终答案。现有方法在监督微调(SFT)和强化学习(RL)中通常把一条轨迹内的所有步骤一视同仁地对待,难以区分有用动作与错误或冗余动作。本文提出一种细粒度信用分配方法,把稀疏的“整条轨迹对错”转化为稠密的“每一步是否有用”的监督信号。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

商汤开源统一多模态模型SenseNova U1.5-Lite-Preview,基于NEO-Unify架构,仅8B-MoT规模,实现原生4K生成、更准确的中英文字与复杂版式,以及更稳定可迭代的图像编辑,多项基准显著超越前代U1,效果可比肩商用闭源模型。

据腾讯研究院AI速递(2026-08-04)报道,商汤开源了统一多模态模型SenseNova U1.5-Lite-Preview。相比此前版本U1,新版原生支持4K生成,在图像纹理、文字渲染、版式呈现和图像编辑方面均有明显提升。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-04

阿里发布迄今最强的Qwen3.8-Max,参数达2.4万亿、激活95B、支持百万上下文,编程与办公能力显著提升,并计划下周开源权重。

据腾讯研究院AI速递(20260804),阿里发布了Qwen3.8-Max,定位为迄今最强版本。在长程任务中,模型可自主运行十余天迭代项目,复现并超越最新论文;办公场景覆盖法律、工程、量化等数百种专业场景。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-04

OpenAI 发布了面向教育场景的 ChatGPT Work 与 Codex 新插件(教育插件),旨在帮助 K-12 教师、大学教育者和学生进行学习、教学、研究与构建,但具体功能细节待核实。

根据已有元数据,本条目涉及 OpenAI 官方发布“New ways to learn and teach with ChatGPT Work and Codex”,即探索 ChatGPT Work 和 Codex 在教育领域的新用法。由于原始页面正文未能抓取,目前只能确认其主题方向和教育受众,具体产品说明与发布背景待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-04

Karpathy以约10美元、约100万Token的预算,让Opus 5模型自主运行近两小时,写出约5500行代码,将《指环王》开篇文字做成了可交互的3D场景。这个实验展示了大模型按需生成临时虚拟世界的潜力,也暴露了模型无法原生感知视频、只能靠静态截图自检的局限。

腾讯研究院AI速递报道,Karpathy给Opus 5约100万Token(成本约10美元)预算,要求用Three.js把《指环王》开篇文字做成可交互3D场景。模型自主运行近两小时,写出约5500行代码,完成了资产建模、坐标摆放与镜头动画。最终效果粗糙,但整体可玩。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-04

Grok新增了视频分析能力,可在数十秒内生成长视频摘要,并声称能鉴别Deepfake及溯源制作模型;但技术人员指出其实际依赖字幕而非逐帧画面,存在幻觉与稳定性不足。

据腾讯研究院AI速递(20260804)报道,马斯克宣布Grok可分析任意视频,并发布了一段63秒的科比Deepfake演示,画面逼真到难辨真假。Grok还能鉴别AI伪造内容并溯源其制作模型,实测中可读懂无字幕的科拉茨猜想动画。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-04

NVIDIA 技术博客提出,以视频世界模型为骨干的“世界动作模型(WAM)”正在挑战传统视觉-语言-动作模型(VLA)范式;开放的 NVIDIA Cosmos 3 世界基础模型可作为 WAM 后训练的强起点,在物理泛化、少样本适应新机器人和部署灵活性上带来可量化的收益。

机器人策略的核心难题是“超越训练示范的泛化”:物体形状、位置或光照变化时,策略往往失效。传统 VLA 在预训练的视觉-语言模型(VLM)上增加动作模块,但 VLM 擅长“描述”世界而非“预测世界如何演化”。NVIDIA 研究员 Jim Fan 在 “Robotics’ End Game” 演讲中探讨了这一转变,并被总结为 **“VLAs are dead,…

产业观察 · 原始来源:NVIDIA 博客 · ai-industry
事件日期 2026-08-04

据量子位报道,一家DAU破亿的出海AI穿搭应用在遭遇推理成本倒挂(人均年收入2美元,人均云端算力+传输成本3美元)后,通过将推理层迁移至Akamai推理云并换用NVIDIA RTX PRO 6000,将GPU集群规模缩减75%,单图生成耗时从12秒降至3-5秒。

报道聚焦一款主打“AI穿搭+购物推荐”的出海应用,其DAU破亿,但每用户ARPU仅2美元,而每用户云端算力和传输成本为3美元,即每活跃用户净亏损1美元。报道将亏损归因于“三重算力锁链”: 传统云GPU租金高且存在空转浪费; 出站流量费(Egress Fee)高昂,业内流传“算力花一万,流量花五千”; 跨国网络延迟导致GPU利用率下降,行业实测称14ms往返…

产业观察 · 原始来源:量子位 · ai-industry
事件日期 2026-08-04

Jeff Dean提出“1%法则”:小团队应瞄准通用模型成功率为0-1%的难题,依靠私有数据、专用模型与产品设计取胜。

在腾讯研究院AI速递(2026-08-04)中,报道了Jeff Dean关于创业机会和AI趋势的观点。他认为推理正成为新瓶颈,数据搬运能耗远高于计算,未来将出现更多面向推理、兼顾速度与成本的专用硬件;同时Agent正从短任务走向连续数天的长程自主运行,但容易在数十步后偏离目标。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-04

开源智能体Hermes试图通过剥离通用策略提示词,把模型对大厂的忠诚转移给用户,并用性格与批评技能、上下文学习及Curator自动清理记忆技能,应对“你说得完全对”式谄媚;开源被视为防止AI被少数公司垄断的关键。

Nous Research联合创始人Karan在腾讯研究院AI速递中介绍开源智能体Hermes,核心问题是模型“忠于谁”。他指出模型会出现“你说得完全对”式谄媚,这种回应本质上是奖励钻空子。Hermes尝试从对齐控制权入手,让用户而非大厂成为模型行为的最终受益者。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-04

Genspark 在 AGI Playground 2026 发布了 GenOffice——一款面向 Windows/Mac、免费开源无广告的本地 Office 客户端。据材料称,其 Alpha 版由一名工程师在一周内完成,Token 成本约 1 万美元;这是一次用低成本、开源方式抢占白领高频办公入口的尝试。

本条信息来自腾讯研究院AI速递 20260804。Genspark 在 AGI Playground 2026 活动上发布了 GenOffice,定位为 AI 原生的本地 Office 客户端,支持 Windows/Mac,免费开源无广告。材料强调,免费开源的目的是抢占白领高频办公入口、积累用户工作上下文,而商业化则留给更高阶的 Agent 能力与企业服务。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-04

E-Bench是一个面向智能体多步工具调用能力的中文场景基准测试,由腾讯混元联合清华、东南大学推出,用王者荣耀、QQ音乐、腾讯会议等真实产品原型设计任务;测试显示11个前沿模型平均成功率仅54.56%,可靠性不足是当前最大瓶颈。

腾讯混元联合清华大学、东南大学推出E-Bench,专门考核智能体在真实产品场景中的多步工具调用能力。基准以王者荣耀、QQ音乐、腾讯会议为原型,要求智能体通过连续调用多个工具完成状态改变类任务。结果发现,即便是前沿模型,在干扰信息干扰下也经常“过早行动”,导致任务失败。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-04

WorldCup Arena 通过在 2026 年 FIFA 世界杯期间、每场比赛开球前让六款前沿大语言模型填写预测卡,构建了一个“构造上无泄漏”(leakage-free by construction)的前瞻性预测基准;结果显示模型预测表现与直接押注博彩公司热门基本持平,且模型之间相互一致的程度远高于其正确率。

现有衡量大语言模型预测能力的基准大多属于“回顾式”设计:事件已经发生、答案已存在于互联网上,评估必须额外防御模型记忆。本文报告了一种相反的设计:在 2026 年 FIFA 世界杯 39 天赛期内,六款前沿 LLM 在每场比赛开球前,一场一场地填写预测卡,覆盖全部 104 场比赛,外加 12 个小组出线队预测和赛前冠军池预测。由于提问时答案尚不存在,该评估不…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

ALiBi位置编码的线性偏置缩放会因浮点精度下溢而使大量注意力权重被置零,导致部分注意力头“失明”;该问题会显著损害token检索,但对标准解码器基准影响较小,使用对数缩放距离是其中一种有效的缓解策略。

论文识别出一个此前被忽视的ALiBi位置编码失效模式:其线性偏置缩放在浮点精度下发生下溢,使大量注意力权重归零,受影响的注意力头“部分失明”。研究者分析了该失效模式、刻画其影响,并检验了四种缓解策略;同时证明这一问题也出现在基于ALiBi的先进预训练模型中。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

EcoFrame 是一个免训练的查询自适应视觉证据调度框架,通过利用 VLM 自身的推理反馈来决定“何时增大帧预算”和“到哪里寻找额外候选帧”,在 Video-MME、LongVideoBench 和 MLVU 上取得了比静态帧选择更优的准确率-效率平衡;在 Qwen2.5-VL 上平均准确率 64.4,超过 BOLT 的 63.5。

长视频理解要求视觉语言模型(VLM)只依赖少量稀疏帧作为视觉证据进行推理。现有基于相关性的方法通常采用固定帧预算和候选池的一次性静态选择;基于智能体(agent)的调度器虽然自适应,但依赖多轮推理和交互搜索,开销高昂。EcoFrame 针对的是“何时看(when)”和“往哪看(where)”这两个核心调度问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条