AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 421-440 条,共 2259 条
第 22 / 113 页
事件日期 2026-08-25

据候选摘要,BrowserForge 通过并行运行大量浏览器沙箱,在开放网络上生成包含 203,238 条网页操作轨迹的数据集,微调小型多模态模型后,可将其在 Online-Mind2Web 上的成功率从 25.66% 提升到 33.33%。

直接从渲染后的像素画面行动的网页智能体,可以避免解析 HTML 或 accessibility tree 的脆弱性,也能降低 token 消耗。 但训练这类智能体需要大量高质量交互轨迹;公开数据集通常只有几千条轨迹,且来源网站固定、范围狭窄。 近期的自动化数据合成流程仍受限于预定义网站列表或教程来源,导致智能体见过的不同网站数量难以增长。 BrowserF…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-25

BioKERN 是一种将生物结构作为显式、可学习归纳偏置的多模态空间表示学习框架,通过结合转录组相似性与空间邻近性构建训练时生物核,能够持续改进组织学图像到转录组的生物邻域检索效果,且增益主要来自该正则化本身而非模型容量增加。(具体改进幅度待核实)

空间解析生物学需要能够保留生物邻域结构的表示,而不仅仅是精确的跨模态对应。现有组织学—转录组学学习目标可能过度强调实例级匹配,即使未配对的空间点也可能共享分子或空间上下文。BioKERN 针对这一问题,提出将生物结构显式纳入训练过程,以改善邻域级检索。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-25

本研究提出了一种基于大语言模型(LLM)的双维度自动题目相似性分析框架(AISA),将题目相似性分解为“结构化分解”与“语义相关性”两个维度;心理测量学验证和计算机化自适应测试(CAT)模拟表明,该框架比传统文本相似度指标(如 BLEU、余弦相似度)更贴近题目非实质局部依赖指标,并能改善 CAT 选题的估计稳定性与偏差。

A Dual-Dimensional LLM Framework for Automated Item Incidental Content Similarity Analysis in Large-Scale Assessments

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-24

匿名模型Ox Alpha现身OpenRouter,免费开放1M上下文并支持图片、视频输入,因谐音“牛来”走红;公开测试显示其推理链接近GLM-5.3,小样本DeepSWE通过率80%,但模型自身无法确认其权重、参数与开发者。

腾讯研究院AI速递20260824收录:匿名模型Ox Alpha出现在OpenRouter,具备1M上下文,支持图片和视频输入,免费开放调用。因名字谐音“牛来”在中文互联网引发热度。有用户将其接入Claude Code令其自查,生成七章网页报告,但模型坦言无法得知自身权重、参数与开发者,“我是Ox Alpha”仅为系统提示所赋名字。开发者小样本测试显示,O…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · benchmark-evaluation
事件日期 2026-08-24

商汤开源轻量级原生统一多模态模型 SenseNova U1.5 Lite,以8B参数规模支持3-4k字符超长复杂指令、原生4K输出与图像编辑;据材料口径,该模型在指令遵循和图像编辑保持度上超过同量级模型,且可单卡运行,兼顾性能与部署成本。

商汤开源 SenseNova U1.5 Lite,定位为轻量级原生统一多模态模型的“正式版”,聚焦真实视觉创作交付。模型原生支持超长复杂指令、4K输出与图像编辑,并已在 GitHub、Hugging Face、魔搭社区全球开源。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-24

OpenAI产品设计负责人Ian Silber认为,生成式AI压缩了从想法到实现的时间,但执行能力增强不等于AI能独立完成产品判断;设计师的重心正从方案制作转向问题定义、方向判断与结果验证。

腾讯研究院AI速递(20260824)报道了OpenAI产品设计负责人Ian Silber关于AI时代设计角色变化的观点。核心问题是:当生成式AI大幅降低“实现”门槛后,设计师的核心价值和工作重心应该如何转移?

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-24

作者认为,AI 时代“超级个体”是真实趋势,但“超级团队”是伪概念。团队协作成立的前提是“判断可以让渡”,而超级个体的核心资产恰恰是不可让渡的判断。超级个体真正需要的是“编队”(单一意志 + 多个执行体),而非由多个超级个体组成的团队。

本文是一篇约 8700 字的评论文章(据文章),围绕一个组织学问题:AI 放大个人能力之后,把多个“超级个体”聚合在一起,是否就能得到“超级团队”?作者借林格尔曼效应、斯坦纳过程损失公式、布鲁克斯定律、漫威电影和《奥德赛》等素材,论证“超级团队”在逻辑上不成立。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-24

NVIDIA 的交互式 AI 推理加速器 Groq 3 LPX 与 NVIDIA Vera Rubin NVL72 平台结合,在 Artificial Analysis 的 100K 上下文基准上,对 Gemma 4 31B 模型实现了 3,431 output tokens/second 的中位生成速度,展示了长上下文、小批量场景下的高交互性推理能力。

Agentic AI 的多轮交互中,上下文会随会话不断增长,长期会话可能达到数十万 token。要求模型在保留长上下文的同时,以极高的速度(每用户每秒数千 token)生成输出,这对推理系统提出了独特的工程挑战:高交互性需要很小的 batch size,而 tensor parallelism(TP)在这种规模下可能因通信协调开销而失效。

产业观察 · 原始来源:NVIDIA 博客 · ai-industry
事件日期 2026-08-24

据AGIBOT官网新闻标题,AGIBOT将与长隆(Chimelong)合作开发“全球首个具身智能主题公园”;但网页正文未抓取到,合作细节、时间表与具体内容均待核实。

该新闻条目发布于2026-08-24,标题为“AGIBOT Partners with Chimelong to Develop the World’s First Embodied Intelligence Theme Park”。从标题可确认的核心信息是:

产业观察 · 原始来源:agibot.com · ai-industry
事件日期 2026-08-24

OpenAI 宣布 GPT‑5.6 现已集成到 Kiro 中,帮助开发者在规划、构建、审查和测试软件时获得更好的性价比(price-performance)。具体功能细节、定价和性能数据待核实。

根据官方页面元数据,本条信息介绍的是 GPT‑5.6 在 Kiro 中的可用性。由于未能抓取正文,具体发布时间、Kiro 的产品形态、使用方式以及功能范围均待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-24

谷歌与圣路易斯华盛顿大学团队提出EnvHarness,通过在静态环境外增加可编程层,使训练环境能够随Agent策略持续进化;配套EnvRigger自动诊断Agent弱点并编写验证组件,在多个基准上优于原始环境与领域专用环境。

研究问题:传统强化学习/Agent训练通常依赖固定环境,环境无法根据Agent能力变化自适应调整,导致训练信号不足或任务难度失配。 EnvHarness 的目标是让“静态训练环境”随Agent进化,而无需重建环境或修改验证器。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-24

DeepSeek推出实验性多模态视觉理解模型V4-Flash-Vision-Exp:纯文本能力与V4-Flash正式版持平,视觉Agent能力大幅提升、接近Opus-4.8;API按token计费,单张图片最多384 tokens,价格与V4-Flash一致,并开放免费Files API。

据“腾讯研究院AI速递 20260824”报道,DeepSeek上线了实验性多模态视觉理解模型V4-Flash-Vision-Exp。该模型属于V4-Flash的视觉扩展版本,重点提升视觉Agent能力,而非替代V4-Flash正式版。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-24

在第二届世界人形机器人运动会开幕式上,银河通用人形机器人进行全球直播网球对抗,材料称其完成发球、正反手、网前截击、极限救球与摔倒起身;双打中还可与人类队友实时战术协作。材料未给出具体赛事日期、地点、网坛名将姓名及比赛详细规则,待核实。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-24

Anthropic 上线免费教育平台 Claude Academy,将员工入职培训内容公开,核心不是教写 Prompt,而是用 AI Fluency 4D 框架训练用户判断“哪些任务该交给 AI、如何检查 AI 的产出”。

据腾讯研究院 AI 速递 20260824 报道,Anthropic 上线 Claude Academy,把原本面向内部员工的入职培训内容公开。平台包含 289 个课程、教程与真实用例,注册即可学习,并可获得可验证徽章。课程覆盖从 AI 基础到 Claude Code、API、MCP、agents 及生产级部署。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-24

AI正在将经济学测量从“寻找可规模化测度”的瓶颈,转变为“在众多看似合理的测度中做选择与验证”的挑战;要获得可信推断,需要把测量锚定在显式标准上进行验证,而不是仅凭“代理指标看起来合理”的非正式宣称。

这是一篇经济学领域(econ.GN)的综述论文,作者为 Melissa Dell 和 Ashesh Rambachan,2026年8月24日发布于 arXiv,编号 2608.23524v1。 研究问题:AI模型能以低成本将文本、图像等非结构化数据转化为结构化变量,使过去难以实现的大规模测量成为可能。但当同一现象存在多种可选的AI测量方式,且它们可能支持不…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-24

多智能体LLM系统的表现并不主要取决于智能体数量,而取决于智能体之间交换的信息;如果让智能体阅读彼此的完整输出,一轮交互就会使提案趋同,产生“交互税”。

既有研究对多智能体交互的作用看法不一:有的报告辩论、批评循环、智能体混合合成带来增益;另一些发现同等预算下交互增加成本但不提升质量,独立采样已能获得多智能体增益。 本论文提出,这些矛盾部分源于缺少一个关键区分:并非所有多智能体通信都是等价的。 研究问题:多智能体LLM交互是帮助还是损害?为什么会产生矛盾结果?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-24

现有编码智能体在“修 bug”上能力提升,但还不能可靠地自主完成整仓库技术栈迁移。SWE Refactor Bench 的 520 次前沿模型运行中,只有 28 次(5.4%)通过全部三阶段评估;最佳模型 claude-opus-5 得分为 47.0/100,20 个任务中有 13 个没有任何被接受解。

现代软件系统长期积累技术债,技术栈迁移成本高且大多依赖人工。 研究问题:编码智能体能否像修 bug 一样,自主完成长周期、全仓库的栈迁移? 指出已有评测基准的“Blindness”问题:它们只看行为正确性,不检查迁移是否真的发生,所以智能体可以复制原始实现来让测试通过。 为此提出 SWE Refactor Bench:包含 20 个全仓库迁移任务,覆盖 4…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-24

在 SWaT 基准和统一离线评估协议下,11 个异常检测器对训练期数据污染的鲁棒性高度依赖具体模型,且无法仅凭干净数据上的性能进行预测;注入式污染造成的性能退化最严重,而 PCA、SVM、HBOS 和 IForest 相对稳定。

机器学习异常检测越来越多地用于工业控制系统(ICS),但大多数研究假设检测器的训练数据是可信的。实际中,训练数据可能因日志被篡改、标注错误、历史记录被操纵或不安全的再训练过程而被污染。本文针对这一缺口,评估离线 ICS 异常检测流程在训练期数据污染下的鲁棒性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条