AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1841-1860 条,共 2269 条
第 93 / 114 页
事件日期 2026-07-15

AI代理在自主分析数据时,约有一半概率会被精心篡改的“投毒”数据集误导,得出与真实情况相反的结论,这对科研诚信和自动化决策构成严重威胁。

2026年7月15日,《自然》新闻栏目报道了一项尚未经同行评审的研究。该研究由卡内基梅隆大学等机构学者完成,旨在证明恶意行为者可以通过上传与原始数据集高度相似但统计趋势被篡改的“投毒”数据集,诱使基于大型语言模型的AI代理在数据分析中得出错误结论。研究团队针对五个高度争议的社会议题进行了模拟攻击。

学术前沿 · 原始来源:nature.com · agent
事件日期 2026-07-14 信息日期 2026-08-13

OpenAI 发布了面向开发者的《The builder's guide to GPT-5.6》,介绍初创企业如何用 GPT-5.6 更快、更具成本效益地构建 AI 智能体,核心卖点包括更聪明的模型选择(smarter model selection)与新的 Responses API 能力。由于正文未抓取成功,具体细节待核实。

这是一篇 OpenAI 官网发布的“构建者指南”(builder's guide),主题围绕 GPT-5.6 在 AI 智能体开发中的应用。从元数据看,文章侧重工程实操而非基准评测。正文内容、发布时间与具体案例待核实。

产业观察 · 原始来源:OpenAI · agent
事件日期 2026-07-14 信息日期 2026-07-16

基于语言模型的安全智能体在进攻性(红队)任务中的成功率随推理预算增加而提升,但防御性(蓝队)SOC调查任务的性能更多取决于工具使用与遥测导航能力,而非推理预算本身;评估标准应加入经济效率和操作适配性。

Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

Anthropic于2026年7月14日推出专为美国K-12认证教师定制的免费AI工具Claude for Teachers,通过连接全美50州学术标准与循证课程,帮助教师提升教学效率并保护师生共处时间。

Anthropic在2026年7月14日发布Claude for Teachers产品,向美国K-12认证教师免费提供高级Claude功能、教学技能库以及与循证课程、全美学术标准直连的接口。该产品旨在填补教育最佳实践与教师实际时间资源之间的鸿沟,特别是针对资源不足的学校。

产业观察 · 原始来源:Anthropic 博客 · ai-industry
事件日期 2026-07-14

腾讯混元开源的HyOCR-1.5是端到端OCR领域首个完整开源训练、推理与权重的专家模型,仅1B参数即可覆盖8种以上OCR任务,借助DFlash投机解码在Transformers下实现6.37倍加速,成为推理速度最快的OCR视觉语言模型(VLM),并支持在CPU及普通笔记本上运行。

2026年7月14日,腾讯混元宣布开源HyOCR-1.5。该模型专注于端到端OCR任务,以极小参数量(1B)实现了多任务覆盖与极低推理延迟,在OmniDocBench v1.6基准上以94.74分位居端到端第一,并显著增强了古文字、图表解析等长尾能力,同时新增了无文字负样本处理能力。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-14

OpenAI 提供的指南展示了数据科学团队可利用 ChatGPT Work(或相关 AI 工具)从真实工作输入中构建根本原因简报、影响报告、KPI 备忘录、范围分析与仪表板规格,从而提升分析效率与协作质量。具体效果与操作细节因原始材料不可用而待核实。

该资源来自 OpenAI Academy 的专题页面,主题为“数据科学团队如何使用 ChatGPT Work”(How data science teams use ChatGPT Work)。页面旨在说明数据科学团队如何借助 ChatGPT Work 产品完成多项典型任务。因无法获取正文,确切背景与案例细节待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-07-14

结合NVIDIA TAO agent skills与LoRA后训练,可将Cosmos 3 Nano在Woven Traffic Safety视频问答任务上的准确率从54.41%提升至93.35%,整个流程在一天内自动完成,仅需少量自然语言提示。

NVIDIA于2026年7月14日发布技术博客,展示如何利用自主编码AI代理(coding agent)调用NVIDIA TAO库中的agent skills,对NVIDIA Cosmos 3 Nano模型进行后训练(post-training)。实验使用Toyota的Woven Traffic Safety(WTS)数据集(四选一视频问答任务),通过Lo…

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-07-14

基于Codex(GPT 5.5)的自主编码智能体,结合NVIDIA NeMo RL、NeMo Gym以及Brev-etiquette、Session-memory、Autoresearch三种技能,能够端到端地自动化强化学习研究工作流,包括环境搭建、实验编排、模型迭代优化,甚至实现论文到代码的转化。

NVIDIA技术博客于2026年7月14日发布文章,介绍了如何利用前沿编码智能体(Codex with GPT 5.5)在NVIDIA Brev GPU实例上,依托NVIDIA NeMo框架(NeMo RL和NeMo Gym)运行一个轻量级、用户侧无需编码的“Autoresearch”自动研究工作流。该工作流展示了三种核心能力:全栈自主性(设置软件栈、管理…

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-07-14

OpenAI 提出企业应从“每美元有用工作量”(useful work per dollar)出发,衡量并优化智能体相关AI投资,从而实现降本增效并规模化高价值工作流。具体评估框架与实证结果待核实。

OpenAI 发布了题为 _How to manage AI investments in the agentic era_ 的官方博客(发布日期待核实),针对企业在智能体时代如何管理AI投资给出了指导建议。核心主张是企业需要一套新的投资衡量标准,而不仅仅是追踪模型成本或计算资源。

产业观察 · 原始来源:OpenAI · agent
事件日期 2026-07-14

Glean创始人Arvind Jain认为,前沿AI模型层正快速商品化,OpenAI和Anthropic提供的垂直应用套件过于肤浅,难以在企业应用层取胜;企业级AI的真正壁垒在于深层上下文与权限管理,而直接暴力检索成本高昂;他预判三年内多数企业负载将运行在开源模型上。

在腾讯研究院AI速递20260714中,Glean创始人Arvind Jain就AI产业格局发表观点,指出模型层商品化趋势,并批评头部AI公司(OpenAI、Anthropic)的企业应用策略不足。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-14

浪潮信息推出业界首款CPU原生液冷整机柜服务器及升级版元脑SD200超节点,单柜最高支持384颗CPU、可承载4万+智能体协同,面向智能体时代重构算力体系。

2026年7月,浪潮信息发布两款面向智能体时代的新型算力设备:一是CPU原生液冷整机柜服务器,基于开放OCM架构(Open Compute Module),实现全域部件液冷并适配800V高压供电;二是升级版元脑SD200超节点,在Kimi K2.6万亿模型上单Token生成低至4.77ms,支持多模融合,在DRACO等基准表现超越单一模型。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-14

Anthropic Claude Platform高管认为,AI agent正从聊天界面转向深嵌组织流程的“隐形操作系统”,其核心演进是复杂脚手架变薄、智能体身份独立化,企业应分三步衡量ROI。

2026年7月,Anthropic三位负责Claude Platform的高管在一次对谈中阐述了agent形态的演变趋势。他们指出,Anthropic的平台定位已从单纯提供API,演进为承接基础设施与脚手架的智能体平台;随着模型能力增强,原先用于编排agent的复杂“脚手架”正在变薄;智能体的身份将独立于特定工作流,能够按需申请权限;多智能体之间可以相互竞…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-14

现有度量深度估计模型通常针对单一相机类型(针孔或鱼眼)设计,难以处理实际系统中混合使用多种相机(如自动驾驶、机器人导航中同时搭载鱼眼和针孔相机)的场景。X-Lens 旨在解决异构相机系统下实时、准确的度量深度估计问题,支持可变数量的校准鱼眼与针孔输入视图。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

计划评估器(plan evaluator)可能奖励一个变得“不那么明确”的战略计划。本文系统研究了这种失败模式:在LLM生成的商业路线(venture routes)的分阶段期望值计分器中,删除计划中的某项中间转换(transition)并重定向其前驱节点,同时保留下游价值,会导致分数非单调变化(即分数可能上升)。论文通过命题1给出了分数变化的解析公式,并…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-14

本文揭示了生成模型输出中嵌入的水印在“检测→归因→提取→定位”四个法医层级上所需的最小样本长度,给出了首个紧的熵率定律:归因到 \(N\) 个用户之一需 \(\Theta(\log N / h)\) 个 token,提取 \(\ell\)-bit 载荷需 \(\Theta(\ell / h)\),且存在真实不可归因窗口和足迹-分辨率不确定性原理。

生成模型水印通常仅用于检测文本是否为机器生成。本文将其拓展为“法医阶梯”(forensic ladder):同一水印可完成归因(识别产生该文本的用户)、提取(携带隐藏载荷)和定位(找出经编辑后仍存活的片段)。核心问题是:每一级在样本长度 \(n\) 上的代价是多少?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条