AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1921-1940 条,共 2269 条
第 97 / 114 页
事件日期 2026-07-13

Song 等人提出将“可持续性机器人学”(Sustainability Robotics)确立为一门新学科,通过三大指导原则(最小侵入性、普遍可及性、共生性)和两个互补维度(可持续机器人设计、机器人可持续解决方案),克服当前机器人发展碎片化问题,使技术进步与全球可持续发展目标对齐。

机器人技术在应对气候变化、医疗、教育等可持续性挑战方面潜力巨大,但当前相关研究缺乏统一框架,存在碎片化风险,可能导致技术获取不平等、错失广泛影响机会。为此,该篇 Perspective 文章倡导建立“可持续性机器人学”这一新学科,以整合科学、工程、经济、伦理与政策视角。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-07-13

该论文对一份已发表的教学评论分类协议进行回溯性基准测试,发现该协议在2019年冻结编码器、稀疏词特征、提示大语言模型等三代表征方法下均保持有效;在情感分析任务上,前沿模型并未比廉价模型表现出显著优势,跨语言(西班牙语→英语)迁移也未发现描述性分离,表明模型选择本质上是部署决策而非协议属性。

高校收集的大量开放式教学评价反馈往往得不到充分阅读。此前研究基于标注指南、标注者内部一致性测量、分层交叉验证和冻结编码器设计,在西班牙语机构语料上建立了一套将评论按主题类别和情感分类的验证协议。本研究关注两个未解决的限制:该协议在表征方法不断演进后是否仍具竞争力;该协议的情感分类能否迁移至第二种语言(英语)。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-12

Claude Code 2.1.205 版本新增的 `/checkup` 命令,将程序员手动优化的配置、上下文清理、插件管理等杂务打包为一键式智能操作,标志着 AI 编程工具从“需要人类时刻看护的高能婴儿”进化为具备工程直觉和自治能力的系统。

2026 年 7 月 12 日,Anthropic 正式发布 Claude Code 2.1.205 版本,包含 23 项 CLI 升级。其中核心亮点是 `/checkup` 命令(原内部代号 `/doctor`),旨在自动诊断并清理 AI 编程环境中的冗余技能、MCP 工具、过期规则、慢速钩子等,释放宝贵的上下文窗口空间。同时新增两条安全护栏:拦截对会话…

产业观察 · 原始来源:新智元 · ai-industry
事件日期 2026-07-12

曙光8000(登峰)是中国首个全国产十万卡AI超集群,通过“原生超智融合”架构实现高精度科学计算与低精度AI训练推理的一体化集成,标志着国产算力从万卡迈向十万卡时代的系统性突破。

在AI for Science(AI4S)和大模型对算力规模与精度的双重需求下,传统“偏科”式算力(高精度慢、低精度不准)已无法满足混合计算场景。2026年7月,中科曙光发布曙光8000(登峰),这是一套全链路自研的十万卡级AI基础设施,采用原生超智融合路线,实现从芯片到网络、存储、散热的系统级重构,并已与北京科学智能研究所达成第二套十万卡系统建设合作。

产业观察 · 原始来源:新智元 · ai-industry
事件日期 2026-07-12

在 IBM 真实量子处理器上,实验将基于 Simon 算法的 Even–Mansour 密钥恢复从已发表的硬件前沿 N=4 推进至 N=10,并将 3 轮 Feistel 结构密钥恢复从块大小 4 推进至块大小 8;但这不是实用量子加速,实际噪声下攻击难度跟踪经典生日界限。

**背景**:对称密码学也面临量子攻击威胁。Kuwakado 和 Morii 指出,Simon 算法可多项式时间恢复 Even–Mansour 结构密钥,并区分 3 轮 Feistel 与随机置换;Kaplan 等人(CRYPTO 2016)将此类攻击推广到多个模式和 MAC。然而,这些此前停留在理论与模拟层面。 **核心问题**:在真实、有噪的量子硬件上…

学术前沿 · 原始来源:Hugging Face 博客 · foundation-model
事件日期 2026-07-12

Google Research在2025–2026年间发布了十余项应用AI(特别是生成式AI、地球AI和开源模型)应对气候与可持续性挑战的研究与工具,覆盖洪水预测、森林保护、热韧性、交通减排、野生动物识别、水下声学分析等领域。

根据Google Research Blog的“Climate & Sustainability”标签页面(收录2006年至今,集中可见2025–2026年的最新博文),团队在一年半内推出了多项面向气候行动的产品化研究: **2026年7月**:联合研究减少交通拥堵的方法(跨算法、数据挖掘与气候标签)。 **2026年6月**:将热韧性数据扩展至全球50+…

学术前沿 · 原始来源:research.google · foundation-model
事件日期 2026-07-12

ParseBench是一个包含约2,000页人工验证企业文档、超过167,000条测试规则的开源基准测试,评估AI代理文档解析的五个关键维度,发现LlamaParse Agentic模式以84.9%整体得分领先,但图表解析仍是主要难点。

现有文档解析基准(如OmniDocBench)存在两个不足:1)主要使用学术论文或网络内容,缺少企业文档(如保险、金融、政府文件);2)使用文本相似度指标(BLEU、ROUGE等)无法捕捉语义错误(如表格标题错位、图表被降级为原始OCR文本、删除线被忽略)。为此,LlamaIndex推出了ParseBench,专门衡量文档解析的语义正确性,确保解析输出保留…

学术前沿 · 原始来源:LlamaIndex 博客 · benchmark-evaluation, agent
事件日期 2026-07-12

材料中描述了一种用于评估和提升智能体性能的方法或平台,但具体细节无法从现有元数据确认。

该材料来自 LangChain 博客,标题为“Evaluation Score and improve agent performance”,核心关注如何通过评估分数来改善智能体(Agent)的表现。由于未能抓取正文,具体研究框架、评估指标或工具细节待核实。

学术前沿 · 原始来源:LangChain 博客 · benchmark-evaluation, agent
事件日期 2026-07-12

LangSmith 的可观测性功能让开发者能够实时查看 AI 代理的每一步操作,包括工具调用、内部推理和最终输出,从而快速定位问题并优化性能。(待核实具体实现细节)

本文档来自 LangChain 官方博客/文档页面,主题为 LangSmith 平台的可观测性能力。核心问题是:如何让开发者清楚地了解复杂代理系统在运行时的内部状态,而不仅仅是最终结果。

学术前沿 · 原始来源:LangChain 博客 · agent
事件日期 2026-07-11

随着机器人基础模型(如视觉-语言-动作模型)的能力快速提升,如何对它们进行严格、可重复的评估成为尚未解决的难题。现有仿真基准测试存在四个主要缺陷: **视觉域重叠**:训练与评估使用同一仿真环境,模型表现仅反映记忆而非泛化能力; **基准饱和**:固定任务集被快速刷分,无法区分模型真实能力差异; **诊断缺口**:二元成功/失败评分无法解释失败原因(如颜色…

产业观察 · 原始来源:NVIDIA 博客 · benchmark-evaluation
事件日期 2026-07-11

Epoch AI 于 2026 年前后发布了一系列关于 AI 芯片、数据中心、模型能力、财务与地缘政治的研究与数据洞察,揭示出 AI 计算基础设施投资急剧增长、芯片瓶颈向封装与 HBM 转移、模型能力加速(尤其推理模型)等关键趋势。

该卡片整合了 Epoch AI 官网“Latest”页面截至 2026 年 7 月的全部最新出版物,涵盖数据洞察、新闻简报、报告、论文、播客与专题概览。研究主题涉及 AI 芯片供应链、数据中心资本支出、模型基准测试(如 MirrorCode、FrontierMath)、AI 工作场所采用、计算走私估算、AI 公司财务等。

产业观察 · 原始来源:epoch.ai · ai-industry
事件日期 2026-07-11

METR 通过自主能力评估、第三方风险报告审查及红队测试,系统测量前沿 AI 系统可能引发的灾难性风险,为行业提供独立、公开的评估参考。

METR(Model Evaluation and Threat Research)公开发布了其风险评估工作成果,包括: **前沿风险报告**(2026 年 2 月至 3 月):对前沿 AI 公司的“失控部署风险”进行试点评估。 **第三方审查**:对 Anthropic 的多份风险报告(如“自动化研发风险”“破坏风险”等)进行独立审查,并参与 OpenA…

产业观察 · 原始来源:metr.org · ai-industry
事件日期 2026-07-11

NIST AI风险管理框架(AI RMF 1.0)获得了来自企业、行业协会、智库和政策倡导组织的广泛正面评价,被认为是促进负责任、可信赖人工智能开发和部署的重要自愿性基准工具。

NIST于2023年1月发布了《人工智能风险管理框架》(AI RMF 1.0),这是一套自愿性指南,旨在帮助组织在设计、开发、部署和使用人工智能系统时管理风险并提升可信赖性。该框架通过公开、透明、多方参与的过程制定,官方观点页面汇集了多家组织与个人的支持性声明。

产业观察 · 原始来源:nist.gov · ai-industry
事件日期 2026-07-11

AI对齐(Alignment)不仅是技术问题,更是关于“该让AI遵守谁的价值观”的哲学问题。因此,以Google DeepMind和Anthropic为代表的头部AI公司,开始将哲学家、伦理学家甚至宗教领袖引入实验室,以应对技术手段无法独立解决的规范性问题。

**核心事件**:2026年5月,教宗利奥十四世在梵蒂冈发布首道通谕《Magnifica Humanitas》(壮丽人性),聚焦“在人工智能时代守护人性”。AI公司Anthropic的联合创始人Chris Olah作为产业代表出席。 **核心问题**:如何实现AI对齐,即让通用人工智能(AGI)的目标、行为与人类价值观保持一致,避免AI失控?这一问题的深层…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-11

NVIDIA 推出了集成 GPU MSA、cuEquivariance 加速推理、OpenFold3 NIM 和 Fold-CP 多GPU扩展的端到端加速方案,并通过 BioNeMo Agent Toolkit 以智能体工作流的形式编排,显著提升了生物分子结构预测管道(特别是共折叠模型)的速度和规模。

生物分子结构预测和共折叠模型(如 OpenFold3)已成为药物发现和蛋白质设计的主流大规模工作负载。其端到端流程包括:多序列比对生成、共折叠推理、模型服务和多GPU扩展。传统的CPU处理MSA和单GPU内存限制成为性能瓶颈,阻碍了虚拟筛选和大分子复合物(如核糖体级别)预测等应用。

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-07-10 信息日期 2026-07-24

LLM辅助编程教育中,通过纳入学生真实体验的“三人民族志”对话,教育者能发现课堂上不可见的深度学习过程,从而修正自己对AI使用、评估和教学法的假设。

本研究是一份经验报告,采用“三人民族志”方法,邀请两位教学理念不同的计算机科学教育者与一位本科生组成三人小组,通过三次结构化对话追踪教育者对LLM支持编程学习的解释如何演变。第一次对话聚焦教育者对课堂中AI使用的观察,第二次讨论教学法调整,第三次在听取了学生的亲历叙述后重新审视此前假设。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-10

在 JAX 大语言模型训练中,通过主机卸载(Host Offloading)将部分激活值移至主机内存,并在反向传播时流回 GPU,能够显著缓解高带宽内存(HBM)压力,在 NVIDIA GB200 NVL72 上针对 DeepSeek-V3 671B 实现最高 57% 的吞吐量提升,且能支持更大批次配置。

大语言模型训练时,模型权重、梯度、优化器状态、通信缓冲区和中间激活值竞争 GPU 高带宽内存(HBM)。随着模型规模、序列长度和批大小增长,HBM 容量常常成为首要缩放瓶颈。本文探讨了在 JAX 中利用主机卸载技术来缓解 HBM 压力的方法,并重点分析了其在 NVIDIA Grace Blackwell 和未来 Vera Rubin 平台上的优势。

产业观察 · 原始来源:NVIDIA 博客 · foundation-model
事件日期 2026-07-10

通过使模型维度(隐藏维度H、中间投影维度H')近正方形、将其对齐GPU tile尺寸(至少128的倍数,优选256或512),并采用宽度优先于深度的架构比例,可以显著提升LLM推理的吞吐量和交互性,在不牺牲精度的情况下推动系统Pareto前沿外扩。

NVIDIA技术博客文章探讨了如何通过模型-硬件协同设计(Model Co-Design)来优化LLM的部署性能。核心问题是:在固定精度的前提下,如何同时优化吞吐量(tokens/秒)和交互性(用户感知延迟),使模型在Blackwell等现代GPU上不仅运行更快,而且扩展性更好、成本更低。

产业观察 · 原始来源:NVIDIA 博客 · foundation-model
每页 20 条