AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1981-2000 条,共 2269 条
第 100 / 114 页
事件日期 2026-07-09

OpenAI 于 2026 年 8 月推出 ChatGPT 桌面应用 Linux 预览版,将 ChatGPT、Work 与 Codex 整合进同一客户端;其中 Codex 能直接操作本地项目、代码库和终端,是本次更新的关键亮点。

文章称,OpenAI 官宣 ChatGPT 桌面应用 Linux 版本开放预览,首批支持 Ubuntu 24.04/26.04 LTS、Debian 13、Fedora 43/44,提供 x64 与 ARM64 架构的 .deb/.rpm 安装包,预览面向全球开放。 2026 年 7 月 9 日,OpenAI 发布 ChatGPT Work,将独立 Cod…

产业观察 · 原始来源:新智元 · ai-industry
事件日期 2026-07-09

波士顿动力通过人类运动演示(如足球运动员的动作)来训练其Atlas机器人,使其能够完成类似运动员的复杂物理动作,并将Atlas从研究机器人演化为工业人形机器人。

波士顿动力在其官方博客中提出一个问题:足球能否教会机器人运动?他们指出,运动员每天都在完成令人惊叹的身体动作,而这正是他们为Atlas机器人设定的标准。他们正在探索如何从人类演示中训练Atlas,使其具备类人的运动能力。该博客同时概述了Atlas从研究机器人向工业人形机器人的演化过程。

产业观察 · 原始来源:bostondynamics.com · ai-industry
事件日期 2026-07-09

Anthropic 于 2026 年 8 月 4 日宣布,Mariano-Florentino (Tino) Cuéllar 将加入公司,担任其首任 Chief Global Affairs Officer,负责全球政策、战略国际参与及政府关系。

Anthropic 宣布,Tino Cuéllar 将出任公司首任首席全球事务官(Chief Global Affairs Officer),领导公司在全球范围内的政策、战略国际参与和政府关系工作。

产业观察 · 原始来源:Anthropic 博客 · ai-industry
事件日期 2026-07-09

2026年世界人工智能大会(WAIC 2026)将于7月17日至20日在上海举办,以“智能伙伴,共创未来”为主题,规模再创新高:超10万平方米展览、1100余家企业参展、推出3000余项展品,并首次设立OPC专属展示区,180家企业携成果入驻。

WAIC 2026由上海市经济和信息化委员会等主办,分设世博、张江、西岸三大片区。大会设置论坛会议、展览展示、评奖赛事、应用体验、创新孵化、招才引智六大板块。计划举办140余场主题论坛,集聚1400余位国际嘉宾。展览总面积超10万平方米,全球1100余家企业参展,将推出3000余项展品。大会首设OPC专属展示区,已有180家企业携成果入驻。

产业观察 · 原始来源:量子位 · ai-industry
事件日期 2026-07-09

通过为 NVIDIA Nemotron 3 Ultra 构建定制的 LangChain Deep Agents harness profile(如添加 `ReadFileContinuationNoticeMiddleware` 中间件),可在不进行微调的情况下提升开源模型的 agent 准确性,使其接近专有前沿模型的水平。

Agent 系统通常面临准确性-成本的权衡:专有前沿模型与 harness 准确性高但成本昂贵。微调是改善方法之一,但需要专业知识、硬件和定制模型托管。本文探索一种替代方案——**harness 工程**(harness engineering):通过修改 agent harness 的提示、添加/移除中间件或子 agent,使模型调用更接近训练数据,从而…

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-07-09

Anthropic 将 Claude Cowork 扩展至手机和网页端,任务迁移至云端后即使合上电脑也能持续执行,并遇到需决策时推送手机等待用户确认;该 agent 产品面向日常杂活,与巨头同步布局 agent 增量市场。

2026 年 7 月 9 日,Anthropic 宣布 Cowork 正式登陆手机和网页端。核心变化包括:任务从本地设备迁移至云端运行,用户合上电脑后任务仍持续执行;Chat 与 Cowork 合并入口;用户用量翻倍,有效期顺延至 8 月 5 日。Cowork 具备自主拆解任务、探测连接器、拉取 Slack/邮件/日历数据的能力,在需要决策的关键节点会推送…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-09

ChatGPT Work 是 OpenAI 推出的一个智能代理(agent),能在用户的应用和文件间执行操作,可长时间跟踪项目,并将目标转化为完成的工作成果。

OpenAI 于其官网发布公告,介绍名为“ChatGPT Work”的新产品/功能。该功能旨在将 ChatGPT 从对话工具升级为能够主动执行跨应用、跨文件操作的协作伙伴,以支持用户完成最雄心勃勃的工作。具体发布时间、定价与可用性待核实。

产业观察 · 原始来源:OpenAI · agent
事件日期 2026-07-09

ZipDepth是一个仅6.1M参数的紧凑型单目深度网络,通过知识蒸馏与高效编码器-解码器设计,在零样本精度与部署效率之间取得最佳平衡,可在从服务器GPU到功耗受限设备上实现实时运行,性能接近参数量大50倍的基础模型。

单目深度估计在基础模型推动下取得了稳健的零样本泛化能力,但计算需求远超嵌入式与移动平台。已有的轻量级替代方案几乎仅在单域自监督范式内开发,在域迁移时无声失效。ZipDepth旨在弥合这一鸿沟,通过结合高效可重参数化编码器-解码器架构与来自基础模型的大规模多域训练集知识蒸馏,实现轻量级零样本深度估计。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

该论文提出一种受 Lisp 启发但语言无关的概念模型,将工作流定义、实例、推理记录、上下文快照和依赖关系表示为共享知识基底中的持久化知识对象,并区分确定性计算(derive)与 LLM 中介判断(infer),从而使工作流本身成为可检查、可恢复、可审查的知识对象。

大语言模型(LLM)应用越来越多地使用显式工作流来协调工具调用、检索、分支、检查点、人工审批等操作。现有工作流系统已解决许多执行层面的问题,但尚未将工作流本身视为可持久化的知识对象。本研究旨在建立一个概念模型,让工作流不仅产生知识并留下痕迹,而且其自身也能被表示、检查、恢复和审查。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

WebSwarm 是一种渐进式递归委派框架,通过动态任务分解、递归扩展和智能体协作,在深度搜索、广度搜索及两者交织的复杂任务上,显著优于单智能体与现有并行多智能体基线。

基于大语言模型(LLM)的网络搜索代理正从简单事实问答转向“深度与广度”并重的研究型任务。单 ReAct 风格智能体受限于单一长轨迹与有限上下文,难以兼顾深度与覆盖;现有并行多智能体系统虽提升搜索覆盖,但在递归深度、协作适应性、以及基于证据的扩展上仍存在明确局限。WebSwarm 旨在突破这些限制,实现可递归、自适应的多智能体搜索协调。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

基于77,543名远程学生的客观日志数据,AI学习助手Syntea已融入许多学习者的日常学习,但其使用模式因性别、年龄、学习领域、学位和学习方式等人口与结构因素而异。现有研究多依赖小样本和自报告数据,本研究提供了大规模实际使用行为的实证基础。

本研究对高等教育中AI学习助手(Syntea)的使用进行大规模描述性分析。研究问题是:在不同人口统计学和结构背景(性别、年龄组、学习群组、学位、学习模式)下,学生的实际使用模式存在哪些差异? 英文标题:*Using AI-based Learning Assistants in Higher Education: A Large-Scale Descrip…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

UniClawBench 是首个基于能力驱动设计的基准,用于在动态真实环境中评估主动智能体(proactive agents),并通过细粒度逐步检查点、闭环评估策略以及多框架对比,揭示了基础模型能力与代理框架设计如何共同影响真实世界任务表现。

大型语言模型和多模态大语言模型的快速发展催生了能够操作日常工具并协助用户的主动智能体。然而,现有基准大多依赖沙盒环境和单轮评估范式,且基于场景的任务分类将多种模型能力混杂在同一任务类别中,难以定位智能体失败的根源。该研究旨在解决这一评估困境,提出一种能有效拆解和测量主动智能体关键能力的新基准。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

“超级权重”(Super Weights)——即单个重要性极高的参数——并不适合作为微调的目标;单独训练超级权重会导致模型性能崩溃,而有效的微调依赖于对整层进行结构化分解(如LoRA),而非针对个别重要参数。

近期研究指出,大语言模型(LLM)中存在“超级权重”:删除这些个别参数会使模型性能下降数个数量级。本文质疑这一现象的普适性,并进一步追问:如果超级权重如此重要,针对它们的训练是否有效?研究者在OLMo-1B和OLMo-7B上系统检验了选择性训练(selective training)策略,揭示了参数重要性并不等同于参数单独可训练性这一反直觉结论。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

SolarChain-Eval 是一个结合物理约束与 LLM 审计机制的基准测试平台,用于评估去中心化能源市场中自主智能体的任务性能与可信度;实验表明,仅追求收益的强化学习智能体会产生不安全行为,而加入 LLM 规划/审计层可提升可审计性但无法完全补偿错误奖励函数。

随着智能体 AI 系统越来越多地应用于网络物理环境(如去中心化能源市场),其评估需要同时关注任务性能和可信度。自主智能体可能改善市场效用,但也可能利用无效物理数据、制造虚假流动性并产生不稳定的治理决策。为此,研究者提出了 SolarChain-Eval,一个受物理约束的基准,用于评估可信经济智能体。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

SAM-MT 基于 SAM2 改造,通过将延迟与目标数量解耦,实现了与单目标基线相当的多目标实时视频分割(10 个目标时 >36 FPS),同时保持 SAM2 的鲁棒分割性能。

现代视频对象分割(VOS)在单目标场景中表现优异,但扩展到多目标时,通常将单目标处理流程复制到每个对象,导致帧率(FPS)随目标数增加而下降,延迟无界增长。本文提出 SAM-MT,将 Segment Anything 2(SAM2)转化为交互式实时多目标分割框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-09

在预算约束下,将重采样(resample)与重路由(reroute)视为同一查询预算的竞争性使用,并基于每单位成本的估计边际正确率进行在线分配,可以在成本-质量Pareto前沿上显著优于现有基线,尤其在模型异质性最高的基准上增益最大,且收益受验证器质量门控。

大语言模型(LLM)服务中,路由(routing)机制在响应质量与部署成本之间做权衡。已有研究表明,部署的路由器与每实例最优(per-instance oracle)之间存在差距;进一步分析表明,测试时的重采样可以恢复单次提交路由器无法捕获的选择空间,但该保证仅在拥有正确标签且预算无约束的理想条件下成立。本文首次将“对已提交模型进行重采样”和“切换到另一模…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条