AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1301-1320 条,共 2259 条
第 66 / 113 页
事件日期 2026-07-29

SpecFirst 将行为规范提取作为独立阶段前置到代码合成之前,在 ProgramBench 基准上将测试通过率提升 6.9%–21.3%,证明了“需求工程先行”范式对于从零开始的程序构建的有效性。

LLM 智能体在已有代码库的软件工程任务中表现出色,但从头构建程序仍极具挑战。ProgramBench 基准显示,面对仅含自然语言文档和可执行二进制的行为 oracle,即使前沿模型解决率也低于 1%。现有框架将文档阅读、行为探索和代码合成混为单次循环,导致探索不足、行为意图漂移、早期误解被传播。研究问题:能否借鉴经典需求工程,将行为规范提取作为独立的一等…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

WindCastNet 是首个直接从卫星散射计星座不规则观测数据学习海上风速和风向的临近预报框架,在北海测试中相比数值天气预报模型 HARMONIE MEPS,于 1 小时和 2 小时提前期分别降低均方根误差 23% 和 7%,前三小时优于持续性预报 9–15%。

准确的海上风电日内预报对电力系统运行及高比例风电并网日益关键。现有运行预报主要依赖数值天气预报(NWP),但 NWP 对分钟至小时级(主导因素为初始场精度)的提前期优化不足。卫星散射计观测虽被常规同化进 NWP,却从未被直接用于预报。本研究提出一种新范式:直接利用欧、中、印三颗散射计卫星组成的星座所获取的时空不规则微波雷达观测,进行海上风场预报。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

本研究提出 CE-CM 及 CE-CM-Div 方法,通过推断任务不变的能力向量,使智能体在无预训练、仅少量任务交互下即可适应具有隐藏能力的未知合作伙伴,并在模拟实验和离线人类研究中显著提升了能力估计的准确性。

现有临时团队协作(Ad-Hoc Teamwork, AHT)研究通常假设:①合作任务单一且固定;②合作伙伴执行期望动作的能力已知。然而现实场景中伙伴的真实能力往往是隐藏的,且人类在具有多个有效策略的任务中可能表现出次优行为。为此,本文将 AHT 扩展至多任务场景,将其重新表述为在隐藏伙伴能力下进行分散式执行的联合规划问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

Pangram 4 在 AI 文本检测任务上实现了 AUROC 0.9916,假阳性率仅 0.0041%,假阴性率 0.3396%,并在分布外泛化、对抗鲁棒性、细粒度编辑与混合人机合著文本检测上均优于上一代模型,达到当前 SOTA 水平。

Pangram Labs 发布了第四代深度学习 AI 文本分类模型 Pangram 4 的技术报告。该模型在标准 AI 检测基准上取得了全面领先的性能,尤其加强了对经过轻微编辑的 AI 文本、以及人类与 AI 混合作者文本的识别能力。同时,模型在边界检测任务(定位 AI 生成的起止位置)和交错式 AI 辅助检测上也展现了改进。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

OmegaUse-OfficeVal 基准通过为每项办公套件任务附加人工劳动时间和任务价格代理两种经济信号,允许直接对比人类成本与 LLM 推理成本,评估表明当前前沿 LLM 虽然成本更低、速度更快,但交付质量尚未达到人类水平。

现有 LLM 智能体基准多聚焦于通用任务或代码/数学领域,缺乏对办公套件(office-suite)长时程工作流的经济可行性评估,即“能否以合理成本完成真实办公任务”。本文提出 OmegaUse-OfficeVal,一个带有任务级经济锚定的基准,包含 100 个源自从业者实际请求并经过隐私保护改造的任务,平均每项需 2.32 小时人工完成。每个任务配有人工…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

MindForge 将开源命令行程序自动转换为“无源”训练环境(仅暴露编译后的可执行文件和文档),由此生成的合成训练数据能使小模型(Qwen3.6-27B)在从零编写完整程序这一极具挑战的任务上取得显著提升,并泛化到七种未见过的软件工程基准上。

当前编码智能体在修改已有代码库(如 bug 修复、功能实现)方面取得了较大进展,但“从零构建一个完整程序”仍是重大挑战——即使顶尖模型在 ProgramBench 上的完整解决率也不到 1%。主要障碍是缺乏覆盖软件工程全生命周期的、可扩展的训练环境。现有环境构建框架通常只聚焦于单一步骤。MindForge 旨在填补这一空白。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29
心理世界建模 已接受

将智能体的信念、意图、情感等心理变量作为世界模型的核心组件,而非事后解释,可以显著提升对人类决策的预测准确性。

Mental World Modeling

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

准确拟合期权价格并不能保证准确反推出隐含风险中性密度(RND);不同密度估计方法在价格误差和密度误差上的表现排名可能相反,因此应依据具体任务选择具有相应归纳偏置的模型,而非追求“万能赢家”。

期权定价中,从市场价格反演隐含风险中性密度是一项经典任务。通常认为模型在价格拟合上误差越小,其估计的RND越可靠。本文通过两个互补基准(受控合成基准与NIFTY指数历史市场基准)系统性验证了**价格精度并不等价于密度精度**,并考察了多种学习方法(如两成分对数正态混合、DeepONet、报价Transformer等)在两项指标上的差异及其根本原因。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

提出一种混合大模型与小模型的发现增强搜索架构,将电商搜索中意图驱动的候选商品覆盖率从约60%提升至80%,推理成本仅为大模型教师版本的约30%,同时保持语义相关性。

传统电商搜索系统(尤其是生鲜杂货领域)优化目标是精确匹配查询,优先保证精准率但牺牲召回率,导致替代品、互补品及主题相关商品难以被用户发现。本文旨在通过生成隐式用户意图来扩展候选召回,在不损害相关性的前提下提升商品可发现性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

本研究受果蝇感知环境机制的启发,提出了一种将回归任务重构为分类问题的新框架,通过构建有限局部模式库并基于相似度加权重建进行预测,在降低计算和存储需求的同时实现了对精度与成本的显式控制。(待核实具体实验验证)

研究问题:传统回归任务通常采用复杂的全局代理模型来学习输入-输出映射,但在科学数据(如动力系统、物理信息学习)中,输入空间往往只占据有限且重复的区域。受果蝇高效处理环境信息的生物启发,本文尝试将非线性回归问题转化为基于有限局部模式的分类与加权重建问题,以降低计算和存储成本,并提升可解释性和控制能力。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

在基于价值函数的强化学习(RL)微调中,对Q函数进行预训练(与预训练策略配合)并不能稳定带来性能提升,随机初始化Q函数在多数情况下效果相当甚至更好;作者提出了一种简单的集成策略初始化方法(IPE)可将微调性能提升平均1.26倍。

预训练+微调已成为学习高性能策略的主流范式。对于基于价值函数的RL,一个自然的问题是:给定一个预训练的策略,Q函数是否也应该在离线数据上预训练?传统观点认为应该,但近期结果表明,使用随机初始化的Q函数进行在线RL也能产生高性能且可靠的策略。本文系统研究了在预训练基础策略上进行微调时,预训练Q函数是否真正有帮助。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

前沿AI智能体可以自主完成AI研究的工程部分(如代码实现),但在提出有意义的科学问题、创造性应对研究设计缺陷、有效回溯死胡同、合理分配计算资源以及遵循原始指令等关键环节仍存在系统性失败,无法独立完成一项高质量论文的开放式研究问题。

该研究提出了一种衡量AI研发自动化进展的新型评估方法——“影子评估”(shadow evaluation):让AI智能体接手一篇高质量未发表论文的核心开放式研究问题,并由该论文的原始作者对其输出进行评分。研究者对两篇未发表的NeurIPS 2026投稿进行了影子评估,给予前沿智能体6天时间和数千美元的计算资源。智能体在没有人类帮助的情况下完成了所有工程任务…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-29

APEX-Accounting 是一个由 Mercor 与 Ramp 联合构建的封闭会计任务基准,用于评估前沿模型是否能完成真实会计师的工作。当前最佳模型 Claude-Fable-5 (Max) 在 Mean Criteria@3 上仅达到 56.4%,且所有模型在严格通过率(Pass^8)上均低于 3%,表明现有模型尚不具备可靠的会计实务能力。

APEX-Accounting 旨在回答:当前最先进的 AI 模型能否像专业会计师一样完成对账、应计费用、过账和生成报告等真实业务操作?该基准将会计任务从理论问题扩展为包含完整会计系统、电子表格、PDF 等真实工作环境的综合评估。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

Midjourney通过收购月活约430万的占星应用Co-Star,将Co-Star的二十多名员工全部并入,创始人出任首席设计官;同时加速打造首款独立图像生成应用,并计划将Co-Star的社交玩法融入自家产品,探索AI图像/视频中的共创与兴趣匹配功能。

2025年7月前后(来源日期为20260728),AI实验室Midjourney宣布收购占星应用Co-Star。Co-Star月活跃用户约430万,其二十多名员工全部加入Midjourney,创始人Banu Guler出任首席设计官。另外,Midjourney正在打造首款独立图像生成应用,此前已宣布开发包括“全身超声仪”在内的八个软硬件项目,以“人文主题”…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-28

微软在FY26观察到客户从AI实验转向实际业务部署,出现“前沿企业”(Frontier Firms)——它们不再只追求效率,而是将AI嵌入核心运营,并通过Copilot、Microsoft IQ和Agent 365构建可持续增值的智能与信任平台。

2026年7月28日,微软商业业务CEO Judson Althoff在官方博客发表《Looking back on Microsoft’s FY26: From AI experimentation to Frontier Transformation》,回顾微软2026财年(FY26)中客户采用AI的转变。文章提出“前沿转型”(Frontier Tra…

产业观察 · 原始来源:Microsoft AI 博客 · ai-industry
每页 20 条