AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 241-260 条,共 2259 条
第 13 / 113 页
事件日期 2026-08-28

QGPINNs 是一个基于 PyTorch 的物理信息神经网络框架,专用于求解量子图上的非局部微分方程(如多阶分数阶椭圆问题和时间分数阶演化方程),并通过统一的图损失函数将边上的神经网络解耦合为全局解,同时可扩展求解逆问题。

本研究提出 QGPINNs(Quantum Graph Physics-Informed Neural Networks),旨在解决量子图(由边和顶点构成的度量图)上的非局部微分方程数值求解问题。传统 PINN 主要针对单域或简单几何,而量子图上的微分方程需要处理边上的解、顶点处的传输条件以及分数阶算子的非局部性,挑战更大。该框架试图提供一个通用的计算实现…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

PCMI(Phoneme-Cluster Mutual Information)和 WACS(Word Acoustic Consistency Score)是两种基于自监督语音表征的语料级指标,可在不依赖人工标注时间戳的情况下评估强制对齐质量,从而支持大规模和多语言场景。

强制对齐评估通常需要手动标注的时间戳,限制了大规模和多语言分析。本文提出两种“免参考”(reference-free)语料级指标,利用自监督语音表征对强制对齐结果进行质量评估,无需参考时间戳。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

本文给出加权 Dikin 行走混合时间的两个证明:对于多面体上的指数分布采样,使用 Lee–Sidford、Lewis-weight 或 John 度量时可得到 $\widetilde O(d^2)$ 的总变差混合界;对于适当缩放的 Lee–Sidford 度量,还可在 $\chi^2$ 散度下得到 $\widetilde O(d^2)$ 混合界,改进此前…

研究加权 Dikin 行走从多面体和截断半正定(PSD)锥上的指数分布采样的混合时间。作者提出统一的证明框架,对不同度量给出混合界,并给出第二个更强的 $\chi^2$ 散度分析。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

Claude Code 插件市场正在快速扩张,插件开发以功能提交为主导;技能目录中的自然语言指令文件与实现脚本存在显著共演化,构成一种传统软件工程中未观察到的维护依赖类型。

AI 编码智能体通过推理和工具调用来自动化开发任务,越来越多地通过插件市场进行扩展。与依赖源代码交付功能的传统软件包不同,智能体插件由自然语言指令文件、脚本和配置文件组合而成。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

NL2AGBench 是一个专门评测大语言模型(LLM)能否把英文几何题自动翻译成 AlphaGeometry 可执行形式语言(DSL)的基准,结果显示最强闭源模型的可执行翻译率超过 80%,而开源模型即使在最大规模下也较难稳定保持几何约束并生成合法形式化表示。

AlphaGeometry 这类神经符号几何系统在定理证明上已接近 IMO 金牌选手水平,但它的证明引擎要求输入用专门的领域特定语言(DSL)书写。目前,把自然语言几何题手动转换成这种形式语法是重要的使用瓶颈。论文提出 NL2AGBench,研究 LLM 能否自动完成这一“形式化”步骤。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

这篇系统综述覆盖 2023–2026 年同行评审文献,发现当前 LLM 安全智能体已经“能行动”——能规划、用工具、在多步流程中保持状态并修订计划——但尚未达到“权限有界、行为可审计”。领域中“agent”一词使用不一致、应用场景风险差异大、评估协议常不可比。

软件与系统安全流程通常是程序性的:分析者检查异构工件、形成假设、调用工具、解读输出、修订计划。LLM 智能体具备规划、工具使用、状态保持和多步修订能力,正被快速用于自动化这类工作。由于把安全决策委托给自主系统后果严重,理解这类智能体如何构建、使用和评估至关重要。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

本文提出 LTP-BIT,一种“先学目标域生成先验、后学源条件控制”的解耦训练范式,将遥感跨模态图像翻译中的目标先验学习与跨模态依赖学习分开;在 SAR-to-RGB 和 NIR-to-RGB 基准上仅用 9.81% 任务特定参数达到 SOTA,并在 QXS-SAROPT 上仅用 25% 配对样本保留接近全数据实例保真度。

跨模态图像翻译在遥感中需要保留源图像观测到的内容,同时匹配目标域的分布。现有方法通常从稀缺的配对数据中联合学习“目标域先验”和“跨模态依赖”,但忽略了一个关键不对称性:只有跨模态依赖本质上需要跨模态对应关系。本文通过条件分数(conditional-score)和去噪风险(denoising-risk)分析形式化了这一区别,并提出解耦训练范式 LTP-BI…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

本文研究输入协方差特征值按幂律衰减的各向异性高斯数据上的核岭回归,在多项式高维机制(\(n=\Theta(d^\kappa)\))下推导出核谱与泛化误差的渐近精确表达式,发现各向异性会从根本上重塑学习曲线。

研究问题:输入分布的各向异性如何影响核岭回归的泛化性能?作者针对高斯输入、多项式内积核,设定输入协方差特征值按幂律衰减(指数 \(\alpha \ge 0\)),并在样本量 \(n\) 与维度 \(d\) 满足 \(n=\Theta(d^\kappa)\) 的多项式高维机制下,给出核谱和泛化误差的精确渐近刻画。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

本文提出一个通用框架,用“规模-权重前沿”(size-weight frontier)刻画合成数据增强统计推断时的样本量与权重配置,并从历史任务中估计该前沿,从而对前沿上或下方的所有配置同时给出有限样本覆盖保证。在利用大语言模型回复增强民意调查数据的实验中,该方法达到目标覆盖率并显著缩窄置信区间。

真实数据稀缺时,合成数据可以改善统计推断;但简单地把合成样本当作真实数据使用会引入偏差,导致推断不可靠。论文研究的是在“一组相关任务”上进行合成增强推断的一般性问题:如何选择合成观测的数量以及赋予它们的权重,使得推断具有可信的覆盖保证。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

本研究提出 GOLLuM(Gaussian Process Optimized LLMs)——通过高斯过程的边际似然目标训练大语言模型,使其具备校准的不确定性估计,从而能够在自然语言指导下进行跨领域实验优化;仅从 10 个低性能实验出发,即可在 23 个任务上平均排名第一。

实验发现(从反应优化到分子设计)面临一个共同的高成本问题:在时间和资源约束下,下一个候选应该测试什么?贝叶斯优化(BO)提供了原则性答案,但严重依赖领域专家构造的特征表示,且这些表示难以跨领域迁移。大语言模型(LLM)包含丰富的科学知识,但缺乏高利害决策所必需的不确定性校准能力。本文试图将两者结合,使 LLM 成为可靠且易用的实验优化器。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-28

在LLM机器翻译中,顺序式测试时扩展(sequential sampling)相比并行式(parallel sampling,如i.i.d.采样+重排)具有更高的性能上限,其收益主要体现在翻译流畅性和自然度上;但当推理预算较大时,顺序采样反而可能损害翻译准确性。该增益可部分归因于模型能够访问更大的目标侧上下文(target-side context)。

本文研究测试时扩展在LLM机器翻译任务中的表现,关注两种范式:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

InstructMesh 是一个面向制造的交互式后处理精修工具,允许用户通过区域选择和局部操作(如打开/封闭空洞、调整局部厚度)修复生成式3D模型的几何缺陷;其关键设计是直接在中间潜变量表示上进行编辑,使没有专业建模技能的新手也能完成制造前的几何修正。

生成式AI虽可从文本或图像创建3D模型,但这些模型往往偏重视觉合理性而牺牲几何精确性,输出结果常带有会损害制造/打印后用途的缺陷。InstructMesh 针对这一问题,提出一种“生成后精修”的交互式方案,帮助用户选择性地修复生成模型中的可制造性问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

即使不同评分规则在理论上都激励模型“说出真实概率”,五种 proper scoring rules 作为 LLM 训练目标时,仍可能产生不同的校准、概率使用和误差结构;因此不能简单认为 proper scoring rules 可以互换。

该研究评估奖励函数选择如何影响 LLM 预测器的表现与行为。核心问题是:对于已解决的真实世界事件,使用五种 proper scoring rules 作为二分类预测的训练目标,是否会导致模型出现可区分的预测特征与误差结构。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

GeBDA 提出将建筑损毁评估(BDA)直接建模为文本序列预测任务:一个通用视觉-语言模型仅通过自回归生成,输出建筑物边界框及其损毁等级;初步实验表明,仅输入双时相卫星图像和合适的文本提示即可获得有前景的损毁映射结果。

研究问题:通用视觉-语言模型(VLM)能否不借助专用网络结构或地理空间基础模型微调,仅靠自回归序列生成完成建筑物的定位与损毁分级? 事件概述:作者将 BDA 定义为预测一个可变长度的边界框集合,每个边界框由坐标和损毁标签指定,并基于开放 Gemma 模型进行了初步实现。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

将人工智能融入地球系统模型(Earth system models, ESMs)虽然提升了模拟与预测能力,但也显著放大了可复现性挑战;本文提出将可复现性从“事后要求”重构为混合地球系统模型的“结构性属性”,并推出 RHEM(Reproducibility in hybrid Earth system models)参考指南与实施路线图。

这是一篇发表于 *Nature Machine Intelligence* 的 Perspective(观点文章),讨论的是融合人工智能的混合地球系统模型(hybrid ESMs)的可复现性问题。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-28

DARTS 提出了一种面向自回归解码器的模型合并后表示偏置校正方法,通过熵加权 L1 损失和逐位置加性偏置,在新增参数约 0.1% 的情况下,显著改善合并模型在代码生成、数学推理和指令跟随等任务上的表现。

模型合并(model merging)可以将多个任务专用微调后的大语言模型组合成单个多任务模型,而无需额外训练。但合并后的模型普遍存在“表示偏置”(representation bias),即合并模型的隐藏状态与每个源模型的隐藏状态之间出现系统性漂移。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

COVER 是一种评估契约,通过在结果生成前固定公共信息边界、下游栈 G 和有限合法团队族,使有限基准上的“路由后悔值”(oracle regret)可被识别;受控测试表明它能暴露选择余量,但并未制造出“路由必胜”的结论。

多智能体系统在改变其团队时,也会改变它产生的消息和最终答案,因此端到端准确率差距本身并不能识别出“路由效应”。COVER 试图解决这一识别问题:如何在没有额外假设的情况下,把“选择不同团队/路由”的效果从系统整体表现中分离出来。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

ContextPilot 提出一种用于长程智能体任务的主动上下文管理框架,通过扩展规划、长期记忆和软上下文卸载工具,并使用面向上下文编辑动作的细粒度强化学习(RL),在长上下文问答和深度搜索任务中实现更强性能与更紧凑的工作上下文。

长程智能体任务中,LLM需要跨多轮交互反复检索、整合和维持分散信息;但保留全部交互历史会导致工作上下文持续增长。现有主动上下文管理方法允许模型用专用工具编辑自己的工作上下文,但仍存在三点局限: 1. 工具集受限,仅支持搜索、删除和摘要,缺少全局规划、长期记忆和自适应压缩; 2. 探索效率低,将所有上下文管理动作视为同等重要,忽略其对最终结果的不同影响; 3…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-28

本文提出一个分裂共形(split conformal)框架,使神经算子输出的校准逐点带能在评估域上至少 $1-\gamma$ 的比例内包含真实解,并且该覆盖保证在测试输入与校准输入上以至少 $1-\alpha$ 的概率成立($\alpha,\gamma\in(0,1)$)。在Darcy流与Navier-Stokes方程实验中,该校准带比现有校正方法更紧,同…

Conformal Uncertainty Quantification Guarantees for Neural Operators

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条