AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1141-1160 条,共 2259 条
第 58 / 113 页
事件日期 2026-08-03

在环境模型不确定的马尔可夫决策过程(UMDP)中,预先准备并部署少量(k个)策略,用极小极大遗憾准则优化这组策略,是NP-hard问题;作者提出精确嵌套分支定界算法KAPS。实验显示,遗憾下降最大的一步发生在策略数从1增加到2时;单策略情形下KAPS与现有方法质量相当且更常证明最优性。

现实中的序贯决策常面临环境模型不确定。UMDP将可能环境建模为一组共享状态和动作、但转移概率和奖励可能不同的MDP。若在所有可能MDP上优化单一策略,可能牺牲性能;若为每个MDP单独准备一个最优策略,又可能违反运营、监管或可解释性约束(如策略数量受限)。该研究考虑“模型不确定在即将执行前才被解决”的设置,从而可以在提前准备好的有限策略集合中选取最合适的策略…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

根据 arXiv 摘要元数据,本文构造了宽度为 O(n) 但 0-证书复杂度为 Ω(n²) 的无歧义 DNF,并利用常数大小的 gadget 证明一个提升定理,将证书复杂度分离转化为通信复杂度分离,从而给出 Alon-Saks-Seymour 猜想的最优反驳,以及 Clique versus Independent Set 问题的最优通信下界。具体证明细节…

研究问题涉及无歧义 DNF 的证书复杂度、通信复杂度中的提升定理,以及 Alon-Saks-Seymour(ASS)猜想与 Clique versus Independent Set(CIS)问题的下界。摘要表明本文改进了 Balodis、Ben-David、Göös、Jain 和 Kothari 在 FOCS 2021 / SICOMP 2023 的结果…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

本文提出了 onepot-Bench 0,一个面向湿实验室执行的合成化学能力评估基准套件,由 ChemAbacus、SynthRefusal 和 SynthBench 三项互补评估组成;材料中未报告具体量化结果,模型表现待核实。

语言模型在实验室科学中正发挥越来越重要的作用,涉及实验规划、执行和事后分析等任务。但作者指出,精确衡量模型能力是困难的,因为科学能力同时需要问题求解技能和领域直觉。现有评估很少针对在物理实验室中做出可靠决策所需的能力,并且常常依赖可能已经出现在模型训练语料中的公共数据。为此,本文提出 onepot-Bench 0,尝试构建“实验室感知”的计算机化学基准。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

MedPRESS 是一个包含 600 段五轮医疗对话的多轮基准,用于评估大语言模型在患者反复施压下是否会出现“医疗谄媚”(sycophancy),即放弃安全立场转而迎合患者不合理要求;测试显示多数模型会随对话升级而向不安全共识偏移,且反谄媚提示无法完全消除该风险。

MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

根据摘要,现有 AI 滥用检测大多针对单轮或同会话多轮威胁,攻击者可将有害目标拆解为看似无害的单元,并在多个相互隔离的智能体会话中逐步积累“能力”以规避检测;Magnet 是一种在用户 ID 等高层关联器上汇总跨会话能力痕迹、生成证据束的检测方法。具体检测性能与实验证据待核实。

研究观察:最强 AI 部署不再是单一模型,而是由专门化智能体组成的协作/委派系统;这种架构带来新能力,也带来既有监控、检测和缓解框架未设计覆盖的风险。 研究缺口:主流滥用检测文献聚焦于单轮或多轮(单一会话)威胁模型;攻击者可以把一个有害目标分解成多个看似无害的单元,分别在隔离的智能体会话中执行。 核心不对称:智能体在会话之间“无状态”,但攻击者“有状态”;…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

LiveMem 提出“上下文轮换下的状态连续性”(state continuity under context turnover):用一个固定容量的记忆状态把计算持续向前推进,使得支撑证据被移出当前上下文后,模型仍可能基于该记忆状态回答问题;在 LongMemEval 等评估中取得领先总体性能。

长期运行的助手和智能体会消费持续增长的交互流,最终超出上下文窗口。现有上下文保留、摘要、检索等方法可以保持对“被选中历史”的访问,但不能在上下文变化时提供覆盖整个生命周期的持久状态。作者将这一缺失能力定义为“上下文轮换下的状态连续性”,并为此提出 LiveMem。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

本文证明:在一般查询下,一比特均值估计要达到阶最优样本复杂度并不需要交互;一个完全非自适应的随机协议可以匹配两阶段自适应协议的最优样本复杂度,从而否定了 COLT 2026 开放问题中关于“交互是否必要”的猜想。

研究一比特均值估计问题:每个独立样本被表示为一个二进制消息,目标是在给定精度和置信度下估计实数分布的均值。考虑均值位于 $[-λ, λ]$、$k$ 阶绝对中心矩不超过 $σ^k$ 的分布族($k>1$ 固定)。此前的工作使用两阶段协议达到最优样本复杂度:第一阶段先定位均值,第二阶段根据定位结果选择查询以细化估计。本文提出的问题是:这种交互式查询是否必需?答…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

GradCuit(gradient through circuit)通过在 Transformer 选定层中插入可优化的连续潜在状态,并利用因果自注意力形成从整段续写 token 到潜在状态的可微路径,使奖励加权梯度能直接分配给这些潜在状态;在摘要报告的评测中,它平均准确率为 64.5%,超过思维链提示 6.6 个百分点,并比最强对比方法高 2.4 个百分…

优化式测试时潜在推理(optimization-based latent reasoning)是指在模型参数冻结的情况下,针对每个实例优化连续状态,以改进 LLM 输出。 既有方法通常通过“解码出的 token”把这些状态与推理轨迹连接起来,导致序列级信用分配(sequence-level credit assignment)是间接的,也模糊了潜在更新如何…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

本文提出仅利用参考图像的局部方差/标准差统计量,将全局MSE/PSNR重分配为局部MSE近似,从而在基于DCT(如JPEG)的压缩图像上准确估计SSIM,并显著优于直接使用全局MSE的基线方法。

图像与视频质量评估是编码、压缩和流媒体系统的核心需求。SSIM 具有较好的感知相关性,但通常需要局部统计信息;MSE/PSNR 是全局指标,计算简单但感知相关性较弱。本文研究的问题是:对于 DCT-based 压缩图像,能否仅从全局 MSE/PSNR 和参考图像的局部统计量出发,近似估计 SSIM,而不需要如以往工作那样假设可以获得局部 MSE。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

CoWAM提出一种可选择的策略干预层,通过将同步性、角色兼容性和碰撞收敛表达为“协调合约”,仅在备选动作满足所有义务且带来清晰、低风险改进时才替换机器人默认动作,否则保留默认动作或进入弃权回退。在八个仿真双手任务中,CoWAM提升了协调有效选择和闭环成功率,并将有害干预率控制在1%以下。

世界动作模型(WAMs)通过动作条件下的未来预测来增强机器人策略,但仅凭“未来看起来合理”并不足以证明应当改变双手策略原本要执行的动作。论文提出CoWAM,解决“何时以及如何对机器人策略进行保守干预”的问题,目标是让干预既有选择性又足够安全。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

CAPEval 提出将图像描述(caption)质量拆分为“覆盖度”(Coverage)和“精确度”(Precision)两个维度,并通过受控下游实验发现:覆盖度更能预测多模态理解性能,而精确度更能预测文生图生成性能。

图像描述(caption)既是多模态理解任务的重要监督信号,也是文生图模型的关键输入。以往评测往往把描述质量当作单一标量指标,混淆了两个不同属性:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

本文提出了一套面向电力系统领域AI教学的开放、可执行模块库(Jupyter Notebooks),通过由浅入深的任务阶梯,帮助初学者和跨学科学习者绕过“跑通AI模型”的障碍,实践工程接地AI(EGAI)。

AI在电力与能源系统中的重要性日益增加,用于建模、预测、优化和控制。然而,现有工作多聚焦专门应用,缺少可供新手和跨学科学习者复用的教学材料;这些学习者越来越多依赖大语言模型而非自行构建模型。论文指出需要“工程接地AI”(Engineering-Grounded AI, EGAI),即AI工作流应遵循工程和电力系统领域规则,而非充当与任务无关的黑箱。一项针对…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

大型语言模型(LLM)的内部表征与人类大脑在演绎推理任务中的活动存在部分对齐;作者提出用任务态fMRI脑信号直接引导模型表征,结合推理时干预和训练时微调,在10个LLM(1.5B–72B参数)上带来最高13%的绝对准确率提升,且效果可跨推理类型迁移。

论文聚焦演绎推理,研究LLM是否与大脑推理相关区域的神经信号对齐,以及这些信号能否反过来改进LLM推理。背景是:语言与推理在人脑中看似可分离,而LLM与人类高阶认知之间的对应关系尚未被充分刻画。作者先测量神经可预测性,再提出脑引导框架,试图将LLM与大脑的对应关系从“相关性”推进到“引导性”。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-03

Sheaf神经网络(SNNs)虽然理论上更强大且在直推式任务上表现有潜力,但其在归纳式(inductive)协议下的行为此前未知;本文通过14个归纳数据集上的1,890个受控实验首次系统评估其设计空间,发现限制映射(restriction maps)是主导设计选择,且整体性能差异更多来自周边GNN架构组件而非sheaf算子本身。

背景:Sheaf神经网络(SNN)将标准图神经网络(GNN)中的标量边权替换为可学习的、依赖边的节点茎(node stalks)之间的限制映射,从而泛化消息传递。 问题:此前SNN几乎只在直推式节点分类上被测试,缺乏对归纳协议的系统了解。 论文目标:填补这一空白,首次对sheaf设计空间进行归纳任务基准测试。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

AURORA-LM 提出了一种连续潜空间扩散语言模型:不把文本表示压缩到易建模的低维空间,而是保留高容量、可解码的文本潜变量,并让扩散模型直接学习其分布,在 OpenWebText 自由生成和 XSum 摘要任务上超过了评测中的所有连续/扩散语言模型。

语言建模仍依赖离散 token,而图像、视频、音频已在连续潜空间中建模。已有连续语言模型要么沿用非为联合生成与解码设计的嵌入空间,要么压缩自编码潜变量以简化扩散过程,牺牲 token 级保真度。AURORA-LM 的目标是既不简化表示,也不牺牲保真度,而是让扩散模型适应高容量文本潜变量。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

AtumAI 提出一个基于智能体 AI 的形式化、可迁移、系统化的框架,能从自然语言目标自动生成数据中心控制面策略;初步实验显示,其生成的策略在多个控制面任务上优于专家设计的基线。

数据中心效率取决于控制面策略。随着软硬件栈快速演进、设计空间庞大且相互关联,设计控制面策略越来越困难,单个策略的原型开发可能需要数月。论文指出现成的智能体 AI 在自动化这一搜索时存在三个不足:非形式化(缺乏结构化、可搜索的问题陈述,搜索难以利用结构,硬约束无法保证)、不可迁移(每个任务都从零开始,学到的经验无法迁移到下一个任务)、不系统(仅以 LLM 为…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

该研究提出了一种在随机环境中进行分布感知规划的原则性框架:通过价值函数与预测转移分布之间的“兼容性”条件,将贝尔曼备份化为关于分布矩的解析表达式,从而在传播预测均值与协方差的同时降低目标方差。

基于模型的无模型强化学习(model-based RL)在随机环境中需要处理预测不确定性。传统方法要么用随机采样传播分布,带来显著的目标方差;要么用确定性点估计,完全忽略预测协方差。本文研究的问题是:能否在不施加严格策略或奖励结构限制的前提下,实现解析的分布感知规划?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

生成式与智能体AI在语言生成和自主任务执行上已经表现出很强能力,但持续推理、自适应行为、持久记忆与自我调节等基础认知功能仍然分散或薄弱,限制了其在长时间跨度上的可靠运行;该论文提出一个围绕五个维度的分类学框架,系统梳理这些“认知能力差距”,并给出概念性的自适应认知智能架构(ACIA)与以认知为中心的评估方向。

该论文是 arXiv 上的一篇综述(cs.AI),英文标题为 *A Taxonomy of Cognitive Capability Gaps in Generative and Agentic AI*。研究问题是:在从“语言生成和自主任务执行”走向“持续推理、自适应行为、持久记忆、自我调节”的认知AI过程中,生成式AI与智能体AI仍然存在哪些关键的认知能…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

本文提出了一种岭回归估计量有限样本分布的简单高斯近似,并基于该近似设计了两种新的正则化参数选择策略;由于未能抓取原文,具体数值与推导细节待核实。

研究问题:经典岭回归估计量在有限样本下存在偏差与方差的权衡,如何更准确地刻画其分布并据此选择正则化参数? 作者提出一种基于非标准渐近的简单高斯近似,用以来近似岭回归估计量的有限样本分布。 该近似的两个关键设定(据摘要): 1. 正则化参数随样本量成比例增长; 2. 将总体回归系数视为相对于收缩参考向量的“局部”(local)参数。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-02

尹希的LinkedIn履历已显示加入OpenAI技术团队;他在深度体验GPT-5.6后表示,AI正在抹平物理学各子领域之间的边界,最大价值不只是“帮着做题”,而是“帮着出题”——能提出研究者自己未曾想到的新猜想,并自行编写数值检验。

新智元报道,哈佛最年轻华人正教授尹希首次出镜谈论GPT-5.6。今年5月底曾有相关传闻,当时尹希未出面确认;如今其LinkedIn页面已更新,正式加入OpenAI技术团队。OpenAI同日启动“ChatGPT for Academic Researchers”(学术研究员计划),将向全球10万名科学家、数学家和工程师免费提供前沿模型访问权;今年夏天先放出1…

产业观察 · 原始来源:新智元 · ai-industry
每页 20 条