AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1521-1540 条,共 2269 条
第 77 / 114 页
事件日期 2026-07-23

SANA-Video 2.0 通过混合线性‑softmax 注意力与块注意力残差,在单 GPU 上生成 720p 视频,质量媲美全 softmax 视频 DiT,推理速度比同规模全 softmax 基线快 3.2 倍,并借助 Sol-Engine 优化实现 120 倍于 Wan 2.2-A14B 的加速。

视频扩散 Transformer 的全局注意力计算复杂度随序列长度平方增长,限制了长视频、高分辨率的生成效率。现有线性注意力虽能实现 O(N) 缩放,但缺乏全秩令牌交互,导致表达能力下降。SANA-Video 2.0 提出一种混合注意力框架,在保持线性注意力长序列优势的同时恢复 softmax 级表达力,并探索如何通过注意力残差跨深度传播优质表示。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

通过共享正弦块迭代循环展开,隐式神经表征(INR)可在参数更少、优化步数更少的情况下获得比前馈基线更高的保真度,并在超分辨率、NeRF和SDF任务上迁移良好。

研究将正弦循环作为隐式神经表征中谐波谱增强的迭代机制。关键问题:如何利用迭代循环(而非单纯增加前馈层数)来丰富INR的有效频谱支持,从而用更低成本逼近高频细节。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

本文提出了在结构不可知的部分线性模型中,利用黑盒学习器估计线性系数的最优方法,其收敛速率 \(1/\sqrt{n} + \delta_{a,\mu} \cdot \delta_{a,\pi} + [\delta_s]^2\) 达到理论下界,比双重机器学习(DML)更优地移除了一个次优项,并进一步提出通用算法 TAME。

考虑部分线性模型 \[ Y = \mu_0(X) + \beta_0 \cdot T + \varepsilon, \quad T = \pi_0(X) + u, \] 其中 \(\mu_0\) 和 \(\pi_0\) 是未知的干扰结构,且研究者对其形式一无所知(结构不可知)。目标是在使用某个黑盒假设类估计这些干扰函数时,推断目标线性系数 \(\beta_…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

OpenForgeRL 是一个开源框架,通过轻量级代理和 Kubernetes 编排器解耦训练与推理,使得研究者能够直接在实际部署的 AI 代理推理框架 (Harness) 中,使用标准强化学习 (RL) 代码库对智能体进行端到端训练,并在多项工具使用和 GUI 操作基准上以较少任务量超越了同等规模的开放基线模型。

现代 AI 代理(如 Claude Code、Codex、OpenClaw)依赖复杂的推理框架来进行多轮推理、工具调用和系统访问。然而,这些框架的复杂性和有状态、多进程特性,使得它们难以与标准的开源 SFT/RL 训练栈(如 veRL)兼容。现有基础设施无法原生表达这种框架形式下的推理过程。为了解决这一痛点,论文提出了 OpenForgeRL,这是一个用于…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

本研究证明,仅使用重整化方程残差训练的神经网络可以高精度求解四维Landau规范杨-米尔斯理论中耦合的鬼和胶子Dyson-Schwinger方程,其解与标准定点解在百分比水平一致,且对多种超参数变化保持稳定。

Dyson-Schwinger方程(DSE)是描述非阿贝尔规范场论(如量子色动力学)非微扰行为的积分—微分方程系统。传统上采用数值迭代或定点方法求解,但对耦合系统(鬼和胶子DSE)的计算存在数值不稳定性或收敛慢等问题。本文探索使用神经网络表示替代传统数值求解器,仅从重整化方程残差学习,旨在验证神经网络方法能否可靠复现已知物理结果。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

MIRROR 是一种基于自监督强化学习的方法,通过让视觉-语言模型在同一问题的不同模态视图(纯文本、纯图像、图文结合)之间互相学习,显著提升了模型在几何推理任务上的准确性和跨模态一致性。

大型语言模型(LLM)已展现出强推理能力,但视觉-语言模型(VLM)在视觉推理上仍然困难,甚至在几何问题中——同一问题可以等价地表示为纯文本、纯图形以及图文结合三种视图——模型在不同视图上的表现往往不一致:同一模型可能从文本视图正确解题,但从图形视图却失败;反之亦然。这表明不同视图暴露了互补的推理路径和失败模式,而标准的多模态后训练未能充分挖掘这一现象。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

待核实(原文未提供明确的单一结论,从摘要推断:MedGame框架通过双引擎设计将静态临床案例转化为故事化游戏,在5000例基准测试和初步学生研究中显示出比纯文本方案更高的参与度和实用价值。)

现有的大语言模型医学教育系统大多聚焦于局部交互(如问答或单轮反馈),缺乏将整个临床案例组织成以决策为中心的学习轨迹的能力。本研究提出了**MedGame**框架,旨在将静态临床案例转化为结构化、可执行的故事化游戏,从而增强医学教育的沉浸感和学习效果。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

渐进式种子剪枝(PSP)打破了扩散模型推理时固定内存占用的约束,通过早期加载大量候选种子并逐步剪枝,在相同计算预算下显著提升了图像生成的对齐质量(GenEval 自动评估与人类评估),性能优于 best-of-N、重要性采样和树搜索等基线。

Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

本文通过构造更大的独立集,将奇环 \(C_7\)、\(C_{11}\)、\(C_{13}\) 的香农容量下界分别提升至约 3.258020、5.289773、6.300109,并展示了大型语言模型(LLM)在发现显式组合构造中的潜在作用。

香农容量 \(\Theta(G)\) 是图 \(G\) 在无噪声信道中零误差传输信息的最大速率。它的下界由任意 \(d\) 下 \(α(G^d)^{1/d}\) 给出,其中 \(α(G^d)\) 是图的第 \(d\) 次强幂的独立数。奇环(odd cycles)的香农容量精确值长期未知,此前已有大量关于 \(C_5, C_7, C_{11}, C_{13}…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

GS-Agent 是一个多智能体框架,它通过让多个大模型驱动的智能体模拟人类创建4D世界的工作流程,自动从自然语言描述生成动态、物理逼真的4D场景(含液体、可变形物体与刚体交互),并实现电影级相机与光照控制。

从自然语言描述生成动态且物理真实的4D世界(3D空间+时间)是计算机图形学与生成式AI的交叉难题。传统方法依赖人工手动创建,需要大量人力调整材质、运动和视觉保真度;现有生成式模型虽然可以从数据中学习,但难以保证物理合理性和可控性。GS-Agent 采取另一种路径:利用基础模型构建一个模拟人类创建流程的智能体系统,将物理引擎纳入循环,实现全自动的4D物理世界…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

GraphVid 通过结构化交互图代替轨迹或文本,实现了对多主体交互视频的精准、灵活控制,在视频质量指标上显著优于 Motion-I2V,且所需训练数据和参数更少。

可控视频生成一直面临难题:文本提示难以精确描述多物体的交互细节,轨迹控制需要用户为每个物体绘制准确路径,在遮挡或重叠场景下易产生歧义且难以扩展。GraphVid 提出用交互图(Interaction Graph)作为控制接口,让用户通过图结构指定物体间的关系和运动,以实现灵活且精确的多主体视频生成。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

将环肽分子的多个构象(构象系综)通过共享等变图神经网络编码后池化,并经过自监督预训练,可显著提升分子性质预测性能;单独从头训练则完全失败。

传统分子性质预测通常只使用单个代表构象,但许多分子在溶液中以构象系综形式存在。本研究提出 EnsembleEGNN,一种分子构象系综基础模型,旨在通过编码整个构象系综来改进环肽的性质预测。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

本文提出一种Petri网引导的LLM测试生成方法,通过将API资源、生命周期和因果依赖建模为有色Petri网,推导合法并发场景并作为约束中间表示,再由LLM合成可执行Rust测试,同时通过局部忠实性契约与修复循环保证代码忠于模型意图。

并发有状态库API的行为由资源所有权、生命周期状态和执行交错共同决定。大型语言模型可以直接合成可执行的Rust测试,但其输出常违反API前置条件、测试深度不足或丢失并发性(退化为偶然的串行轨迹)。相反,基于模型和系统化的测试技术能提供语义控制,但将抽象场景转化为可执行测试通常需要大量手写代码。本文旨在填补形式化场景设计与低成本测试具体化之间的空白。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

本文提出**扩展生成流(EFlows)**与**扩展流映射(EFMs)**,将传统固定维度/固定长度的生成流推广为输出大小本身可学习、可控的自由度,从而支持变长序列与变尺寸图生成等动态输出任务。

Expanding Flow Maps

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

大语言模型推理时,KV缓存随着序列长度增长而膨胀,常见做法是使用重要性分数保留top-k token(确定性驱逐)。本文证明:这种设计存在根本性缺陷——攻击者可以篡改被驱逐的token值,使得系统保留的所有内容不变,但真实注意力输出误差任意增长,因此任何运行时误差估计量都不一致。研究问题:如何设计一种可识别、可证书化的KV缓存驱逐策略,既能保证误差有界,又…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-23

MAPS 通过一个集中式 Master 智能体生成紧凑连续的全局协调嵌入(proto‑plan),再由分散式 Worker 智能体结合局部观测执行车辆控制,在 HighwayEnv 的 72 种路口配置中实现无碰撞导航并显著降低平均通行时间,且支持零样本扩展到更多车辆(3→5 车成功率 94%)。

无信号交叉口的自动驾驶车辆协调是多智能体强化学习(MARL)的经典难题,现有方法常受困于组合动作空间、依赖特权信息或智能体设计僵化。本文提出 Master‑Agent Proto‑plan System(MAPS),一种层次化深度强化学习架构,将策略意图与战术执行解耦,并在 HighwayEnv 仿真中验证了其协调机制的有效性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条