AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1101-1120 条,共 2259 条
第 56 / 113 页
事件日期 2026-08-04

在扩展到 100B token 规模的评估中,先让语言模型在“形式推导(formal derivations)”数据上进行前置预训练(Logic-PPT),能显著加速自然语言技能习得:达到 80% 准确率比标准初始化少用 36B token;并且这种训练方式带来的内部表征几何特征,使模型在约 33% 稀疏度剪枝下仍能匹配密集基线性能。

现有“前置预训练”(pre-pretraining)常使用 Dyck 语言、程序化算法等符号任务,虽然能加速自然语言获取,但所用原语较窄,不足以覆盖自然语言的表达能力。 先前研究多在较小 token 预算下进行,难以可靠观察技能涌现与表征动态。 本文提出 **逻辑前置预训练(Logic-PPT)**,用形式推导作为初始化策略,使模型先学习与自然语言高度相关…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

本文提出潜奖励寄存器(Latent Reward Registers),通过在冻结的 Diffusion Transformer(DiT)输入序列前添加可学习、位置无关的寄存器 token,直接从中间噪声潜变量估计最终样本的偏好奖励,从而为整个去噪过程提供密集、可微的奖励信号;并据此设计了训练端策略 RG-OPD 与推理端策略 RGS,分别实现更省算力的偏…

扩散模型与人类偏好对齐通常依赖最终生成样本上的稀疏终端奖励,这在多步去噪过程中带来严重的时间信用分配问题。本文研究的问题是:能否从中间噪声潜变量直接估计终端偏好,以提供密集奖励信号,并降低对齐成本。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

JoyAI-Video-Edit 是一个 16B 参数的自回归扩散视频编辑框架,可在不访问未来帧、无需预设视频时长的情况下,以单张 NVIDIA B200 GPU 实现约 30 FPS 的端到端 720p 实时视频编辑,并在自动与人工评测中优于现有流式编辑器、与强离线系统表现相当。

实时视频编辑需要低延迟的因果生成和有界的计算资源,同时要保留源视频的保真度并维持长时间的时间一致性。JoyAI-Video-Edit 面向的是“开放式”视频编辑:模型不需要看到未来帧,也不需要预先知道视频总时长,从而支持流式、不定长的编辑需求。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

本文提出一种基于轻量级模糊控制器的自适应测试时采样方法,利用提示复杂度和模型置信度等可解释信号,为每个查询分配不同的采样预算,从而在减少平均采样数的同时保持与全预算控制接近的性能。

测试时缩放(test-time scaling)通过生成并聚合多个候选答案来提升大语言模型的推理能力,但现有管线往往对每个查询使用固定的采样预算,导致简单和困难提示消耗相同计算量,并且缺乏可解释性——无法说明某个提示为何获得特定数量的样本。该研究旨在实现一种自适应、可检查的推理时计算分配方案。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

该研究将 GFlowNets 的前向策略训练置于轨迹采样器的信息几何视角下,提出基于 Fisher-Rao 度量与自然梯度的结构感知优化框架,并区分了三种可计算性场景。

GFlowNets(生成流网络)是一种用于离散及混合离散/连续对象摊销推断的灵活框架,只需通过奖励指定未归一化目标密度。本文研究的问题是:如何利用轨迹采样器内在的信息几何结构,为前向策略训练提供更规范的局部更新方向,并利用目标结构获得可计算的自然梯度近似。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

因果感知(causal perception)指多个智能体对同一系统持有不同的结构因果模型(SCM),从而在相同干预下推断出不同概率分布。本文首次将这一纯理论框架落地实现,并在德国信用数据集上证明:公平性判断是相对于智能体 SCM 而“情境化”的,竞争性世界观不能被忽视。

研究问题:如何把 Álvarez 和 Ruggieri(2025)提出的因果感知框架从理论变为可计算实现? 因果感知会影响智能体对系统的推理方式,也会影响其对系统公平性的感知。 该框架此前停留在纯理论层面,本文提供第一个实现。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

HalluTruthQA-4K 是一个包含 4,000 条专家精选阿拉伯语问答实例的细粒度幻觉检测与事实核查语料库,在整句二元标注基础上补充了字符级错误片段、人工解释和分层幻觉类型,用于支撑阿拉伯语大模型的幻觉检测、错误定位与事实核查评测。

现有阿拉伯语幻觉检测资源多将整个回答简单标注为“幻觉/非幻觉”,无法指明具体错误内容、错误原因或正确事实答案。本文提出 HalluTruthQA-4K,将原有 HalluTruthQA 语料扩展到 4,000 条实例,覆盖伊斯兰知识、历史、科学、地理四个知识密集领域,作为 HalluScoring 2026 共享任务 Track 2 的官方数据集。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

标准音乐 Transformer 在时间平移或音高移位后会对同一音乐段落产生不相关的表征,且规模越大、训练越久,等变性越差;本文提出的 Equivariant Music Transformer(EMT)通过自蒸馏加入等变正则化损失,同时提升了下一词元预测能力和表征等变性。

人类即使听到同一段音乐被时间平移或音高移位,仍能识别出该段落,说明人脑表征具有某种等变性(equivariance)。研究问题是:标准音乐 Transformer 是否具备这种时间/音高等变性?如果缺乏,应如何建模?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

传统优化编译器在程序表示中缺少某些“使能语义”(enabling semantics)时,会漏掉本可盈利的优化变换。本文提出一个可执行基准SeGaBench,并系统评估LLM能否从异构C/C++上下文中恢复这类语义,将之实现为经过验证、保持契约的优化工件。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

针对组织病理学合成图像,常规 FID/IS 可能因依赖 ImageNet 预训练特征提取器而不够有效;采用病理领域基础模型改写的 FID/IS,并联合下游细胞核分割任务验证,可能提供更好的判别力。初步结果显示,生成数据多样性的增加比单图视觉保真度的提升与分割性能的正相关性更高。

合成组织病理学图像生成被视为缓解计算病理学数据稀缺的一种途径,但现有评估方法可能不足以评估医学合成数据质量。本研究聚焦于:如何评估条件扩散模型生成的病理图像质量,尤其是如何让评估指标与下游医学任务表现更一致。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

在文本到符号音乐生成中,决定分布保真度的关键变量是音乐表征(representation)而非模型规模;本文提出的性能分辨率音乐令牌 PMT 让 0.8B 模型在 Frechet Music Distance(FMD)上优于 27B 节拍网格模型。

文本到音乐语言模型通常默认选择“如何将音乐分词”,但音乐表征往往与骨干网络、数据、训练配方纠缠在一起,其独立影响从未被单独测量过。本文固定预训练 Qwen3.5(0.8B–27B)、数据、预算和解码方式,仅替换音乐表征,比较 7 种 tokenization,并将织体指标锚定到各表征的无模型上限。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

本文提出一种“物理风味神经网络”(PFNN),将拉伸指数(stretched-exponential)物理模型嵌入 CNN-Transformer 架构,直接从力-时间曲线中提取具有物理意义的收缩动力学参数,并在多种收缩表型和细胞系(含杜氏肌营养不良模型)中实现高保真参数化。

工程骨骼肌组织(ESMs)广泛用于疾病建模和药物筛选,但当前功能表征常只依赖峰值力等简化指标,丢失了关键的动力学信息。传统机制模型虽能描述这些动力学,但数学复杂度高,难以规模化应用和推广。本文试图通过自动化的物理信息深度网络,解决 ESM 收缩动力学表型分析的可扩展性问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-04

当基础模型智能体在社交困境中进行最优规划时,会稳定收敛到合作,而不是经典博弈论预测的相互背叛;这种合作源于“嵌入式贝叶斯智能体”通过相似性推断,将自己的决策过程作为他人行为的证据。

经典博弈论建立在“解耦能动性”(decoupled agency)假设之上,即智能体将自己的决策视为独立于环境和他人。现代基础模型智能体则同时预测自身未来行动与外部观测。本文报告了一个惊人发现:在风格化社会困境中,基础模型智能体进行最优规划时一致收敛到稳定合作,与经典博弈论“相互背叛”的预测直接矛盾。为解释这一现象,作者提出“嵌入式贝叶斯智能体”(embe…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-03

MiniMax发布通用全模态生成模型H3,支持文本、图像、视频、声音的统一理解,可输出原生双声道音视频;最高支持15秒2K分辨率,2K每秒价格不到主流模型三分之一,并将在未来几天开放模型权重。

2026年8月3日腾讯研究院AI速递披露,MiniMax发布通用全模态生成模型H3。该模型强调“任务统一泛化”,试图打破模态与功能边界,覆盖文本、图像、视频、声音的理解与生成,并面向广告、电商、游戏等商业场景。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · generative-model
事件日期 2026-08-03

Ori Eval 是 OpenRouter 推出的评估工具:它用你自己的提示词运行你的 agent,断言 agent 调用了哪些工具,并用 LLM 评判开放式答案,从而帮你找到“最适合你正在构建的东西”的单一模型,并给出可验证的证据。

OpenRouter 于 2026 年 8 月 3 日发布 Ori Eval。官方背景是:当前有超过 500 个模型可选,但实际选型常依赖社交媒体推荐、基准排行榜或“某个模型目前最强”的直觉。这些方式有一个共同限制:基准测量的是固定任务集,推荐反映的是别人的应用,都无法说明模型在你的应用、你的 harness、你的数据、你的提示词下表现如何。Ori Eva…

产业观察 · 原始来源:openrouter.ai · benchmark-evaluation
事件日期 2026-08-03

NVIDIA Vera CPU在存储原语微基准中,相比对比用的x86 CPU,实现了最高1.29x至3.67x的吞吐提升,覆盖加密/解密、Reed-Solomon恢复、CRC32C完整性检查、压缩/解压及多阶段流水线。

2026年8月3日,NVIDIA技术博客发布文章,介绍NVIDIA Vera BlueField-4 STX存储处理器在AI原生存储中的基准表现。 研究问题:CPU侧存储处理(加密、完整性校验、纠删码、压缩等)能否跟上SSD和网络速度,以及Vera CPU在此类存储原语上的性能优势。

产业观察 · 原始来源:NVIDIA 博客 · benchmark-evaluation
事件日期 2026-08-03

Epoch AI 在其官网上推出“AI Capabilities and Benchmarking Hub”(AI 能力与基准测试中心),目标是建立关于基准测试结果的数据库,展示领先 AI 模型在挑战性任务上的表现。该数据库既包含 Epoch AI 内部评测的基准,也包含从外部来源收集的数据,支持按时间、基准或模型探索 AI 能力趋势。

产业观察 · 原始来源:epoch.ai · benchmark-evaluation
事件日期 2026-08-03

OpenAI下一代模型Astra内部版本在高维几何、群论、格密码学等领域给出十项新研究结果,多数问题悬置数十年;全部解法消耗的token成本约2000美元,标志AI开始进入原创数学研究。

据腾讯研究院AI速递报道,OpenAI公布了下一代模型Astra的内部版本,其在高维几何、群论、格密码学等领域给出了十项新研究结果,多数是悬而未决数十年的开放问题。 材料明确列举的成果包括:构造非sofic群、推翻Connes刚性猜想、解决三个Erdős问题。其余七项具体问题未在材料中列明,待核实。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-03

根据当前可获取的元数据,OpenAI 文章介绍了“GPT-Live”:一个支持连续语音交互的 AI 方案,核心思路是使用无轮次(turnless)语音模型和低延迟架构,以实现更快、更自然的对话。由于正文未能抓取,具体实现和实际效果待核实。

来源文章标题(英文):How we built a realtime system for responsive voice AI in six months 事件:来源页面指向 OpenAI 的一篇技术文章,介绍如何在六个月内构建实时响应式语音 AI 系统。 候选摘要称该系统为 GPT-Live,可实现连续的语音交互。 文章正文未能抓取,因此系统发布时间…

产业观察 · 原始来源:OpenAI · ai-industry
每页 20 条