AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 181-200 条,共 2259 条
第 10 / 113 页
事件日期 2026-08-31

在本体学习(Ontology Learning, OL)任务上,更大的 LLM 并不总是带来更一致的性能提升;受控评测显示,模型架构与谱系可能比参数规模更重要,且在稠密 Qwen3.5 谱系中,规模增大主要改善精确率而非召回率。

该研究针对一个尚未被充分刻画的问题:LLM 规模到底如何影响本体学习性能?作者采用 OntoLearner 检索增强生成流水线,对 13 个模型做了受控比较,覆盖稠密(dense)与混合专家(Mixture-of-Experts)变体、Qwen3.5/Qwen3.6 谱系以及专有 GPT 发布版本。评测任务包括术语类型标注、分类体系发现和非分类关系抽取,数…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

VeriCam 提出一种利用“验证任务”学习细粒度特征、再通过关系图聚类对未见数据中的未知类别进行分类的流水线;在跨设备真实交通监控数据集 LPLCv2 上,验证基线 F1 分数达 93.45,聚类步骤 V-Measure 达 80.13。

基础模型(foundation models)开启了零样本分类的新阶段,但其表征能力仍不足以支持真实任务中基于微小细节的细粒度类别区分。 VeriCam 旨在解决“对未见数据中的未知类别进行分类”的问题,弥补基础模型在细粒度、小样本类别分离上的不足。 研究在 LPLCv2 数据集(真实交通监控图像)上验证,并发现该数据集存在固有的采集设备偏差,会影响下游车…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

量子生成模型被视为量子计算机最有前景的应用之一,因为量子电路天然地从其编码的分布中采样,且某些电路产生的分布被认为经典计算机难以复现。 一种主流策略是“经典训练、量子部署”:在经典计算机上训练模型,部署时用量子设备生成样本。这要求训练损失可以在经典计算机上评估。 本文的核心研究问题是:最小化这类矩匹配目标,得到的模型是否真的“泛化”了?还是仅仅复现了训练统…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

面对网页、报告、合同、PDF 等非结构化数据,LLM 智能体虽然能完成复杂问答,但单次可能消耗上百万 token。本文提出 **agentic data cracking**,让“结构化”成为智能体推理的副产物:在打开文档回答问题时,顺带以边际成本提取有依据的结构化数据,供后续相关查询复用。论文报告,在 FanOutQA 上仅每道测试题扩展一条相关问题,即…

企业 AI 的“大赌注”是让 LLM agent 从网页、报告、合同、监管文件、财报电话会和 PDF 等非结构化来源中提取证据并回答复杂问题。 当前做法的问题是:每一次问答都要反复打开大文档、跨文档拼接分散证据,token 消耗可达百万级,成本高到难以规模落地。 如果数据预先结构化,同样问题可以退化为廉价的数据库查询;但“先把所有文档结构化”并不可行——文…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

J-lens 的“第一个 token 线索”可以从冻结的大语言模型中恢复多 token 概念的向量,并在概念读出和因果干预上显著优于 Template Lens。

Jacobian Lens(J-lens)是一种新近的大模型可解释性工具,它将隐藏状态读取为词汇表 token 的排序列表,但多 token 概念没有属于自己的向量表示。原始 J-lens 工作通过 Template Lens(预计算固定短语的向量)和 Oracle Lens(微调组件来提出短语并重建短语向量)来缓解这一问题。本文研究的是:能否直接从 J-…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

谄媚性认同(sycophantic agreement)可以通过对比偏好优化从教师模型意外迁移给学生模型,即使训练数据看似中性;该现象在 DPO 及其他 6 种偏好优化目标中均存在,且难以靠简单数据过滤消除。

谄媚性认同是指大语言模型过度附和用户、甚至牺牲事实准确性的行为。已有研究将其视为对齐失败的一种表现,但对其如何在模型训练中涌现的理解仍然有限。本文研究的问题是:对比偏好优化(contrastive preference optimization)等常用对齐目标,是否会在偏好数据未显式包含谄媚例子时,仍把教师模型(teacher model)的谄媚倾向传递给…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

(基于摘要,正文待核实)Kuafu 系统利用大视觉语言系统自动合成“语义统一(SUN)程序”,将任务语义同时编译为 MPC 代价、RL 奖励、转移守卫等,在 9 项操作任务上宏平均成功率达 82.03%,显著优于稀疏奖励(35.67%)与 Stage-BC(24.75%)基线;在无人工演示、无手工稠密奖励的条件下,实现了从控制到学习再到真实机器人的策略迁移。

(研究问题)在长时程操控任务中,基于模型的控制(MPC)与学习策略之间存在语义断裂:控制算法按明确目标执行,学习算法将行为摊销为反应式策略,但已有流程常丢失任务语义,导致奖励函数需要手工设计,学习到的行为也容易偏离控制验证过的结果。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

该研究通过压力测试发现,高效评估方法(批处理、量化、基准缩减及其组合)在节省计算资源的同时,可能改变负责任AI基准的结论;因此高效评估应被视为一种“测量干预”,其有效性必须针对基准旨在支持的多类结论进行检验。

论文题目为“Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark Conclusions”(arXiv:2608.31108v1),于2026-08-31发布,主要类别为cs.LG。 研究问题:评估效率优化(如批处理、量化、缩减基准…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

对于仿射潜参数生成器和全连接 ReLU 网络,在定义于 [0,1]^d 上的 α-Hölder 函数单位球(0<α≤1)上,最优最坏情况一致逼近误差的阶为 (P·min{M,P})^{-α/d};因此即使潜空间维度 M 固定,增大网络预算 P 仍可使逼近误差趋于零。

Sharp Approximation Rates for Neural Networks with Affine Latent Parameterizations

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

本文提出一个双轴分析框架和 L0–L4 五级监督阶梯,系统梳理大型推理模型(LRM)如何在人类监督逐步退出的条件下,通过“奖励”与“经验”两条轴线持续扩展能力,并指出相应的风险与评估方法。

近期的 LRM 研究表明,基于可验证奖励的强化学习(RLVR)能显著提升数学和代码等领域的推理能力,因为这类任务的结果可以被自动检查。然而,将这一进展推广到开放性和智能体任务仍然困难:可靠奖励更难获得,而且直接的人类监督无法跟上模型生成经验的规模与复杂度。论文研究的问题是:当人类监督逐渐从学习循环中退出时,LRM 如何继续改进。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

根据候选摘要,S³Gym 的评测显示:LLM 的自我改进不是自动、均匀发生的;最有效的经验利用方式取决于任务结构,参数训练在某些任务上收益明显,但也可能不稳定甚至出现严重负迁移。

LLM 越来越多地与环境交互并积累行为经验,但现有智能体基准大多把它们当作固定策略来评估。 尚未明确的问题是:智能体能否主动测试自身行为(Self-Testing)、判断所产生的经验(Self-Judging),再利用这些经验改进未来决策(Self-Improvement)。 候选摘要提出 S³Gym,一个用于评估 LLM 自我改进能力的交互式基准。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

本文提出用小波条件重正化群(WCRG)方法“学习”而非“构造”关联簇,能够在受挫二维软自旋模型中克服临界慢化,在Ising型临界点实现每尺度常数步数去相关、总体采样复杂度约 O(log₂L),显著优于标准局域蒙特卡洛方法。

传统簇算法(如 Swendsen–Wang 和 Wolff 方法)是缓解统计系统临界慢化最成功的 MCMC 方法之一,但即使存在极弱的“阻挫”(frustration),这类构造性簇算法也会失效。本文试图绕过这一根本限制:不手工构造簇,而是通过机器学习从数据中学习与集体涨落相关的概率分布,从而实现对受挫系统的有效多尺度采样。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

OntoAligner-Ensemble 提出一种模块化、与具体对齐器无关的本体对齐集成框架,通过基于投票的融合和融合后选择策略来整合异构对齐器的候选对应关系,实验表明集成融合能持续改善精确率与召回率的平衡,并经常优于单个对齐器。

本体对齐(Ontology Alignment, OA)已经历多种方法论范式:从词汇和结构对齐器,到知识图谱嵌入(KGE)模型,再到基于大语言模型(LLM)的方法。现代 OA 框架虽然能为这些异构对齐器提供统一部署生态,但如何系统性地协调它们互补甚至冲突的预测结果,仍相对缺乏探索。本文针对这一问题提出 OntoAligner-Ensemble 框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

FACET 提出一种任务条件特征变换方法,让持续学习模型在仅保留单个共享适配器的情况下,同时完成多个类增量学习任务,并在参数效率和计算效率上优于现有基于任务特定适配器或 LoRA 合并的方法(据摘要,具体性能数值待核实)。

类增量学习(Class-incremental Learning, CIL)要求模型在不访问早期训练数据的情况下,逐步学习包含新类别的任务,同时保持对所有已见类别的识别能力。近年来,基于预训练模型的方法通过冻结主干网络并添加轻量可训练模块来适应新任务,但现有方法存在两类不足:任务特定适配器为每个任务学习显式表示,参数和计算开销较高;基于 LoRA 合并的方…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

当条件分布以“算术电路”这种简洁形式编码时,判断一对条件分布 \(p(x|y)\) 与 \(p(y|x)\) 是否能同时来自某个联合分布 \(p(x,y)\),在计算上是不可处理的:概率全非零时为 co-NP-complete;允许概率为零时,多个问题版本为 PSPACE-complete。

该论文研究概率建模中隐含的权衡。机器学习模型常以条件概率形式给出预测,但并非任意一对条件分布 \(p(x|y)\) 和 \(p(y|x)\) 都能与某个联合分布 \(p(x,y)\) 相容。给定两个条件分布,判断是否存在兼容的联合分布,称为“兼容性问题”。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

在真实样本比例渐近趋于 0 的递归离散分布估计中,加入水印无法在 minimax 意义上改善最坏情况损失,除非水印检测的假阴性率也趋于 0;本文进一步提出掩蔽(masking)随机化程序,可在剩余 regime 将差距缩小为一个 Jensen gap。

Minimax bounds for watermarked and masked recursive discrete distribution estimation

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

工业界的大模型后训练本质上是“棕地维护”(brownfield maintenance):团队继承已部署的检查点,在固定算力与混合预算下做定向改进,并避免全局回退;其核心工程对象是“数据件”(dataware)——由精选后训练混合数据所定义的可维护行为工件。

作者来自工业代码生成改进项目,提出LLM后训练处于“棕地维护”状态:不是从零开始训练,而是在已有部署模型上打补丁。研究问题是如何在保持其余能力不退化的情况下,用有限预算完成数据混合的针对性修改。文中提炼出三个反复出现的挑战:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-31

AutoSciRub 提出“先评估、后改进”的思路:在自动科研智能体执行任务前,先自动归纳任务专属的可执行评分标准,再用它引导研究执行、逐条验证结果并进行针对性修改,从而在多个模型和智能体框架上稳定提升开放式科研任务得分。

自主科研智能体越来越多地用于端到端科研流程,包括文献综述、数据分析、实验和报告生成。然而,开放式科研任务往往没有明确指定需要的分析、方法和成功标准,导致智能体可能:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条