MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization
MedFailBench 是一个由临床医生构建的开源基准,旨在系统性地识别和分类医疗 AI 模型在不同安全边界(safety gate)上的失效模式,而非仅仅判断模型是否给出正确答案。
传统医疗 AI 基准主要衡量模型是否知道正确答案。MedFailBench 提出了不同的问题:**哪个安全边界(safety gate)失效了?** 它提供了一个由临床医生审查的合成案例集,并对每个案例的错误按严重程度(1–5 级)和安全门类型进行标注。当前公开版本(v0.2.1)包含 44 个经临床医生审查的合成案例、严重程度注释、一个实时的 Huggi…
MeanFlowNFT 首次将面向过程的强化学习框架 DiffusionNFT 成功应用于平均速度生成器(MeanFlow),在保持快速少步采样优势的同时,通过构建诱导瞬时速度预测器实现奖励优化,实验表明其在图像和视频生成上显著超越先前最优的 RL 调优少步生成器。
**背景**:MeanFlow 生成器通过预测时间区间的平均速度实现快速少步采样(few-step sampling),具有高效生成的潜力。强化学习(RL)已成为对齐扩散/流模型与人类偏好或特定目标的有效手段,其中 DiffusionNFT 提供了一种高效的前向过程 RL 框架,无需反向过程轨迹或似然估计。 **问题**:DiffusionNFT 优化的是…
Mask-Aware Policy Gradients for Diffusion Language Models
MAGiSt3R 是一个多智能体框架,能以接近 10 FPS 的速度从单目 RGB 视频中完成 3D 重建和相机跟踪,在合成与真实数据集上均达到了优于现有方法的精度。
从单目 RGB 视频进行 3D 重建是计算机视觉中的基础问题,传统方法(如基于优化的 SLAM 或神经隐式表示)通常速度慢、依赖顺序处理;纯前馈式方法(如 DUSt3R 等 3R 家族模型)虽能快速回归点图,但直接应用于视频时难以处理长序列中的累积相机漂移。论文提出 MAGiSt3R,将单段视频切分到多个智能体,并行处理局部片段,再通过合并模型与位姿图优化…
Linear representations of grammaticality in neural language models
本文提出一种基于中心化对数比率(CLR)变换和拉普拉斯平滑的线性时间语言识别方法,将字符及双字符频率建模为组合向量,在六种语言上取得鲁棒准确率,尤其对较长文本表现较强,可作为神经网络方法的高效可解释替代方案。
语言识别通常采用神经网络架构或统计n-gram模型。神经方法需要大量计算资源,而传统频率方法依赖的距离度量对于组合数据(频率和为定值)并不恰当。本文试图利用组合数据分析(Compositional Data Analysis)的理论框架,为语言识别提供一种既线性时间又理论严谨的分类器。
2026 年 7 月 16 日,LlamaIndex 发布了 `@llamaindex/liteparse-grpc`——一个基于 LiteParse Node.js 绑定构建的 gRPC 服务器。LiteParse 本身是一个 Rust 库,用于解析非结构化文档(PDF、Office 文件、图像),已有 Node.js、Python 和 WebAssem…
In-Place Tokenizer Expansion for Pre-trained LLMs
HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning
当前视频模型虽向视觉基础模型演进,但仍缺乏人类式的多步推理能力。流式自回归扩散模型效率高但推理能力有限,双向扩散模型可全局修正但细粒度帧级去噪导致高推理成本。两种范式在复杂推理任务中均难以兼顾逻辑一致性与低延迟流式生成。HDR 旨在统一两种范式,在因果视频生成中融入分层潜变量以实现高效多步视觉推理。
四项LLM评判(包括Grok自身)一致认为,由LLM Grok全自动编写的百科Grokipedia在政治中立性上不如Wikipedia,且两者存在相反方向的意识形态偏好:Grokipedia偏袒经济右翼政客、惩罚社会自由主义政客,而Wikipedia则偏袒社会自由主义政客。
2025年底,由xAI推出的LLM Grok完全撰写的在线百科Grokipedia上线,其动机之一是提供一个无偏见的Wikipedia替代品(Wikipedia长期被指责有“左翼”和“自由主义”偏见)。本研究通过大规模政治偏差审计,探究LLM编写的百科是否真正实现中立,还是仅仅嵌入另一种意识形态。研究对象包括1,394对描述政府成员的百科文章,涵盖九个由专…
VEXMLM通过对XLM-R进行30,000个吉兹语子词词汇扩展和两阶段训练,在阿姆哈拉语和提格雷尼亚语的问答、情感分析和命名实体识别任务上显著超越基线模型,并将提升迁移到17种未扩充的低资源非洲语言。
多语言预训练语言模型(PLM)在低资源、非拉丁文字语言上表现下降,主要原因是基于拉丁文字的分词器训练导致高未登录词(OOV)率和过度的子词碎片化。本研究针对吉兹(Ge'ez)文字体系下资源最丰富的两种语言——阿姆哈拉语(Amharic)和提格雷尼亚语(Tigrinya),提出词汇扩展方案VEXMLM,并进一步在另外17种低资源非洲语言上评估(共计19种语言…
自闭症成年人在自由观看绘画时,表现出一种独特的空间-时间双重注意模式:空间探索范围与艺术家相似,但时间动态(注视时长、停留时间、扫描路径一致性)则显著不同,且不与任何其他群体完全重叠。
该研究通过眼动追踪对比了自闭症成人(ASD)、训练有素的艺术家和典型发育观察者在自由观看30幅绘画(每幅15秒)时的注视行为。以往自闭症眼动研究多使用社交场景而非艺术品,且只关注注视位置而忽略时间顺序。本研究同时分析了空间分布(注视密度图)和时间序列(扫描路径),以揭示不同群体的注意机制差异。
对于高维分布中的任意 K 维边缘,若变量间存在弱或稀疏相互作用,则只需 O(√K) 个积分步(忽略 log d 项)即可控制未调整 HMC 和欠阻尼朗之万算法的 W₂ 偏差,表明偏差可以随维度“去局域化”,即局部边缘的偏差远小于总体偏差。
未调整的 HMC 和欠阻尼朗之万等无调整采样器已知存在偏差。传统上,通过 Metropolis-Hastings 调整消除 HMC 偏差,但代价是迭代复杂度上升(因需小步长以保证接受率)。本文试图在不使用 MH 调整的前提下,量化这些未调整算法在边缘分布上的偏差行为,将先前针对过阻尼朗之万(如 ULA)建立的“偏差去局域化”现象推广到这两类更复杂的动力学。
基于链上数据、金融指标与社交媒体推文,结合梯度提升(XGBoost)模型可有效分类比特币市场情绪,平均F1-score约0.84;SHAP解释性分析显示链上特征对分类有显著贡献。
比特币作为去中心化数字资产和投资工具,其市场行为备受关注。现有研究多聚焦于价格预测,而本研究转向**解释市场情绪**——如何利用区块链交易数据、历史价格数据与每日Twitter情绪分类共同刻画比特币市场情绪,而非预测价格涨跌。
本研究将**成组替换策略**中未知寿命分布下的最优替换间隔学习问题建模为随机多臂赌博机,提出了达到 Lai–Robbins 下界的遗憾上界算法,并利用独特的嵌套观测性质实现了仅需常数次直接探索次优臂的改进算法。
研究针对**N台独立同质机器**的成组替换维护策略:每台机器故障时单独更换,同时所有机器每隔固定长度 **k** 的时间单位共同更换一次。运营者不知道机器的寿命分布,只能从运行数据中逐步学习能使**单位时间平均成本**最小的最优间隔 **k\***。在每个决策周期,运营者选择 **k∈{1,2,…,K}**,观察到包含完全寿命和右删失寿命的混合失效历史,并…
研究者利用人工智能模型成功设计出自然界不存在的功能性CRISPR酶,其基因编辑效率甚至优于天然版本。
2026年7月16日,加州大学伯克利分校的Jennifer Doudna团队在《科学》杂志上发表论文,报告了利用AI逆向工程设计合成CRISPR蛋白的方法。他们以TnpB(Cas12的进化前体)为模板,通过AI反向推导DNA序列变化,产生了数千种候选变体,并筛选出具有活性的合成核酸酶。
CRISP 是一种无需目标域数据、无需测试时参数更新的模型无关框架,利用“正区域排名稳定性”假设,通过潜在特征扰动生成高精度(HP)与高召回(HR)空间先验并迭代精炼,在跨中心、跨人群、跨模态的医学图像分割中显著优于现有方法。
域偏移是医学 AI 临床转化的核心瓶颈。现有域适应方法依赖预定义偏移模拟或伪监督,无法应对真实世界中无限多样的偏移。本文提出 CRISP 框架,旨在实现源域训练模型在未知目标域上的鲁棒分割,而无需获取任何目标域数据或调整模型参数。
当前主流视觉世界模型在孤立评估时存在严重缺陷(如球消失、错误运动、无效交互),作者提出概念引导的空间正则化(CGSReg)作为辅助像素重建损失,可部分改善 DreamerV3、DIAMOND、TWISTER 的 rollout 质量与零样本 MBRL 性能,但未能解决所有模型瓶颈。
世界模型通常作为模型基强化学习(MBRL)系统的组件被评估,其自身质量很少被单独研究。本文在 Atari Pong 环境中系统考察了五个代表性视觉世界模型代理(DreamerV3、DIAMOND、TWISTER、Simulus、STORM),通过两种隔离诊断暴露其固有缺陷:闭循环 rollout 诊断(用独立训练的 policy 与冻结世界模型交互,检查视…