AI基准测试(benchmark)越来越多地采用项目反应理论(IRT)这类项目级统计模型,用于估算模型能力、排名系统、选择有信息量的示例以及诊断基准质量。然而,标准IRT估计工具原本是为人类测试的数据场景开发的;AI基准数据通常涉及更少的被评估模型、更多的项目,并且能力分布可能呈现偏斜、聚类或多模态。本研究系统考察了这种“场景不匹配”对IRT建模可靠性带来…
传统检索系统基于静态效用训练和评估:将文档和问题交给阅读器模型,看答案是否改善。但这种假设在语言模型作为搜索智能体(连续发出多个查询并在多轮间推理)时失效,因为文档的价值可能在于它允许智能体下一步做什么,而非它本身对当前问题的回答。本文旨在量化这一差距,而非仅口头论证。
在医疗多模态问答(VQA)中,参数高效微调虽然能在排行榜上取得高分,但答案层面的优势并不总能带来忠实、完整的临床推理;强制结构化推理和显式特征映射的方法更具可靠性,但证据仅为相关性而非消融验证。
研究基于MediaEval Medico 2025挑战赛的回顾性GI内窥镜(胃肠镜)案例,分析九个已记录系统在问答和解释质量上的设计选择。核心问题是:如何设计可信的多模态医疗AI,使其既能融合视觉和文本证据,又保持可靠和可解释?
当前多模态大语言模型(MLLM)在科学可视化(SciVis)素养上表现不均衡:闭源模型 Gemini 整体超过人类平均水平,但多数模型在细粒度定量估计、流向解读等任务上存在系统性失败,开源模型整体低于人类基线。
虽然 MLLM 被越来越多地用于解读可视化内容,但现有评测主要集中在图表(chart)理解上,缺乏对科学可视化(SciVis)——如流场图、等值面、体渲染等专业可视化——理解能力的系统评估。本研究首次使用标准化 SciVis 素养评估测试(SciVis Literacy Assessment Test)对 6 个 MLLM 进行基准测试。
BadWAM 框架揭示了世界动作模型(WAM)在视觉微小扰动下存在“想象正确但行动错误”的脆弱性,其中动作仅攻击可将闭环任务成功率从 96.5% 降至 43.1%,而想象保持攻击进一步暴露了 WAM 特有的对齐失效风险。
世界动作模型(World-Action Models, WAMs)将动作生成与未来世界预测耦合,被认为能提升具身控制的鲁棒性、可解释性和安全性(因为机器人动作原则上可与其想象的未来进行对照检查)。本文指出这一假设是脆弱的,提出 BadWAM 统一框架,用于建模和评估一类针对 WAM 的新型对抗攻击——世界动作漂移攻击(World-Action Drift…
AutoSynthesis 是一个端到端的多智能体系统,可将自然语言研究问题自动转化为完整的元分析流程,其汇总效应估计与专家手动元分析的结果高度一致(基于 Hedges' g),有望使定量证据综合大规模可扩展。
证据综合(evidence synthesis)是基础研究转化为可靠知识的关键,但定量元分析目前仍主要依赖人工,难以规模化。本研究提出 AutoSynthesis,旨在自动化元分析的完整流程,包括搜索策略制定、文献检索、研究筛选、全文评估、效应量提取、随机效应元分析、异质性分析和偏倚风险评估,并生成符合 PRISMA 指南的报告。
ARMOR++ 是一个基于视觉-语言模型和大语言模型编排五种互补原语的多智能体攻击框架,在黑盒无查询约束下生成高可迁移性的对抗样本,在 AADD-2025 基准上显著超越现有基线,揭示了当前深度伪造检测器部署中的显著可靠性缺口。
深度伪造检测器在黑盒可迁移攻击下可靠性频繁下降,因为它们依赖脆弱且与架构相关的取证线索。现有可迁移攻击缺乏语义感知能力,且当扰动从卷积替代模型迁移到基于Transformer的目标模型时,在严格无查询条件下难以保持有效性。本文旨在解决这一局限。
FixAnything 通过复用预训练视频生成模型,将渲染伪影清理建模为视频到视频翻译,仅需轻量级微调即可统一修复 3DGS、NeRF、网格和点云等多种 3D 表示的渲染质量问题,并借助相机位姿精度作为奖励信号来保证 3D 一致性。
使用 3D 场景表示(如高斯泼溅 3DGS、神经辐射场 NeRF、网格或点云)进行新视角渲染时,如果输入视角稀疏或目标视角偏离输入,会产生明显伪影。近期工作尝试用扩散生成先验来缓解这些伪影,但往往针对单一 3D 表示定制,需要自定义架构或大量重新训练。FixAnything 旨在用单个通用模型修复多种渲染伪影。
68岁“强化学习之父”、图灵奖得主Richard Sutton与Khurram Javed离开Keen Technologies,在加拿大创立Oak Lab,主张智能体必须通过试错从自身经验持续学习、实时进化,批评当前大语言模型仅学习人类文本而非经验,部署后即停止学习。
2026年7月,Richard Sutton与Khurram Javed共同创立Oak Lab,公司总部位于加拿大。Sutton认为大语言模型(LLM)的核心缺陷在于:它学习的只是人类积累的文本,而非通过与环境交互获得的经验;模型部署后便停止学习,未能真正践行他提出的《苦涩的教训》(The Bitter Lesson)——即智能必须依靠搜索和试错产生新发现…
腾讯混元团队公开了旗舰模型Hy3(295B参数)的极致量化方案,提供1bit和4bit两种GGUF格式,以及可直接对接vLLM的GPTQ Int4版。同时为llama.cpp新增了Multi-Token Prediction (MTP) 投机解码支持,显著提升了推理速度。
通过构建可验证的思维链、压缩推理痕迹、分离记忆与求解过程,以及按任务类型进行细粒度评估,可以显著提升AI模型的推理准确性,而非仅仅追求最终答案的正确性。
NVIDIA Nemotron模型推理挑战赛邀请Kaggle社区,在相同开放模型、基准、基础设施和评估约束下,探索如何提高推理准确性。超过5,000名活跃参与者组成4,000多个团队,提交了数千次结果和1,000多条讨论帖。参赛者训练LoRA适配器、构建合成思维链数据集、破解谜题类型、调试基础设施并公开分享发现。最终评分在私有排行榜上完成。
安全研究员利用钓鱼仓库(即伪装成正常项目的诱饵仓库)对xAI推出的Grok Build进行渗透测试,发现该IDE虽然宣传“数据本地优先”,实际运行中却将用户完整的代码仓库连同Git修改历史一并上传至谷歌云存储,上传量远超正常对话所需的元数据。进一步测试表明,即使用户在设置中关闭“改进模型”开关,上传行为依然未被阻止。日志记录显示存在339次自动上传,其中一…
前OpenAI研究员Kokotajlo警告,大厂并非逐个替代岗位,而是集中算力让AI自动写代码、做科研,一旦研究闭环闭合并开启自我改进,失业潮将瞬间爆发;他预计超级智能中位落点在2030年,默认路径下有约70%概率走向AI接管式大灾难。
前OpenAI研究员(姓名待核实,材料中仅写Kokotajlo)在近期观点中提出,当前AI巨头并未采用逐岗位替代策略,而是将算力集中投放在让AI自动完成代码编写和科学研究上。他认为,一旦AI能够自我改进并形成研究闭环,大规模失业将在短时间内发生。同时,他判断超级智能(Superintelligence)的中位到达时间约为2030年,并估计若保持当前默认发展…
GPT-Red 是 OpenAI 提出的一种自动化红队(red teaming)系统,通过自我博弈(self-play)机制让模型自行生成对抗性测试案例并从中学习,从而提升 AI 系统对提示注入攻击的鲁棒性、安全性和对齐能力。(待核实具体实现细节)
OpenAI 发布了名为 GPT-Red 的研究成果,旨在利用大语言模型自身的生成能力,模拟红队攻防对抗过程,无需人工标注即可持续发现并修复模型的脆弱点。该系统聚焦于提示注入(prompt injection)和安全性对齐挑战,试图实现模型鲁棒性的自主进化。(待核实发布日期及公开程度)
前谷歌DeepMind科学家Alex Turner于2026年7月15日辞职,并发布万字长文,指控谷歌高层在五角大楼压力下秘密签署一份“毫无红线”的军事AI协议,将Gemini模型部署于军方隔离数据中心,使谷歌丧失对模型思维链的监控能力,且多位曾公开反对致命自主武器的AI领袖(Jeff Dean、Demis Hassabis、Yoshua Bengio、S…
2026年1月,美国国土安全部特工街头枪杀平民,Turner发现谷歌是DHS的云与AI供应商。随后五角大楼向AI巨头施压,要求签署允许“任何合法政府用途”的军事AI合同。Anthropic拒绝并遭供应链威胁,而谷歌高层准备妥协。Turner于2026年4月27日晚得知合同正式签署,合同中限制自主武器和大规模监控的条款仅使用无法律约束力的“不应该”措辞,且谷…
来源博客标题为“Bridging the ‘Porch Gap’”,描述中提到 Boston Dynamics 正在测试用 Spot 完成最后一英里的交付,目标是将包裹送达客户门阶,减少配送员的体力消耗并提高运营效率。 具体测试细节、部署规模、合作方、时间节点等未在摘录中提供(待核实)。
Anthropic在2026年8月发布的第二份《Risk Report》中,首次承认公司内部存在一个比Mythos 5更强、但目前“没有对外发布计划”的模型Model 2;同时将高风险场景下的“误对齐”风险从“极低”上调至“低”,并承认现有评测已出现“饱和”。(据新智元报道,原始报告细节待核实)
新智元报道,Anthropic发布了覆盖至2026年7月15日的第二份《Risk Report》,首次亲口承认内部运行着比自己公开最强模型Mythos 5更强的模型,代号Model 2。 Anthropic表示:目前没有对外发布Model 2的计划。 报道将这一节奏与Mythos 5类比:Mythos 5最初也被称“不打算发布”,后来才有了Project…
Anthropic 从超 30 万段真实对话中提取信号,将 Claude 的价值倾向压缩为四条坐标轴,发现不同模型版本的语言风格有显著差异,且同一份内容用不同语言咨询可能得到截然不同的评价。
Anthropic 发表了一项关于 Claude 价值观随模型与语言变化的研究。研究团队从超过 30 万段真实对话中提取信号,将 Claude 的价值倾向量化为“顺应与审慎、温暖与严谨、深度与简洁、坦诚与执行”四条坐标轴,并据此绘制了不同模型版本及不同语言环境下的画像。
Google DeepMind CEO 哈萨比斯(Demis Hassabis)公开呼吁美国牵头组建类似金融业监管局(FINRA)的前沿AI标准机构,要求前沿模型在网络、生化、核等高风险领域通过独立安全评估后方可在美部署,并警告AGI可能在几年内实现,其影响规模与速度均为工业革命的十倍。
哈萨比斯撰文指出,当前AI技术发展已超过人类理解速度,激烈的商业竞赛导致实验室“比谁下限更低”,抢先违规者反而占便宜。他主张由美国牵头建立独立的前沿AI监管框架,参照FINRA模式设立标准机构,所有前沿模型在发布前必须经过独立安全评估认证,尤其需在网络攻击、生化武器、核安全等高风险领域通过科学评估方可部署。
DeepSeek在首轮融资结束仅六周后,即启动新一轮融资,投前估值约710亿美元(4800亿人民币),并已开始筹备2027年IPO,最快2026年底递交上市申请。融资主要用于自建数据中心、采购AI芯片及研发Agent系统。
2026年7月,据《金融时报》报道,DeepSeek正接触新投资者,开启第二轮融资,投前估值约710亿美元(约4800亿元人民币)。 该估值较首轮融资后估值520亿美元上涨约37%。 首轮融资于约六周前完成,总额超500亿元人民币,梁文锋个人出资200亿元,腾讯、宁德时代及国家人工智能产业基金等参与。 DeepSeek同时开始筹备IPO,目标2027年上市…