Claude Code之父Boris建议每六个月删掉Claude.md、skills与hooks,用消融实验逐行加回,以减少“产品悬余”、给模型“解缚”;据材料,Opus 5已借此思路精简超过80%的系统提示词。
这是腾讯研究院AI速递(20260731)报道的一条行业观点。核心问题是:产品配置和预设边界是否正在压制模型本身的能力?Boris提出,模型能力往往超出产品设计的外壳,用户和开发者应该周期性为模型“解开缰绳”。
Claude Code之父Boris建议每六个月删掉Claude.md、skills与hooks,用消融实验逐行加回,以减少“产品悬余”、给模型“解缚”;据材料,Opus 5已借此思路精简超过80%的系统提示词。
这是腾讯研究院AI速递(20260731)报道的一条行业观点。核心问题是:产品配置和预设边界是否正在压制模型本身的能力?Boris提出,模型能力往往超出产品设计的外壳,用户和开发者应该周期性为模型“解开缰绳”。
OpenAI 提出以“全栈方法”(full-stack approach)推动先进 AI 变得更强大、更便宜、更广泛有用;具体技术细节与发布内容待核实。
该页面标题为“Building abundant intelligence”,候选摘要将其描述为一种全栈方法,目标是让高级 AI 更强大、更实惠、更易用。由于未能抓取正文,具体是产品发布、技术报告还是战略声明,待核实。
谷歌DeepMind的AlphaFold明星团队已解散,诺奖得主John Jumper及两名核心成员转投Anthropic;谷歌转而押注以Gemini为底座的统一科研平台,但此前“小团队长周期单点攻坚”的模式能否被平台化取代仍存疑问。
据金融时报报道,谷歌DeepMind曾打造AlphaFold的独立团队已不再存在,成员被分流到Gemini、基因组、酶设计等多个项目。AlphaFold 2负责人、2024年诺贝尔化学奖得主John Jumper以及两位核心成员已转投Anthropic。最初在AlphaFold论文上署名的DeepMind员工中,近四分之一已经离开。
蔡浩宇旗下AI公司Anuttacon出现重大转向:多个项目暂停或停运,资源集中押注Agent方向,蔡浩宇本人领英身份变为“独立大模型与智能体开发者”。
据量子位报道,2026年7月前后,Anuttacon公司动态引发关注: 蔡浩宇更新领英,Anuttacon工作经历停在2026年7月,新身份为“独立大模型与智能体开发者”。 Anuttacon旗下项目陆续停运或暂停,团队成员相继离开。 公司资源分配大幅调整,接近九成计算资源集中到LLM方向,团队从游戏内容生成转向以Agent为核心的系统能力建设。
Cursor通过将开发环境视为以代理为用户的独立产品,构建了 `anydev` CLI、`Cursor Cloud MCP` 及 `Cloud Doctor` 自动化工具,使云代理从2025年12月贡献约1/10的合并PR,增长到如今贡献超过一半,成为主力代码贡献者。
Cursor团队在决定为云代理提供独立计算机以测试代码更改后,发现代理在自有单仓库(monorepo)中运行效率低下。他们意识到开发环境本身就是一个产品,其用户是代理而非人类。为此,团队系统性地解决了环境适配、接口简化、自愈与持续改进等问题,最终让云代理能够端到端测试更改并产生可信结果,进而被工程师信任并大量采用。
OpenAI总裁Brockman称,ChatGPT桌面端未来将实现“零标签页”,ChatGPT与Codex合并后的界面混乱只是过渡;OpenAI的定位不是超级应用,而是AI操作系统,Agent正从回答问题转向主动执行任务。
在2026年7月31日的腾讯研究院AI速递中,OpenAI总裁Brockman对ChatGPT桌面端与Codex合并后的产品状态和战略方向作出说明。他称界面暂时混乱只是过渡,未来将实现零标签页;年底“Work”标签可能融入ChatGPT。他还谈到OpenAI的定位、硬件设备家族、语音交互、Agent演进,并回应了Hugging Face安全事件与临时聊天隐…
通过访问控制、沙箱化执行、默认拒绝网络出口和秘密隔离等确定性架构控制,可显著降低企业AI代理被利用的风险,而基于提示或LLM判断的防御不可靠。
NVIDIA AI红队在过去六个月内评估了多个AI代理(从简单交互编码工具到始终在线的自主数字助理),发现无论使用何种框架,重复出现的四个关键失败模式:缺乏对代理本身的访问控制、代理工具允许任意代码执行、无网络出口控制、秘密在代理环境中以明文暴露。基于提示的防御和LLM-as-a-judge模式在面对社会工程、青蛙煮水攻击和通过合法工作流转移注意力时均被可…
在模仿学习中,让学习者沿自身轨迹与专家进行在线交互,可以放宽其表示条件:不再需要精确表示专家策略,只需能表示专家价值函数;作者据此提出交互式在线策略算法 OVI,并在理论和实验上显示优于行为克隆、DAgger 等基线。
模仿学习(IL)通过演示训练智能体复现专家行为,用于机器人、语言模型训练等场景。标准行为克隆(BC)在学习者不能完美表示专家策略时(例如蒸馏中常见的情况)会出现复合误差和性能瓶颈。已有经验认为两种干预手段有效:一是沿学习者自身轨迹交互式查询专家,二是在生成策略前先估计价值函数,而不是直接拟合专家的完整动作分布。
WCM 通过让评论家(Critic)在估计价值的同时显式预测未来潜在状态,解决了视觉-语言-动作(VLA)模型强化学习后训练中评论家表征缺乏时间动态结构的问题,在仿真和真实机器人操作任务上均取得领先效果。
VLA 模型的强化学习(RL)后训练在机器人操作中展现出很大潜力。其中基于评论家的方法依赖价值估计器,但现有价值估计器主要基于单帧观测或单帧 VLM 主干特征,与机器人控制的部分可观测性存在根本性不匹配。简单地把观测历史拼接到评论家中,会在高维视觉空间中带来指数级复杂度,并且纯标量回报回归无法提供足够的跨时间动态监督。作者将根因归结为“状态近似问题”:没有…
TraceViT 通过将循环视觉推理模型的中间迭代过程约束为“语义单调的变换链”,并配合任务参考与对象工作区接地,在 ARC-AGI-1 上达到 67.8% 的 pass@2,在 ARC-AGI-2 上达到 24.3%;受控消融表明,迹监督只有在与接地配对时才有益。
Abstraction and Reasoning Corpus(ARC)要求模型从少量输入-输出示例中推断未见的变换,并将其应用到新的网格上。循环视觉推理器会在多次迭代中逐步修正预测,但传统训练只约束最终输出,中间迭代的修正过程没有任何监督信号。本文提出:中间修正应当逐步跟随真实变换,而不是只检查终点是否正确。
该论文提出一种无需干净RGB监督的3D感知RGB-NIR低光成像方法,通过将极嘈杂的RGB观测与近红外(NIR)线索在3D空间中隐式融合,恢复出干净RGB图像,并能在不同噪声水平下泛化。
低光成像仍具挑战性。已有研究尝试融合近红外(NIR)与含噪RGB来改善低光增强效果,但多数方法依赖精心配对的训练数据,在不同场景下的鲁棒性有限。本文提出新视角:引入3D感知神经建模来处理RGB-NIR低光成像问题。
持续学习(CL)系统中的分布外(OOD)检测性能会随任务增加而下降(称为 OOD 遗忘,OODF),但该下降与“旧任务分类准确率”仅呈弱负相关,说明其机制相对独立;论文提出的免训练后处理方法 TOOD 通过对数几率(logit)的任务级能量分解和基于回放缓冲区的重校准,可在多数设置下改善 OOD 检测。
持续学习通常关注“学新任务不忘旧任务”,但系统能否识别来自已学任务分布之外的输入(即 OOD 检测)同样重要,却较少被研究。本文研究持续学习过程中 OOD 检测性能动态变化的原因,提出“OOD 遗忘(OODF)”这一现象,并分析其内在机制与缓解方法。
TokTier 提出一种“有状态”的 tokenization 服务:不每次从头全量分词,而是只重算追加位置附近的小窗口,并用稳定边界检查保证输出的 token ID 与全量参考分词完全一致,从而在 coding agent 类长会话场景显著降低首 token 延迟。
LLM serving 系统会对 prompt 的 KV 状态做缓存,但大多数前端仍在每次调用时对完整请求文本重新 tokenization。 这个问题对 coding agent 尤其严重:智能体每执行完一个小工具结果,就会重新提交很长的多轮 transcript;即便只是末尾追加少量字符,也可能改变前一序列末尾的 token 边界,导致复用困难。 摘要…
该论文提出“苏格拉底测试”的理论基础:一种自动化、计算机中介的对话式评估方法,用动态评估和渐进式脚手架来量化学生的最近发展区(ZPD),并以非补偿性的加法式评分体系取代传统的惩罚性扣分模式。
论文指出两类传统评估的缺陷:
在参数高效微调(PEFT)中,将单一共享LoRA改为“自动任务分组 + 任务排序 + 独立QLoRA”的多策略优化路径组织方式,可以在相同可训练参数量下提升性能;论文报告在TRACE基准上达到44.78的最好成绩(待核实)。
PEFT通常使用单个共享LoRA适配大语言模型,但面对异构任务序列时,共享优化空间容易产生干扰,导致迁移效果差和灾难性遗忘。 已有改进思路主要是增加适配器参数容量或组合多个适配器,但大多仍依赖同一条共享优化路径。 本论文提出一种优化路径组织框架,通过自动任务分组与任务排序,在固定参数预算下构建多策略PEFT架构。
Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks
SignMuon 将 Muon 更新逐元素取符号,压缩到每参数 1 bit,是在极低通信预算下运行矩阵感知优化器的一种最直接方式;它在实践中优于 SignSGD,但即使在线性函数上也可能上升。把符号放在 LMO 之前或两侧并不能普遍修复该问题;误差反馈只有作用在梯度上时才带来标准非凸收敛率。更反直觉的是,实验中理论上会发散的 sign-after-LMO…
论文研究 Muon(一种矩阵感知优化器)在低比特通信约束下的符号压缩。核心问题包括:
视觉生成中,收敛后的扩散损失并不随自然语言提示的 token 数量缩放,而是随提示中“结构化语言”的数量缩放:与白盒似然度量 GPG 近似线性下降,与黑盒属性度量 ED 呈幂律下降。
本文研究视觉生成中“文本条件”的经验缩放性质。传统上,扩散损失被认为难以随自然语言提示的 token 数呈现稳定缩放规律,因此这类性质很少被直接测量。作者发现,若将语言提示中的“结构化程度”作为变量,则扩散损失表现出清晰的缩放行为。
研究问题:KV 缓存压缩对高效长上下文推理至关重要。已有驱逐类方法会永久丢弃未选中 token,导致这些 token 对注意力的总贡献被整体移除;合并类替代方法虽保留更多信息,但可能扰动本应保持精确的保留 key/value。 核心观察:缓存驱逐所遗漏的信息,可以形式化为 softmax 注意力分子和分母中的残差统计量。 事件信息:论文《ResKV: Re…