AI消息速览

Daedalus-150M——面向 CPU 推理的卷积-注意力混合小模型

事件日期 2026-08-20 · 学术前沿 · 已接受

事件日期2026-08-20
信息日期2026-08-20
入库日期2026-08-22
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:Daedalus-150M——面向 CPU 推理的卷积-注意力混合小模型

一句话结论

Daedalus-150M 是一个 150M 参数的语言模型,设计时先固定“单用户、逐 token、4-bit 权重、普通 CPU”的推理目标,再选择架构:18 个 block 中仅 6 个保留全注意力,其余 12 个使用记忆宽度恒为两个时间步的短卷积。它在 59.9B 个 token 上从零训练,五项任务基准得分 47.31,超过训练前设定的 42.20 分门槛;在 2048 token 上下文时,比同规模全注意力对照模型解码快 1.76 倍。

事件概述或研究问题

常见做法是先按大模型方式训练小模型,再在 CPU 上做压缩部署。作者反向设计:先把目标定为“一个用户、一次一个 token、4-bit 权重、普通 CPU”,再选择适配该目标的架构。研究问题可概括为:用“全注意力 + 短卷积”的混合架构,能否在 CPU 推理场景下兼顾质量与速度。

方法/产品要点

  • 架构混合:18 个 block 中,6 个使用全注意力;12 个使用短卷积,其记忆宽度不随对话长度增长,始终为两个时间步。因此 2/3 的网络不需要反复读取不断增长的缓存。
  • 训练条件:从零训练,数据量 59.9B 个 token;验证集 bits-per-byte 为 0.8685。
  • 评估门槛:在训练前固定五项任务基准的及格线为 42.20,最终得分为 47.31。
  • 控制实验:为检验架构而不是训练配方,作者在同一数据上训练了相同规模的常规 all-attention 模型,并在评分前预先写下胜出条件。
  • 部署形态:4-bit 权重、普通 CPU,面向单用户逐 token 生成。

主要结果或产业意义

  • 相对基线:摘要称其超过 GPT-2 124M、Pythia-160M、OPT-125M、GPT-neo-125M,这些模型的训练数据量约为它的 3 到 6 倍;还超过 MobileLLM-125M 的已发表分数,尽管后者见过 1 万亿个 token。
  • 对照实验:与同规模全注意力模型相比,混合架构在选定质量指标上高 0.81%,下游任务持平,4-bit 文件小 6.3%,2048 token 上下文解码快 1.76 倍;相对外部同规模模型为 2.08 倍。
  • 速度规律:空上下文时加速接近零,随上下文长度增长而增大;简单带宽计算只预测 1.17 倍,说明仅用“读取字节更少”不能解释加速。
  • 产业意义:为 CPU 或无加速器环境下运行小模型提供了一种“推理目标优先”的架构思路,可能降低本地部署的硬件门槛。

为什么重要

该工作把部署约束前置到模型设计阶段,而不是事后把大模型压缩到 CPU。短卷积设计使大部分网络不随上下文增长而重读缓存,因此长对话解码速度优势更明显;同数据、同规模的控制实验也说明收益来自架构本身。其增量信息在于:将“混合注意力”用于 CPU 自回归小模型,并用预先写下的胜出条件分离架构收益;这与已有卡片中 SANA-Video 2.0 的视频生成混合注意力场景不同,与其余两张卡片无直接延续关系。

局限与不确定性

  • 摘要明确报告了未解决的问题:4-bit 化带来未缓解的质量损失;约一半卷积通道最终是惰性的且无法移除;词表对该模型规模偏大。
  • 待核实:五项任务的具体名称与质量指标;外部同规模模型的名称;CPU 型号与推理环境;吞吐量的具体测量方式;论文全文中的架构细节与训练超参数。
  • 待核实:所谓“普通 CPU”的具体规格未在摘要中给出;MobileLLM-125M 的“published score”对应的任务和条件也需查证原论文。

可用于图书/PPT/简报的角度

  • “先定 CPU 目标,再设计模型”:小模型不应只是大模型的缩小版。
  • 用 2/3 短卷积绕过增长缓存:长对话不重读整个缓存,是速度随上下文增长的原因。
  • 预先设定及格线再训练:47.31 vs 42.20 的可核对叙事。
  • 同数据、同规模控制实验:证明架构增益,而不是训练配方差异。
  • 带宽计算只预测 1.17 倍,实测 1.76 倍:说明架构设计带来的速度收益超出“省带宽/省显存”的朴素估计。

原始材料

  • 英文标题:Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference
  • 英文关键词:Daedalus-150M; CPU inference; convolution-attention hybrid; small language models; 4-bit weights; short convolution; token-by-token decoding
  • 作者:Christos Koutsiaris
  • arXiv ID:2608.20210v1
  • 分类:cs.IR, cs.AI, cs.CL, cs.LG
  • 发布时间:2026-08-20
  • 原始来源:https://arxiv.org/abs/2608.20210v1