知识卡片:Puro-2B:穷实验室的Qwen2-1.5B——在RTX 5090上以5090美元内完成预训练
一句话结论
Puro-2B 是一套面向资源受限实验室的开源预训练配方:在消费级 RTX 5090 GPU 上用 FP8 精度从零训练 2B 级模型,最高使用 1.4 万亿 tokens;最佳模型计算成本低于 6.9K 美元,性能接近 Qwen2.5-1.5B。拟合的 Puro 成本缩放定律进一步表明,约 4.4K 美元(<5,090 美元)即可达到 Qwen2-1.5B 的性能水平。
事件概述或研究问题
大型语言模型预训练长期被认为是“天价”研究,学术和小型开源社区难以参与。论文指出,即便小规模训练,Llama-3.2-3B 也需超过 150 万美元,复现 SmolLM3-3B 需超过 70 万美元。尽管已有开源权重和部分训练配方,但缺乏一套成本高效、硬件可及且完整开源的预训练方案。Puro-2B 报告提出并验证了这样一套配方,将预训练成本压缩到数千美元量级。
方法/产品要点
- 硬件:消费级 RTX 5090 GPU。
- 精度:FP8 低精度训练。
- 技术组合:硬件选择、低精度训练、hyperball optimization(具体机制待核实)、curriculum model averaging(课程模型平均)以及数据配方。
- 模型系列:Puro-2B 集合,包含不同 token 预算和配方变体,最多训练 1.4 万亿 tokens。
- 开源发布:完整训练配方(数据、代码、模型权重)以 Apache 2.0 协议发布在 Hugging Face。
主要结果或产业意义
- 最佳模型:计算成本 < 6.9K 美元,在作者自己的评估协议下性能接近 Qwen2.5-1.5B。
- Puro 成本缩放定律:基于 Puro-2B 系列拟合训练成本与平均性能的关系,预测约 4.4K 美元即可达到 Qwen2-1.5B 性能,低于标题中的 5,090 美元。
- 端到端案例研究:借助完整预训练管线而非仅模型权重,研究了预训练数据课程(curricula)如何影响 post-training 之后的下游性能。
- 相比 Llama-3.2-3B 的 150 万美元和 SmolLM3-3B 的 70 万美元,该配方的成本降低约两个数量级,为“穷实验室”从零预训练大模型提供了可行路径。
为什么重要
- 填补了“低成本、硬件可及、完整开源预训练配方”的空白,而不是只发布模型权重。
- 可复现的训练数据、代码和权重全量开放,便于社区验证和改进。
- 提出成本缩放定律,为预算规划提供定量依据。
- 提供了数据课程对下游性能影响的受控实验证据,这类研究通常需要完整预训练管线才能开展。
局限与不确定性
- 评估协议的具体细节未在摘要中说明,“接近 Qwen2.5-1.5B”的具体差距待核实。
- 成本“< 6.9K 美元”是计算成本(compute cost),是否包含硬件购置、电力、人工等费用不明确,待核实。
- 成本缩放定律是拟合结果,实际以 4.4K 美元达到 Qwen2-1.5B 性能仍需独立复现验证。
- hyperball optimization 和 curriculum model averaging 的具体实现与作用机制待核实。
- 模型集合中的模型数量、每个模型的 token 规模及变体列表待核实。
- 摘要未给出与 Qwen2-1.5B / Qwen2.5-1.5B 的详细对比基准,待核实。
可用于图书/PPT/简报的角度
- 消费级 GPU 上从零预训练大模型:从“百万美元门槛”到“几千美元可能性”的案例。
- 成本缩放定律:用少量实验预测达到目标性能所需预算。
- 开源配方比开源权重更重要:让社区能“从零训练”而不是只能微调。
- FP8 低精度训练在 2B 规模上的性价比验证。
- 预训练数据课程对后训练下游表现的影响,以及完整管线对科学研究的价值。
原始材料
- 英文标题:Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
- 英文关键词(根据摘要归纳):LLM Pretraining, Cost Efficiency, Open-source Recipe, FP8, RTX 5090
- 原始来源:https://arxiv.org/abs/2608.27370v1
- arXiv ID:2608.27370v1
- 分类:cs.CL, cs.LG