知识卡片:蚂蚁开源轻量端侧MoE模型Ling-3.0-tiny
英文标题:Ant Group Open-Sources Ling-3.0-tiny, a Lightweight On-Device MoE Model
英文关键词:Ling-3.0-tiny; MoE; On-Device AI; Agent; Open Source
一句话结论
蚂蚁百灵开源的Ling-3.0-tiny是一款总参数7.9B、激活参数仅1.3B的轻量混合推理MoE模型,可在MacBook等端侧设备运行,FP8精度下MacBook输出约86–90 tokens/s,8K上下文峰值内存仅8.34GiB,且数据全程本地留存。
事件概述
腾讯研究院AI速递(2026-08-12)报道,蚂蚁百灵开源轻量混合推理MoE模型Ling-3.0-tiny,提供BF16、FP8、INT4三个版本,支持MacBook、Mac mini、DGX Spark等设备运行。该消息属于“生成式AI”板块。
方法/产品要点
- 架构:KDA与MLA按3:1交替结构,搭配128专家稀疏MoE。
- 规模:总参数7.9B,激活参数仅1.3B。
- 版本:提供BF16、FP8、INT4三个精度版本。
- 运行设备:MacBook、Mac mini、DGX Spark。
- 隐私:数据全程本地留存。
主要结果
- 在智能指数评测中获25分,仅比Gemma-4-26B低1分。
- Agent相关得分超过31B模型(材料未给出具体基准名称与分值)。
- FP8精度下,MacBook输出速度约86至90 tokens/s。
- 8K上下文峰值内存仅8.34GiB。
为什么重要
这是轻量端侧模型在Agent能力与推理效率上的新进展:以不到8B总参数量、1.3B激活参数,在Agent得分上超过31B模型,同时能在MacBook等消费级硬件上运行,数据不出设备。相比已有相关卡片中的SIMA 2、Together推理基准和Cursor Design Mode,本卡片的增量信息是:端侧小模型也能具备较高Agent能力,且开源可本地部署。
局限与不确定性
- 材料为新闻速递摘要,未提供智能指数评测的具体方法论、数据集和版本信息,待核实。
- “Agent得分超31B模型”中的31B模型具体名称、得分细节未列出,待核实。
- 性能数据(tokens/s、内存)仅在FP8精度、特定上下文(8K)和MacBook环境下测得,其他设备/精度/上下文下的表现待核实。
- “数据全程本地留存”是指默认使用方式,具体实现细节(如系统级隐私保障)未说明,待核实。
可用于图书/PPT/简报的角度
- 端侧AI模型的新范式:小激活参数+MoE稀疏结构如何兼顾性能与效率。
- Agent能力下沉:轻量模型在消费级硬件上运行Agent任务的可行性。
- 开源与隐私:本地推理对数据留存的产业意义。
- 模型评测:从“智能指数”得分看轻量模型与更大模型的差距。
原始材料
来源:腾讯研究院AI速递 20260812
URL: https://m.sohu.com/a/1061632085_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=4