知识卡片:匿名模型Kivine外网刷屏,开发者猜测是Kimi-K3测试版
英文标题:Anonymous Model Kivine Surges, Developers Speculate It's Kimi-K3 Beta
英文关键词:Kivine; Kimi-K3; LLM Arena; Delta Attention; Coding Benchmark
一句话结论
匿名模型Kivine在大模型竞技场突出表现编程能力,结合泄露信息与官方彩蛋,开发者普遍猜测其为月之暗面即将发布的Kimi-K3测试版,但短期内难以对标Fable 5等顶级旗舰模型。
事件概述
2026年7月17日前后,大模型竞技场(LMSys Chatbot Arena)出现匿名模型Kivine,其编程成绩超越Opus 4.8与GPT-5.5。此前Kimi API充值页面短暂泄露(显示“K3”名称),且官方预热短片中暗含彩蛋,开发者据此广泛推测Kivine即为Kimi-K3的测试版本。
方法/产品要点
- 爆料称K3总参数量达2~3T(万亿),上下文窗口100万token,采用Kimi Delta Attention新架构。
- 网友实测Kivine可一句话生成3D游戏、模拟器等任务,表现出色。
主要结果或产业意义
Kivine在编程基准上超越前代旗舰,表明月之暗面在超大参数规模(2-3T)和长上下文架构上取得实质突破,对大模型竞技场的头部排名形成冲击。
为什么重要
该事件延续了Kimi系列模型的迭代节奏(此前有Kimi K1.5等),若Kivine确为K3,则代表中国AI公司在百亿级参数与百万token上下文窗口上的最新进展。此外,匿名测试方式反映了当前大模型评测中“匿名挑战”的流行趋势,有助于减少品牌偏见。
局限与不确定性
- 模型真实身份、参数量、架构细节均来自开发者猜测和网络爆料,月之暗面官方尚未确认,需核实。
- 网友实测案例缺乏系统性评估,短期内难以与Fable 5等顶级旗舰展开全面对标(对比标准待核实)。
- API充值页面泄露与预热短片彩蛋的关联性存在主观解读空间。
可用于图书/PPT/简报的角度
- 大模型竞技场匿名测试机制如何影响行业透明度与评测公信力。
- 从K3爆料看国产大模型在长上下文和架构创新上的追赶策略。
- 模型参数规模突破2T带来的工程挑战与训练/推理成本问题。
原始材料
- URL: https://m.sohu.com/a/1051238276_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=2
- 来源:腾讯研究院AI速递 20260717