知识卡片:腾讯混元Hy3正式版实测与WorkBuddy限时免费
一句话结论
腾讯混元Hy3正式版(300B参数)在软件开发、办公生产等场景综合表现追平甚至超越700B的GLM5.1,部分能力接近更大参数的DeepSeek V4 pro,已在WorkBuddy首发并限时两周免费。
事件概述
腾讯混元Hy3正式版发布,体量仅为300B参数,却在多个基准测试和实际场景中展现出与更大规模模型相当甚至更优的能力。该模型已在WorkBuddy平台首发,并推出限时两周免费使用的活动。实测中,Hy3在三个刁钻场景(手搓商业级微信小程序、单文件3D光学塔防游戏、零输入自动生成研报网页与PPT)均一次交付,复杂前端交互与物理反射计算表现突出;体感上意图保持能力稳定,工具调用与输出格式达到生产级标准,幻觉率低,缺失数据会主动提示。
方法/产品要点
- 模型规模:仅300B参数(待核实是否指总参数或激活参数)
- 对标模型:综合表现追平/超越700B的GLM5.1,部分能力接近更大参数的DeepSeek V4 pro
- 首发平台:WorkBuddy,限时两周免费(具体截止日期待核实)
- 实测场景:
- 手搓商业级微信小程序:一次性生成完整可运行代码
- 单文件3D光学塔防游戏:包含物理反射计算,一次交付
- 零输入自动生成研报网页与PPT:无需用户提供初始内容即可完成
- 生产级特性:意图保持稳定、工具调用准确、输出格式规范、幻觉率低、缺失数据主动提示
主要结果或产业意义
- 以更小参数规模实现与更大模型相近甚至更强的能力,验证了模型架构和训练优化的有效性
- 在复杂前端交互、物理模拟等需要多步推理的场景中表现出色,展示了在软件开发、办公自动化等领域的实用价值
- 限时免费策略有望快速吸引开发者生态,积累真实使用反馈
局限与不确定性
- “300B”参数的具体定义(总参数 vs 激活参数)待核实
- 与DeepSeek V4 pro的对比细节(具体哪些能力接近、差距多少)未量化说明
- 限时两周免费的起止日期未提及,需从WorkBuddy官方确认
- 实测场景为官方选取的演示,可能存在样本选择偏差,实际通用能力需更多独立评测
可用于图书/PPT/简报的角度
- 大模型“以小博大”的案例:300B模型如何追平700B模型,展示效率优化趋势
- AI在软件开发中的实战应用:从聊天助手到代码生成、游戏构建的突破
- 企业级AI产品的免费试用策略:WorkBuddy限时免费如何推动生态建设
原始材料
- URL: https://m.sohu.com/a/1047205956_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=2
- 英文标题: Tencent Hunyuan Hy3 Hands-on Test, WorkBuddy Free for Two Weeks
- 英文关键词: Hy3, WorkBuddy, Tencent Hunyuan, large language model, AI test