7 月 6 日,腾讯混元 Hy3 正式版发布。距离 Preview 版本(4 月 23 日)过去了 74 天。
正式版的数据很直接:首周调用量较上一代 Hy2 增长超 68 倍,登顶 OpenRouter 全球模型调用榜单。在 WorkBuddy 自选模型的用户中,选择 Hy3 的比例达到 60%。近 50 个腾讯内部业务排队接入。
这不是一个「又发了个新版本」的故事。68 倍增长意味着 Hy3 从「内部试验品」变成了「生产级基础设施」。
68 倍不是营销数字,是产品 Co-Design 策略的验证——当模型从第一天就和 10 亿用户的产品一起迭代,调用量增长是自然结果。
正式版 vs Preview:稳定性 > 新能力
Hy3 正式版的核心升级不是参数变化(仍然是 295B 总参/21B 激活),而是稳定性和性价比:
| 维度 | Hy3 Preview(4.23) | Hy3 正式版(7.6) |
|---|---|---|
| 总参数/激活 | 295B / 21B | 295B / 21B |
| 上下文 | 256K | 256K |
| 架构 | MoE(192 专家,激活 8) | 同左 |
| 注意力 | GQA(64 heads / 8 KV heads) | 同左 |
| 思考模式 | 快慢融合三档 | 同左 |
| 开源 | HuggingFace | GitHub + HuggingFace + ModelScope + GitCode |
| 量化版本 | 无 | 1bit + 4bit 权重量化 |
| 部署门槛 | 多卡 | 单张推理显卡可跑(量化后) |
| Token 节省 | — | 文档场景 -47.4%,PPT 场景 -49.0% |
正式版的关键增量是量化版本。1bit 和 4bit 权重量化让 Hy3 可以在单张推理显卡或内存充足的本地机器上运行。这把私有化部署的门槛从「多卡服务器集群」降到了「一台工作站」。
Token 节省数据也值得注意:文档场景节省 47.4%,PPT 场景节省 49.0%。这意味着同样的任务,Hy3 正式版的 API 成本约为 Preview 的一半。
68 倍增长背后的产品逻辑
68 倍调用量增长不是靠模型本身,而是靠产品矩阵的拉动。Hy3 正式版发布时,腾讯的 AI 产品矩阵已经成型:
| 产品 | 角色 | Hy3 接入方式 |
|---|---|---|
| WorkBuddy | 办公智能体 | 默认推荐模型 |
| CodeBuddy | AI 编程工具 | 全系产品支持 |
| 元宝 | C 端对话 | 主力模型 |
| 腾讯文档 | 办公套件 | AI 功能底层 |
| 腾讯新闻 | 内容平台 | no-think 快速模式 |
Hy3 的 Co-Design 策略在 Preview 阶段就已经展开(详见Preview 评测):CodeBuddy 首 Token 延迟降 54%,端到端耗时降 47%,最长驱动 495 步 Agent 流。正式版进一步优化了这些指标。
OpenRouter 登顶则是另一个维度的验证——海外开发者用脚投票,把 Hy3 推到了全球调用量第一。这与 GLM-5.2 的 MIT 开源策略形成呼应:国产模型正在从「国内自用」走向「全球可用」。
WorkBuddy 免费两周:7 月 6 日至 22 日
配合 Hy3 正式版发布,腾讯 WorkBuddy 推出了限时免费活动:
| 维度 | 详情 |
|---|---|
| 活动时间 | 2026 年 7 月 6 日 — 7 月 22 日 23 |
| 免费范围 | 使用 Hy3 时不消耗积分 |
| 功能限制 | 全功能开放 |
| 签到要求 | 无需签到攒积分 |
| 版本差异 | 免费版与专业版底层模型能力一致 |
| 7.22 之后 | 收费方式未公告 |
关键信息:免费版与专业版的底层模型能力一致,差异主要在积分额度和高级技能包。这意味着在活动期间,免费用户体验到的 Hy3 能力与付费用户完全相同。
CodeBuddy 也同步提供了 Hy3 限免(截至 7 月 20 日),但截止时间与 WorkBuddy 略有不同。
盲测数据:Hy3 vs GLM-5.1
正式版发布时,腾讯给出了一组盲测数据:
| 指标 | Hy3 正式版 | GLM-5.1 |
|---|---|---|
| 盲测均分 | 2.67 | 2.51 |
0.16 分的差距不算碾压,但方向明确:在人类评估者不知道模型身份的情况下,Hy3 正式版的综合表现优于 GLM-5.1。
需要注意的是,这个对比对象是 GLM-5.1 而非最新的 GLM-5.2。GLM-5.2(744B MoE,MIT 开源)在编程实战场景的能力已有显著提升。Hy3 正式版与 GLM-5.2 的正面对比数据尚未公开。
API 定价与接入
Hy3 正式版 API 已上线腾讯云 TokenHub 和海外平台:
| 计费项 | 价格 |
|---|---|
| 输入 | 1 元 / 百万 Tokens |
| 输出 | 4 元 / 百万 Tokens |
| 缓存命中 | 0.25 元 / 百万 Tokens |
对比 Claude Fable 5 的 $10/$50(约 72 元/360 元),Hy3 的定价低了两个数量级。当然,两者不在同一能力层级——Fable 5 的 1M 上下文和数百子代理并行是 Hy3 当前不具备的。但在性价比维度,Hy3 正式版对国内开发者极具吸引力。
OpenRouter 上还提供 Hy3 Preview(Free)的永久免费版本,但那是预览版而非正式版,能力有差距。
竞品定位:295B 的生存空间
在 Qwen 3.8 Max(2.4T)和 GLM-5.2(744B)的夹击下,Hy3 的 295B 看起来「小」。但腾讯的逻辑从来不是「最大」,而是「够用且便宜」:
| 维度 | Hy3 正式版 | Qwen 3.8 Max | GLM-5.2 |
|---|---|---|---|
| 参数 | 295B/21B | 2.4T | 744B/40B |
| 部署成本 | 单卡(量化后) | 云端 only | 多卡 |
| API 输入价 | 1 元/M | 未公布 | 开源免费 |
| 产品生态 | WorkBuddy + CodeBuddy + 元宝 | Qoder CN 系列 | 开放接入 |
| 开源协议 | 开源 | 不开源 | MIT |
Hy3 的生存空间在于:腾讯产品矩阵的内嵌需求 + 极低的部署成本 + 开源带来的企业私有化部署可能性。不是所有场景都需要 2.4T,大部分办公和编程场景 295B 足够——关键是够用的同时成本最低。
写在最后
Hy3 正式版的 68 倍增长,验证了姚顺雨「Co-Design」策略的有效性:不追最大参数,追最深产品嵌入。当模型从第一天就和 WorkBuddy、CodeBuddy、元宝、腾讯文档一起迭代,调用量增长不需要市场推广来驱动——产品本身就是分发渠道。
Hy3 正式版的意义不在于 295B 有多强,而在于证明了一件事:在 AI 模型竞争中,「被 10 亿人用到」比「在 benchmark 上排第一」更有商业价值。
开源策略:四平台同步的意义
Hy3 正式版选择同时在 GitHub、HuggingFace、ModelScope、GitCode 四个平台开源,这个决策有多层考量:
GitHub:面向全球开发者社区,建立国际影响力。OpenRouter 登顶带来的海外关注度需要 GitHub 仓库来承接。
HuggingFace:AI 模型的事实标准分发平台,方便研究者下载、评测、微调。
ModelScope:阿里达摩院的模型平台,国内访问速度快,适合国内开发者。
GitCode:CSDN 旗下,覆盖国内最大的中文开发者社区。
四平台同步确保了无论用户在哪个生态,都能以最低摩擦获取模型权重。对比 Qwen 3.8 Max 的「不开源」策略,Hy3 走的是完全不同的路——用开源换生态,用生态换调用量,用调用量换商业价值。
1bit/4bit 量化:本地部署的平民化
正式版新增的 1bit 和 4bit 权重量化版本,是 Hy3 区别于其他大模型的关键差异化:
| 量化精度 | 显存需求(估算) | 适用硬件 | 精度损失 |
|---|---|---|---|
| FP16(原始) | ~590GB | 多卡服务器集群 | 无 |
| 4bit | ~150GB | 单张 A100/H100 | 极小 |
| 1bit | ~37GB | 消费级显卡(48GB) | 可接受 |
1bit 量化让 Hy3 可以在单张 48GB 显存的消费级显卡上运行。这意味着个人开发者和小团队可以本地部署一个 295B 参数的模型,无需依赖云端 API。
对于有数据合规要求的企业(金融、医疗、政务),本地部署不是可选项而是必选项。Hy3 的量化版本把私有化部署的门槛从「百万级服务器集群」降到了「一台工作站」,这是实实在在的商业价值。
对腾讯 AI 战略的意义
Hy3 正式版不只是一个模型发布,而是腾讯 AI 战略从「观望」转向「全面进攻」的信号。
马化腾在内部讲话中用「船漏水了」形容腾讯在 AI 竞赛中的紧迫感(据公开报道)。WorkBuddy 三个月用户量增长两个数量级、Hy3 首周调用量暴涨 68 倍、近 50 个内部业务排队接入——这些数据表明腾讯的 AI 产品化能力正在快速兑现。
腾讯的 AI 路径与阿里和字节不同:不追求「最大模型」或「最便宜模型」,而是追求「最多用户触达的模型」。微信 13 亿用户、QQ 6 亿用户、腾讯文档数亿用户——这些产品就是 Hy3 的分发渠道。模型不需要最强,需要「在 10 亿人的手机里」。