2026 年 8 月 28 日,腾讯正式开源并上线了新一代旗舰级大语言模型 —— 腾讯混元 Hy4 preview。
距离 7 月 6 日发布的 Hy3 正式版(295B 总参/21B 激活)过去仅 53 天。如果说 Hy3 是腾讯在工程落地与极高性价比路线上的代表作(登顶 OpenRouter,首周调用量暴涨 68 倍),那么 Hy4 preview 则是一次面向生产力天花板的重磅跨越:总参数规模扩展至 770B,单 Token 激活 49B,原生支持超过 100 万(1M)Tokens 的超长上下文窗口,并全面以 Apache-2.0 协议开源。
更具突破性的是研发范式:Hy4 成为业内首个深度参与自身全链路研发的递归自我改进模型,从算子优化、训练策略到评估体系均由模型自主参与迭代,端到端吞吐量提升 31.8%。
腾讯在 Hy4 上展现出的技术野心很明确:不仅要让大模型在微信与办公生态中低成本普及,更要在 700B+ 顶级参数规模、长程 Agent 规划与代码工程主战场正面抗衡全球头部开源旗舰。
核心架构拆解:770B/49B MoE 与 10B MTP 投机解码
根据腾讯混元团队在 GitHub 官方仓库 与 Hugging Face 公布的架构细节,Hy4 preview 的底层技术规格如下:
| 技术维度 | Hy3 正式版(2026.07) | Hy4 preview(2026.08.28) | 架构升级与技术细节 |
|---|---|---|---|
| 总参数量 | 295B | 770B | 规模扩增 2.6 倍,表征上限与知识密度大幅跃升 |
| 激活参数量 | 21B | 49B | 78 层 Transformer(第 1 层标准 FFN,后 77 层 MoE) |
| 专家配置 | 192 专家,激活 8 | 256 路由专家(Routed Experts) | 细粒度专家动态路由,负载更均衡 |
| 投机解码 | 标准自回归 | 内置 10B MTP(Multi-Token Prediction) | 多头预测层加速输出,大幅降低推理延迟 |
| 上下文窗口 | 256K | > 1M Tokens (100万+ Tokens) | 原生支持超长代码库全局感知与书籍级分析 |
| 开源协议 | 权重开源 | Apache-2.0 宽松开源协议 | 允许商用与二次开发修改 |
| 推理部署推荐 | 单卡/多卡量化 | vLLM / SGLang 原生支持 | 提供 Hy4-preview-FP8 权重,推荐 8 卡节点高并发服务 |
Hy4 preview 引入的 10B MTP 模块是提升长文本推理效率的关键:在解码阶段,模型能够单步预测多个后续 Token,配合 vLLM 与 SGLang 的推测解码(Speculative Decoding)优化,有效解决了 770B 超大模型在长序列生成时常遇到的内存带宽瓶颈。
业内首创:研发全链路「递归自我改进闭环」
在大模型研发过程中,人工调优训练数据、写算子、做评测往往面临人力瓶颈。Hy4 首次实现了自我演进的闭环研发机制(Recursive Self-Improvement Loop):
graph TD
A[Hy4 基座模型能力] --> B[自主分析底层算子与通信瓶颈]
B --> C[自动优化训练方法与数据混合策略]
C --> D[生成高难度针对性合成数据与验证集]
D --> E[驱动下一轮迭代与模型自重构]
E --> A
- 算子与系统优化:Hy4 自主分析分布式训练与推理运行时的性能热点,重构算子融合逻辑与跨卡 All-to-All 通信调度,使得模型端到端吞吐量相比人工基线提升 31.8%。
- 合成数据与课程学习设计:模型能够自动识别自身在长链代码重构与数学竞赛题中的弱项,针对性生成逻辑校验合成数据,并通过自我博弈(Self-Play)过滤低质样本。
- 工具调用专用解析器:内置了经过深度自迭代调优的
hy_v4工具解析器,显著提升复杂 JSON 与多层嵌套 API 调用的容错率。
生产力导向:四大核心落地场景能力实测
腾讯官方明确将 Hy4 定位为「为真实生产力而生(Born for Productivity)」的模型,重点在四大关键场景实现了能力跨越:
| 核心场景 | 重点能力升级 | 实际生产力表现 |
|---|---|---|
| 复杂代码工程 (Coding) | 跨仓库长链规划、跨文件依赖重构、Bug 定位 | SWE-bench 解决率大幅超越上一代,适配复杂微服务演进 |
| 智能体工作流 (Agent) | 长达数百步工具调用、环境状态自适应感知 | 结合 1M 上下文,具备长程任务容错与状态自愈能力 |
| 办公与数据分析 (Office) | 复杂财务建模、多表关联分析、超长文档提炼 | ima 与腾讯文档长文本综合分析准确率显著提升 |
| 游戏开发与科研 (Creative & Science) | 自然语言生成可运行原型、物理/分子动力学推理 | 支持与游戏引擎交互,具备复杂跨学科逻辑推演能力 |
在实际工程测试中,Hy4 preview 的长程依赖管理展现出明显优势。在面对 50 万行以上的复杂开源代码库重构任务时,得益于 1M 上下文和细粒度专家路由,模型能够精准定位跨模块符号调用,避免了传统分块 RAG 带来的上下文断裂问题。
全矩阵首发与产品生态联动
配合 Hy4 preview 的发布,腾讯旗下 AI 核心产品线在第一时间完成了全系接入:
| 接入产品 | 定位 | Hy4 接入赋能与使用方式 |
|---|---|---|
| CodeBuddy | AI 编程工作台 | 国内版与国际版同步上线 Hy4 preview,支持对话即编程与全栈代码生成 |
| WorkBuddy | 办公智能体平台 | 默认高算力主力推荐模型,强化复杂数据表分析与报告生成 |
| 腾讯元宝 (Yuanbao) | C 端通用 AI 助手 | 深度融合 Hy4 生产力能力,支持超长文档解析与多轮深度创作 |
| ima.copilot | 知识库与工作流中枢 | 依托 1M 上下文能力,实现海量个人/团队知识库的无缝多跳检索 |
与 Hy3 正式版 依靠 295B 规模走平民化部署路线不同,Hy4 preview 承担的是「顶尖技术旗舰」的角色,为 CodeBuddy 和 WorkBuddy 的高阶复杂任务提供了充足的算力与智能底座。
官方开源仓库与权威获取链接
Hy4 preview 遵循 Apache-2.0 开源协议,模型权重与官方代码已在国内外主流平台同步开放下载:
- Hugging Face 官方权重:
- tencent/Hy4-preview(全精度权重)
- tencent/Hy4-preview-FP8(FP8 官方量化版本)
- GitHub 官方开源仓库:
- ModelScope 社区地址:
- GitCode 镜像仓库:
- 腾讯 CNB 平台:
API 接入与商业化定价矩阵
开发者与企业用户除了自行下载权重部署外,亦可通过云端 API 快速调用:
| 计费项 (TokenHub / OpenRouter) | Hy4 preview 官方费率 | Hy3 正式版 费率 | 竞品万亿级模型参考 |
|---|---|---|---|
| 输入价格 (Input) | 6.0 元 / 百万 Tokens | 1.0 元 / 百万 Tokens | ~$5.00 / M (~36 元/M) |
| 输出价格 (Output) | 18.0 元 / 百万 Tokens | 4.0 元 / 百万 Tokens | ~$15.00 / M (~108 元/M) |
| Prompt 缓存命中 (Cache Hit) | 0.3 元 / 百万 Tokens | 0.25 元 / 百万 Tokens | ~$1.25 / M (~9 元/M) |
| 上下文支持 | 1,000,000 Tokens (1M) | 256,000 Tokens (256K) | 128K - 200K Tokens |
| API 接入渠道 | 腾讯云 TokenHub / OpenRouter | 腾讯云 TokenHub / OpenRouter | 官方 API 平台 |
在定价层面,Hy4 preview 依然延续了极高的性价比策略:尽管模型规模大幅跃升至 770B 且支持 1M 上下文,其 6元/18元的输入输出定价仅为海外同等量级模型的 1/6 左右,配合低至 0.3 元的缓存命中价,在大规模上下文注入场景下具备极强的商业吸引力。
总结与未来展望
从 4 月 23 日的 Hy3 Preview,到 7 月 6 日的 Hy3 正式版,再到 8 月 28 日的 Hy4 preview,腾讯混元在短短 4 个月内完成了从「295B 做减法、专注端侧单卡」到「770B 挺进万亿规模、突破 1M 上下文、探索递归自我演进」的战略蜕变。
- 开源生态的持续深耕:坚持 Apache-2.0 协议多平台同步开源,展现了腾讯与全球开发者共建开源生态的决心;
- 算力效率与技术闭环:通过 MTP 投机解码与自我优化闭环,突破了超大 MoE 模型的部署瓶颈;
- 产品即分发渠道:依托 CodeBuddy、WorkBuddy、元宝与微信生态,Hy4 的技术红利能够以极快速度转化为实际生产力。
随着后续正式版(Official Release)的持续迭代,腾讯混元在大模型核心竞争中的技术纵深值得持续关注。