跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.08.28 · 10 min

腾讯混元 Hy4 Preview 正式开源:770B/49B 万亿级 MoE、1M 超长上下文与递归自我改进闭环

2026 年 8 月 28 日,腾讯正式开源发布混元 Hy4 preview(https://huggingface.co/tencent/Hy4-preview)。模型采用 770B 总参/49B 激活的 MoE 架构,支持 1M+ 上下文与 10B MTP 投机解码,业内首次实现研发全链路递归自我改进闭环。

前沿动态

2026 年 8 月 28 日,腾讯正式开源并上线了新一代旗舰级大语言模型 —— 腾讯混元 Hy4 preview。

距离 7 月 6 日发布的 Hy3 正式版(295B 总参/21B 激活)过去仅 53 天。如果说 Hy3 是腾讯在工程落地与极高性价比路线上的代表作(登顶 OpenRouter,首周调用量暴涨 68 倍),那么 Hy4 preview 则是一次面向生产力天花板的重磅跨越:总参数规模扩展至 770B,单 Token 激活 49B,原生支持超过 100 万(1M)Tokens 的超长上下文窗口,并全面以 Apache-2.0 协议开源。

更具突破性的是研发范式:Hy4 成为业内首个深度参与自身全链路研发的递归自我改进模型,从算子优化、训练策略到评估体系均由模型自主参与迭代,端到端吞吐量提升 31.8%。

腾讯在 Hy4 上展现出的技术野心很明确:不仅要让大模型在微信与办公生态中低成本普及,更要在 700B+ 顶级参数规模、长程 Agent 规划与代码工程主战场正面抗衡全球头部开源旗舰。


核心架构拆解:770B/49B MoE 与 10B MTP 投机解码

根据腾讯混元团队在 GitHub 官方仓库 与 Hugging Face 公布的架构细节,Hy4 preview 的底层技术规格如下:

技术维度 Hy3 正式版(2026.07) Hy4 preview(2026.08.28) 架构升级与技术细节
总参数量 295B 770B 规模扩增 2.6 倍,表征上限与知识密度大幅跃升
激活参数量 21B 49B 78 层 Transformer(第 1 层标准 FFN,后 77 层 MoE)
专家配置 192 专家,激活 8 256 路由专家(Routed Experts) 细粒度专家动态路由,负载更均衡
投机解码 标准自回归 内置 10B MTP(Multi-Token Prediction) 多头预测层加速输出,大幅降低推理延迟
上下文窗口 256K > 1M Tokens (100万+ Tokens) 原生支持超长代码库全局感知与书籍级分析
开源协议 权重开源 Apache-2.0 宽松开源协议 允许商用与二次开发修改
推理部署推荐 单卡/多卡量化 vLLM / SGLang 原生支持 提供 Hy4-preview-FP8 权重,推荐 8 卡节点高并发服务

Hy4 preview 引入的 10B MTP 模块是提升长文本推理效率的关键:在解码阶段,模型能够单步预测多个后续 Token,配合 vLLM 与 SGLang 的推测解码(Speculative Decoding)优化,有效解决了 770B 超大模型在长序列生成时常遇到的内存带宽瓶颈。


业内首创:研发全链路「递归自我改进闭环」

在大模型研发过程中,人工调优训练数据、写算子、做评测往往面临人力瓶颈。Hy4 首次实现了自我演进的闭环研发机制(Recursive Self-Improvement Loop):

graph TD
    A[Hy4 基座模型能力] --> B[自主分析底层算子与通信瓶颈]
    B --> C[自动优化训练方法与数据混合策略]
    C --> D[生成高难度针对性合成数据与验证集]
    D --> E[驱动下一轮迭代与模型自重构]
    E --> A
  1. 算子与系统优化:Hy4 自主分析分布式训练与推理运行时的性能热点,重构算子融合逻辑与跨卡 All-to-All 通信调度,使得模型端到端吞吐量相比人工基线提升 31.8%。
  2. 合成数据与课程学习设计:模型能够自动识别自身在长链代码重构与数学竞赛题中的弱项,针对性生成逻辑校验合成数据,并通过自我博弈(Self-Play)过滤低质样本。
  3. 工具调用专用解析器:内置了经过深度自迭代调优的 hy_v4 工具解析器,显著提升复杂 JSON 与多层嵌套 API 调用的容错率。

生产力导向:四大核心落地场景能力实测

腾讯官方明确将 Hy4 定位为「为真实生产力而生(Born for Productivity)」的模型,重点在四大关键场景实现了能力跨越:

核心场景 重点能力升级 实际生产力表现
复杂代码工程 (Coding) 跨仓库长链规划、跨文件依赖重构、Bug 定位 SWE-bench 解决率大幅超越上一代,适配复杂微服务演进
智能体工作流 (Agent) 长达数百步工具调用、环境状态自适应感知 结合 1M 上下文,具备长程任务容错与状态自愈能力
办公与数据分析 (Office) 复杂财务建模、多表关联分析、超长文档提炼 ima 与腾讯文档长文本综合分析准确率显著提升
游戏开发与科研 (Creative & Science) 自然语言生成可运行原型、物理/分子动力学推理 支持与游戏引擎交互,具备复杂跨学科逻辑推演能力

在实际工程测试中,Hy4 preview 的长程依赖管理展现出明显优势。在面对 50 万行以上的复杂开源代码库重构任务时,得益于 1M 上下文和细粒度专家路由,模型能够精准定位跨模块符号调用,避免了传统分块 RAG 带来的上下文断裂问题。


全矩阵首发与产品生态联动

配合 Hy4 preview 的发布,腾讯旗下 AI 核心产品线在第一时间完成了全系接入:

接入产品 定位 Hy4 接入赋能与使用方式
CodeBuddy AI 编程工作台 国内版与国际版同步上线 Hy4 preview,支持对话即编程与全栈代码生成
WorkBuddy 办公智能体平台 默认高算力主力推荐模型,强化复杂数据表分析与报告生成
腾讯元宝 (Yuanbao) C 端通用 AI 助手 深度融合 Hy4 生产力能力,支持超长文档解析与多轮深度创作
ima.copilot 知识库与工作流中枢 依托 1M 上下文能力,实现海量个人/团队知识库的无缝多跳检索

与 Hy3 正式版 依靠 295B 规模走平民化部署路线不同,Hy4 preview 承担的是「顶尖技术旗舰」的角色,为 CodeBuddy 和 WorkBuddy 的高阶复杂任务提供了充足的算力与智能底座。


官方开源仓库与权威获取链接

Hy4 preview 遵循 Apache-2.0 开源协议,模型权重与官方代码已在国内外主流平台同步开放下载:


API 接入与商业化定价矩阵

开发者与企业用户除了自行下载权重部署外,亦可通过云端 API 快速调用:

计费项 (TokenHub / OpenRouter) Hy4 preview 官方费率 Hy3 正式版 费率 竞品万亿级模型参考
输入价格 (Input) 6.0 元 / 百万 Tokens 1.0 元 / 百万 Tokens ~$5.00 / M (~36 元/M)
输出价格 (Output) 18.0 元 / 百万 Tokens 4.0 元 / 百万 Tokens ~$15.00 / M (~108 元/M)
Prompt 缓存命中 (Cache Hit) 0.3 元 / 百万 Tokens 0.25 元 / 百万 Tokens ~$1.25 / M (~9 元/M)
上下文支持 1,000,000 Tokens (1M) 256,000 Tokens (256K) 128K - 200K Tokens
API 接入渠道 腾讯云 TokenHub / OpenRouter 腾讯云 TokenHub / OpenRouter 官方 API 平台

在定价层面,Hy4 preview 依然延续了极高的性价比策略:尽管模型规模大幅跃升至 770B 且支持 1M 上下文,其 6元/18元的输入输出定价仅为海外同等量级模型的 1/6 左右,配合低至 0.3 元的缓存命中价,在大规模上下文注入场景下具备极强的商业吸引力。


总结与未来展望

从 4 月 23 日的 Hy3 Preview,到 7 月 6 日的 Hy3 正式版,再到 8 月 28 日的 Hy4 preview,腾讯混元在短短 4 个月内完成了从「295B 做减法、专注端侧单卡」到「770B 挺进万亿规模、突破 1M 上下文、探索递归自我演进」的战略蜕变。

  1. 开源生态的持续深耕:坚持 Apache-2.0 协议多平台同步开源,展现了腾讯与全球开发者共建开源生态的决心;
  2. 算力效率与技术闭环:通过 MTP 投机解码与自我优化闭环,突破了超大 MoE 模型的部署瓶颈;
  3. 产品即分发渠道:依托 CodeBuddy、WorkBuddy、元宝与微信生态,Hy4 的技术红利能够以极快速度转化为实际生产力。

随着后续正式版(Official Release)的持续迭代,腾讯混元在大模型核心竞争中的技术纵深值得持续关注。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板