跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.08.26 · 9 min

智谱 GLM-5.3-Flash 正式开源:320B/18B 原生多模态、代号「牛来」与 1M 上下文

2026 年 8 月 26 日,智谱 AI 正式开源 GLM-5.3 系列。其中 GLM-5.3-Flash 采用 320B 总参/18B 激活的原生多模态 MoE 架构,前身为盲测屠榜的匿名模型「ox-alpha(牛来)」,在 Artificial Analysis 斩获 57 分并支持 1M 上下文。

前沿动态

2026 年 8 月 26 日,智谱 AI 正式发布并开源了 GLM-5.3 旗舰系列模型。其中,最受开发者关注的轻量主力舰 —— GLM-5.3-Flash 正式揭开面纱。

此前在 OpenCode 与 OpenRouter 盲测排行榜上,一个代号为 ox-alpha(中文开发者社区亲切称之为「牛来」) 的神秘模型连续数周在代码生成与多模态交互榜单上位居前列。随着智谱官方公布权重,社区终于确认:ox-alpha 正是 GLM-5.3-Flash。

作为 GLM-5 家族首个原生端到端多模态架构的轻量 MoE 模型,GLM-5.3-Flash 拥有 320B 总参数、18B 激活参数,支持高达 1,000,000 Tokens(1M) 的超长上下文窗口,并在兼顾极低推理成本的同时,性能达到了与顶级闭源模型同台竞技的水平。

在国产大模型竞争进入「深水区」的 2026 年 8 月,GLM-5.3-Flash 的开源再次证明了:高密度的架构创新与极致的推理优化,可以让平民级成本迸发出旗舰级的智能表现。


核心架构拆解:混合稀疏注意力与 320B/18B MoE

GLM-5.3-Flash 在底层架构上进行了大胆的工程创新,兼顾了多模态表征与高速长序列推理:

架构维度 GLM-5.2(2026.06) GLM-5.3-Flash(2026.08.26) 核心升级说明
总参数 / 激活参数 744B / 40B 320B / 18B 激活参数减少 55%,单卡吞吐量大幅跃升
模态支持 纯文本 + 视觉适配器 原生端到端多模态统一 Transformer 视觉、图表与代码统一编码,Token 损耗降低 45%
注意力机制 传统 Grouped-Query Attention (GQA) 混合稀疏/线性注意力机制 (Sparse-Linear Attention) 解决 1M 极长序列计算二次方复杂度爆炸
上下文长度 256K 1M Tokens (100 万) 支持长视频切帧与超大型代码仓库一次性输入
开源协议 MIT 协议 Apache-2.0 协议 权重全量开源,开放商业化部署与微调
盲测代号 GLM-5.2 ox-alpha(牛来) 在全球盲测榜单中战平顶级旗舰

得益于混合稀疏与线性注意力机制,GLM-5.3-Flash 在处理 100 万 Token 级别的长输入时,首 Token 延迟(TTFT)相比前代缩短了 62%,显存占用降低了 50% 以上。


盲测战绩复盘:匿名模型 ox-alpha 到底有多强?

在正式开源前,智谱将模型匿名提交至 OpenCode 与 OpenRouter 竞技场进行双盲测试,积累了海量真实生产调用的评测数据:

评测基准 / 竞技场 GLM-5.3-Flash (ox-alpha) 腾讯混元 Hy3 正式版 DeepSeek V4-Flash Claude 3.7 Sonnet (参考)
Artificial Analysis (AA) 智能指数 57 分 52 分 53 分 56 分
SWE-bench Verified 78.6% 74.4% 76.2% 70.3%
AIME 2026 (数学竞赛) 79.2% 71.0% 78.0% 78.5%
LiveBench 多模态图表解析 84.5 — 79.1 82.0
推理速度 (Output Tokens/s) 145 tok/s 95 tok/s 130 tok/s 80 tok/s

数据表明,GLM-5.3-Flash 在仅激活 18B 参数的轻量配置下,不仅在代码和数学基准上全面反超前代模型,更以 145 tok/s 的极速输出吞吐成为高并发 Agent 调用的理想底座。


旗舰同步登场:GLM-5.3 全尺寸深度思考模型

除 Flash 轻量版外,智谱同期推出了主打复杂推理的重磅旗舰 GLM-5.3:

graph TD
    A[用户输入复杂工程任务] --> B{GLM-5.3 深度思考引擎}
    B -->|Low 档位| C[日常代码审查与文档问答]
    B -->|High 档位| D[跨模块系统架构设计与重构]
    B -->|Max 档位 (32K Token)| E[形式化数学证明与网络安全漏洞挖掘]
  • 全场景强制思考(Thinking by Default):GLM-5.3 默认开启快慢思考融合,提供 low、high、max 三种推理强度;
  • 网络安全攻防 SOTA:在权威网络安全基准 CyberGym 测试中,GLM-5.3 成为首个能够全自主发现并复现 0-day 内存越界漏洞的大模型;
  • 编程能力暴涨 50%:在大规模跨文件工程重构任务中,代码单次通过率大幅提升。

API 定价与私有化部署实操

智谱开放平台(bigmodel.cn)与海外分发渠道已同步上线 API:

计费与部署维度 GLM-5.3-Flash 官方费率 GLM-5.3 旗舰版费率
输入价格 (Input) 0.8 元 / 百万 Tokens 12.0 元 / 百万 Tokens
输出价格 (Output) 2.0 元 / 百万 Tokens 36.0 元 / 百万 Tokens
Prompt 缓存命中 0.1 元 / 百万 Tokens 1.5 元 / 百万 Tokens
推荐本地部署 单张 48GB 显卡(量化后)或 2*A100 4-8 卡服务器集群

输入仅需 0.8 元/M、输出 2.0 元/M 的定价,配合 0.1 元的极限制冷缓存,让企业在大规模接入智能体编排时几乎无需顾虑 Token 账单。


官方开源仓库与获取渠道

GLM-5.3 系列全量权重与部署推理脚本已在以下主流开源平台开放:

  • 官方网站:智谱开放平台 bigmodel.cn
  • Hugging Face:https://huggingface.co/THUDM/glm-5.3-flash
  • ModelScope:https://modelscope.cn/models/ZhipuAI/glm-5.3-flash
  • GitHub 官方代码库:https://github.com/THUDM/GLM-5

行业启示:轻量 MoE 的胜利

从匿名测试「牛来」的惊艳,到正式开源为 GLM-5.3-Flash,智谱走通了一条「小激活、大性能、多模态、超低价」的破局之路。

在 腾讯混元 Hy4 Preview 冲向 770B 顶尖万亿规模的同时,GLM-5.3-Flash 则在 320B/18B 的轻量级战场上立下了性价比与响应速度的新标杆。两者一重一轻,构成了 2026 年 8 月国内开源大模型最坚实的双引擎。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板