2026 年 8 月 26 日,智谱 AI 正式发布并开源了 GLM-5.3 旗舰系列模型。其中,最受开发者关注的轻量主力舰 —— GLM-5.3-Flash 正式揭开面纱。
此前在 OpenCode 与 OpenRouter 盲测排行榜上,一个代号为 ox-alpha(中文开发者社区亲切称之为「牛来」) 的神秘模型连续数周在代码生成与多模态交互榜单上位居前列。随着智谱官方公布权重,社区终于确认:ox-alpha 正是 GLM-5.3-Flash。
作为 GLM-5 家族首个原生端到端多模态架构的轻量 MoE 模型,GLM-5.3-Flash 拥有 320B 总参数、18B 激活参数,支持高达 1,000,000 Tokens(1M) 的超长上下文窗口,并在兼顾极低推理成本的同时,性能达到了与顶级闭源模型同台竞技的水平。
在国产大模型竞争进入「深水区」的 2026 年 8 月,GLM-5.3-Flash 的开源再次证明了:高密度的架构创新与极致的推理优化,可以让平民级成本迸发出旗舰级的智能表现。
核心架构拆解:混合稀疏注意力与 320B/18B MoE
GLM-5.3-Flash 在底层架构上进行了大胆的工程创新,兼顾了多模态表征与高速长序列推理:
| 架构维度 | GLM-5.2(2026.06) | GLM-5.3-Flash(2026.08.26) | 核心升级说明 |
|---|---|---|---|
| 总参数 / 激活参数 | 744B / 40B | 320B / 18B | 激活参数减少 55%,单卡吞吐量大幅跃升 |
| 模态支持 | 纯文本 + 视觉适配器 | 原生端到端多模态统一 Transformer | 视觉、图表与代码统一编码,Token 损耗降低 45% |
| 注意力机制 | 传统 Grouped-Query Attention (GQA) | 混合稀疏/线性注意力机制 (Sparse-Linear Attention) | 解决 1M 极长序列计算二次方复杂度爆炸 |
| 上下文长度 | 256K | 1M Tokens (100 万) | 支持长视频切帧与超大型代码仓库一次性输入 |
| 开源协议 | MIT 协议 | Apache-2.0 协议 | 权重全量开源,开放商业化部署与微调 |
| 盲测代号 | GLM-5.2 | ox-alpha(牛来) |
在全球盲测榜单中战平顶级旗舰 |
得益于混合稀疏与线性注意力机制,GLM-5.3-Flash 在处理 100 万 Token 级别的长输入时,首 Token 延迟(TTFT)相比前代缩短了 62%,显存占用降低了 50% 以上。
盲测战绩复盘:匿名模型 ox-alpha 到底有多强?
在正式开源前,智谱将模型匿名提交至 OpenCode 与 OpenRouter 竞技场进行双盲测试,积累了海量真实生产调用的评测数据:
| 评测基准 / 竞技场 | GLM-5.3-Flash (ox-alpha) |
腾讯混元 Hy3 正式版 | DeepSeek V4-Flash | Claude 3.7 Sonnet (参考) |
|---|---|---|---|---|
| Artificial Analysis (AA) 智能指数 | 57 分 | 52 分 | 53 分 | 56 分 |
| SWE-bench Verified | 78.6% | 74.4% | 76.2% | 70.3% |
| AIME 2026 (数学竞赛) | 79.2% | 71.0% | 78.0% | 78.5% |
| LiveBench 多模态图表解析 | 84.5 | — | 79.1 | 82.0 |
| 推理速度 (Output Tokens/s) | 145 tok/s | 95 tok/s | 130 tok/s | 80 tok/s |
数据表明,GLM-5.3-Flash 在仅激活 18B 参数的轻量配置下,不仅在代码和数学基准上全面反超前代模型,更以 145 tok/s 的极速输出吞吐成为高并发 Agent 调用的理想底座。
旗舰同步登场:GLM-5.3 全尺寸深度思考模型
除 Flash 轻量版外,智谱同期推出了主打复杂推理的重磅旗舰 GLM-5.3:
graph TD
A[用户输入复杂工程任务] --> B{GLM-5.3 深度思考引擎}
B -->|Low 档位| C[日常代码审查与文档问答]
B -->|High 档位| D[跨模块系统架构设计与重构]
B -->|Max 档位 (32K Token)| E[形式化数学证明与网络安全漏洞挖掘]
- 全场景强制思考(Thinking by Default):GLM-5.3 默认开启快慢思考融合,提供
low、high、max三种推理强度; - 网络安全攻防 SOTA:在权威网络安全基准 CyberGym 测试中,GLM-5.3 成为首个能够全自主发现并复现 0-day 内存越界漏洞的大模型;
- 编程能力暴涨 50%:在大规模跨文件工程重构任务中,代码单次通过率大幅提升。
API 定价与私有化部署实操
智谱开放平台(bigmodel.cn)与海外分发渠道已同步上线 API:
| 计费与部署维度 | GLM-5.3-Flash 官方费率 | GLM-5.3 旗舰版费率 |
|---|---|---|
| 输入价格 (Input) | 0.8 元 / 百万 Tokens | 12.0 元 / 百万 Tokens |
| 输出价格 (Output) | 2.0 元 / 百万 Tokens | 36.0 元 / 百万 Tokens |
| Prompt 缓存命中 | 0.1 元 / 百万 Tokens | 1.5 元 / 百万 Tokens |
| 推荐本地部署 | 单张 48GB 显卡(量化后)或 2*A100 | 4-8 卡服务器集群 |
输入仅需 0.8 元/M、输出 2.0 元/M 的定价,配合 0.1 元的极限制冷缓存,让企业在大规模接入智能体编排时几乎无需顾虑 Token 账单。
官方开源仓库与获取渠道
GLM-5.3 系列全量权重与部署推理脚本已在以下主流开源平台开放:
- 官方网站:智谱开放平台 bigmodel.cn
- Hugging Face:
https://huggingface.co/THUDM/glm-5.3-flash - ModelScope:
https://modelscope.cn/models/ZhipuAI/glm-5.3-flash - GitHub 官方代码库:
https://github.com/THUDM/GLM-5
行业启示:轻量 MoE 的胜利
从匿名测试「牛来」的惊艳,到正式开源为 GLM-5.3-Flash,智谱走通了一条「小激活、大性能、多模态、超低价」的破局之路。
在 腾讯混元 Hy4 Preview 冲向 770B 顶尖万亿规模的同时,GLM-5.3-Flash 则在 320B/18B 的轻量级战场上立下了性价比与响应速度的新标杆。两者一重一轻,构成了 2026 年 8 月国内开源大模型最坚实的双引擎。