跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.07.23 · 8 min

MiniCPM5-1B 发布:1B 参数碾压 Qwen3.5-2B,INT4 仅 0.5GB,清华团队做的

OpenBMB 发布 MiniCPM5-1B,1B 稠密 Transformer。Artificial Analysis 小模型榜第 1(17.9 分),超越 Qwen3.5-2B(16.3 分)。INT4 量化仅 0.5GB,支持双模式推理切换。

前沿动态

2026 年 5 月 25 日,OpenBMB(清华系团队)发布了 MiniCPM5-1B——1.08B 参数的稠密 Transformer。

1B 这个规模放在 2026 年听起来不大。但它的成绩单不像是 1B 该有的:Artificial Analysis 小模型榜单排名第一(17.9 分),超过了 Qwen3.5-2B 的 16.3 分。 INT4 量化后权重只有 0.5GB。手机、树莓派、十年前的老笔记本都能跑。

这是 MiniCPM 系列的第五代了。OpenBMB 从 MiniCPM-2B(2024 年 2 月)开始,一直在做一件事:把小模型做聪明。到 MiniCPM5-1B,这件事已经做得相当好了。

它在小模型里强在哪

在同一尺寸范围的对比中,MiniCPM5-1B 的优势最明显的在三个维度:

  • Agentic 工具调用——小模型通常在这个维度上很弱,调用外部工具时经常输出格式错误或乱填参数,但 MiniCPM5-1B 在这块反而表现最好
  • 代码生成——超过 Qwen3.5-2B 和 LFM2.5-1.2B-Thinking
  • 高难推理——和 Qwen3.5-2B 相当,超过其他同尺寸模型

这三个维度恰恰是小型端侧模型通常最薄弱的环节。能把它们做成优势,说明训练方法和数据质量确实有东西。

怎么做到的:UltraData + OPD

MiniCPM5-1B 在架构上没有创新——它就是标准的稠密 Transformer。创新在训练方法。

OpenBMB 自研了一套叫 UltraData 的分级数据管理体系。粗看像营销词汇,细看其实挺扎实:他们把训练数据分成多个层级(L0-L4),每个层级负责不同的能力——底层基础语料建语言能力,高层 SFT 数据教推理和工具调用。

训练流程分三个阶段:

  1. Base Training——稳定训练 + 衰减训练,建核心语言能力
  2. Mid-Training——强化目标能力,适配分布
  3. Post-Training(SFT → RL → OPD)

OPD(On-Policy Distillation)是整个流程里最有意思的部分。不是用一个教师模型蒸馏——而是为数学、代码、闭卷问答、写作等领域分别训练专用的 RL 教师,然后把多个教师的知识蒸馏回一个模型。

效果:数学、代码和指令遵循任务上平均分提升 +16 分,因 token 预算耗尽而过长的回复占比下降了 29 个百分点。

训练数据也全部随模型开源:Ultra-FineWeb、Ultra-FineWeb-L3、UltraData-Math、UltraData-SFT-2605(1500 万样本)。如果你在做自己的小模型训练,这些数据集本身就是有价值的资源。

双模式推理:一份权重两种用法

和 Qwen3.5、DeepSeek-R1 系列一样,MiniCPM5-1B 支持思考/非思考模式切换,通过 enable_thinking 参数控制:

  • 非思考模式:快速响应,适合日常对话、简单问答
  • 思考模式:生成推理链,适合数学、代码、逻辑推理

能在 1B 参数规模下维持有质量的深度推理,是技术上最值得一提的突破。小模型做推理通常输出质量不稳定——有时候能推理出正确答案,有时候在简单问题上也会翻车。MiniCPM5-1B 在这个尺寸上做得相对可靠,虽然不是每次都准,但比同尺寸的其他模型稳定的多。

与其他 1B 级模型的简单对比

模型 参数量 内存(Q4) 推理模式 工具调用
MiniCPM5-1B 1.08B ~0.7GB 双模式
Qwen3.5-0.8B 0.8B ~0.5GB
LFM2.5-1.2B 1.2B <1GB 单模式
Gemma 3 2B 2B ~1.7GB

MiniCPM5-1B 在 1B 级别是综合最强的,但如果你能接受略大一点的体积(2B、3B),Phi-4 Mini 或 Gemma 3 2B 在某些任务上表现可能更好。选择取决于你的硬件极限在哪里。

本地部署

INT4 量化后 0.5GB。你不需要 GPU,不需要大内存,不需要云计算。

官方提供了面向 vLLM、SGLang、Transformers 的 inference cookbook,以及 LLaMA-Factory、MS-Swift、Unsloth、XTuner 的微调教程。

FlagOS(智源研究院主导的多芯片适配平台)已经完成了在以下芯片上的适配:NVIDIA、Hygon、Metax、Iluvatar、Ascend、ARM-v9。这意味着你可以在国产芯片服务器上跑 MiniCPM5-1B。

OpenBMB 还附带做了一个桌宠应用——一个由 MiniCPM5-1B 本地驱动的桌面宠物,在桌面上跑来跑去,可以直接对话。看起来像玩具,但实际上是端侧部署的一个很好的 Demo:1B 模型跑在本机,不需要联网,不需要 GPU,普通电脑就能跑。对于想向非技术 audience 展示"本地 AI 能做什么"的人来说,这个桌宠比 benchmark 数字有说服力得多。

一句话

MiniCPM5-1B 的意义不在于参数规模——1B 在这个时代不算大——而在于它证明了 1B 参数的模型也能做好推理和工具调用,并且有完整的数据体系和方法论支撑。

对于需要本地部署、隐私保护、低成本推理的场景——手机应用、IoT 设备、边缘计算——它是目前最好的选择之一。INT4 0.5GB 的体量意味着它可以在几乎任何现代设备上运行。

当然,1B 模型的推理质量上限是客观存在的。它适合处理结构清晰、范围明确的任务。如果你需要复杂的长文档分析或多步 Agent 流程,还是需要更大的模型。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板