跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.07.02 · 16 min

美团 LongCat 2.0 深度复盘:5 万张国产卡训练万亿 MoE,Cache 命中免费重塑 API 经济

美团 LongCat 2.0 是国内首个完全依靠国产算力完成训练与推理全流程的万亿参数模型。1.6T MoE 架构,每 token 激活约 480 亿参数,性能接近 Opus 4.6。Cache 命中免费策略让 Token 消耗速度远低于同尺寸模型,5 万张国产卡训练规模创历史纪录。

前沿动态

6 月 30 日,美团正式公布 LongCat-2.0 的技术细节。这匹此前以"Owl Alpha"之名霸榜 OpenRouter 全球调用量前三的"黑马",终于揭开了神秘面纱。

LongCat-2.0 的特殊之处不只是性能——它是国内首个完全依靠国产算力完成训练与推理全流程的万亿参数模型。预训练在 5 万多张国产算力芯片上完成,使用超过 35 万亿 Tokens。从第一个 Token 到最后一个 Token,没有任何海外 GPU 参与。

当行业共识是"国产卡只能做推理,训练必须用 H100",LongCat-2.0 用 5 万张国产卡把这个共识打碎了。

规格速览

维度 LongCat-2.0
总参数 1.6 万亿(MoE)
每 Token 激活参数 ~480 亿
架构 混合专家(MoE)
训练算力 5 万+ 张国产 AI 芯片
训练数据量 35 万亿+ Tokens
上下文 未公开(推测 256K+)
定位 Agent + 代码 + 通用推理

总参数量 1.6T,但每个 Token 仅激活约 480 亿——这是 MoE 架构的核心优势:大知识容量 + 低推理成本并存。在同赛道上,DeepSeek V4 也是 1.6T MoE,但训练依赖 H100/V100 集群。

性能定位:接近 Opus 4.6 的 Coding/Agent 能力

根据美团技术博客披露的官方基准测试和第三方实测反馈:

维度 表现
AI Coding 接近或超越 Opus 4.6
Agent 任务 接近或超越 Opus 4.6
综合推理 第一梯队(国内)
编程工具适配 Claude Code / OpenClaw 调用量前三

Opus 4.6(2026 年 2 月发布)被视为 AI Coding 和 Agent 领域的生产力标杆——能连续自动写两三个小时代码几乎不出错。LongCat-2.0 在 Coding 和 Agent 能力上接近这个水平,意味着它已经从"追平"走向"并跑"。

但 LongCat-2.0 的差异化不在能力本身,而在训练路径的不可替代性

国产算力训练:三年的"头铁"实验

LongCat 团队的国产算力探索始于 2023 年上半年。彼时正值 ChatGPT 发布后国内 AI 团队疯狂抢购算力,A100 一卡难求。

团队内部起初只是"随口一提":能不能用国产算力做大模型训练?这个想法越想越并非不可能。

为什么"不可能"

2023 年的行业共识:

  • 国产卡"可以干,但不经济"
  • 训练周期是 GPU 的 150% 以上
  • 算力成本高一倍以上
  • 适配成本更高
  • 只能训千亿、百亿参数的中小模型

国内科技公司普遍用国产芯片做推理,拿省下来的英伟达 GPU 做训练。几乎所有万亿参数模型都是用 H100/H80 训出来的。

LongCat 团队的解法

LongCat 团队的核心判断是:大模型训练不是玄学,也不是黑盒,它只是一个复杂度极高的科学系统工程。

关键洞察:大模型算子个数相对有限,适配工作量比想象中更聚焦。CUDA 生态的壁垒建立在通用性和丰富性上,但如果目标收敛到大模型训练,这个壁垒并没有看上去那么不可逾越。

工程挑战 解法
算子适配 聚焦有限的大模型核心算子,逐一对标
精度问题 硬件精度保证 + 混合精度策略
路由崩溃 动态温度系数调整 + 专家冻结策略
训练稳定性 梯度累积 + 选择性 FP32

最终,LongCat-2.0 用 2023 下半年量产的某款主流国产 AI 芯片训练出来——甚至没用到 2025-2026 年量产的最新型号芯片。

Cache 命中免费: Token 经济学的新玩法

相比训练路径的"硬实力",LongCat-2.0 在商业模式上的创新同样值得关注:

Cache 命中免费——当用户的请求命中 KV 缓存时,Token 不收费或不消耗套餐额度。

这意味着什么?对于长上下文、高重复率的 Agent 任务(代码库分析、文档问答、多轮对话),实际的 Token 消耗速度远低于同尺寸模型。

场景 Token 消耗对比
首次长上下文请求 与同类模型相当
后续重复上下文请求 远低于同类模型(Cache 命中)
Agent 多步任务 远低于同类模型(上下文复用)

这一策略的威力在于:对于重度 Agent 用户(每天处理大量代码和文档的开发者),LongCat-2.0 的实际使用成本可能只有标价的一半甚至更低。

商业表现:全球调用量前三的"黑马"

在正式发布之前,LongCat-2.0 以"Owl Alpha"之名已经在 OpenRouter 平台上积累了大量用户:

平台 排名
OpenRouter Hermes 调用 第一
OpenRouter Claude Code 调用 第二
OpenRouter OpenClaw 调用 第三

开发者将其称为"今年最令人意外的一匹黑马"。这个"意外"不在于模型本身的能力,而在于这些用户不知道这竟然是一个完全用国产算力训出来的模型。

竞品定位

维度 LongCat-2.0 DeepSeek V4 Qwen 3.8 Max
参数 1.6T/480亿激活 1.6T/49亿激活 2.4T
训练算力 国产芯片 英伟达 GPU 未公开
开源 部分(调用量优先) Apache 2.0 不开源
商业模式 Cache 命中免费 API 按量 云端 Only
调用量 全球前三 极高

LongCat-2.0 的独特性在于:国产算力训练 + Cache 命中免费 + Agent 场景优先。它的竞争优势不是"能力最强",而是"在特定路径上无可替代"。

战略意义

1. 国产算力的里程碑。 LongCat-2.0 证明了国产芯片不仅能做推理,还能训练万亿参数的世界级模型。这对国产 AI 芯片产业的发展有巨大的示范效应。

2. MoE + Cache 免费的组合。 激活参数少意味着推理成本低,Cache 免费进一步降低实际使用成本。对于高并发、高频次的 Agent 开发者,这可能是目前性价比最高的万亿参数模型。

3. 从"能力证明"到"商业落地"。 全球调用量前三不是靠评测分数,而是靠开发者的真实选择。LongCat-2.0 的商业验证比任何 benchmark 都有说服力。

LongCat-2.0 的真正意义,不在于它是否在所有榜单上排第一,而在于它证明了:用国产算力训出来的模型,可以在全球开发者的真实选择中排第一。这是中国 AI 基础设施的一次能力宣言。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板