2026 年 6 月,一家叫 Empero AI 的独立研究机构发布了 Qwythos-9B。如果只看 benchmark 数字,它是一个不错的 9B 推理模型——MMLU 比 Qwen3.5-9B 高出 34 分,gsm8k 高 30 分,Apache 2.0 开源,Q4 量化 5.5GB。
但让它成为行业话题的不是跑分,而是 Empero AI 在模型卡里白纸黑字写的那句话:
"This model was trained on over 500 million tokens of output from Claude Mythos and Claude Fable."
这是第一个公开承认用闭源旗舰模型输出蒸馏的开源模型,而且明确违反了 Anthropic 的服务条款。
它到底怎么样
Qwythos-9B 基于 Qwen3.5-9B 做全参数后训练,9.4B 参数。
| 维度 | Qwythos-9B |
|---|---|
| 基础 | Qwen3.5-9B 全参数后训练 |
| 参数量 | 9.4B |
| 上下文 | 1,048,576 token(YaRN rope-scaling,非原生) |
| 推理 | thinking block 模式,类似 DeepSeek-R1 |
| 函数调用 | 原生支持,兼容 Qwen3.5 规范 |
| 许可证 | Apache 2.0 |
| 审查 | 无审查(uncensored) |
| 训练数据 | 5 亿 token Claude 输出 + rethink 工具思维链数据 |
基准提升确实明显,但需要注意几个问题:
提升主要来自蒸馏,不是架构创新。 这就像你把学霸的作业抄了一遍再优化排版——成绩当然会提高,但提升的归属是个问题。
公布的基准范围有限。 Empero AI 给出了 MMLU 和 gsm8k 两个经典基准,但没有提供 HumanEval、MBPP、MT-Bench 等更全面的评估。一个声称推理能力大幅提升的模型,只在两个基准上有数据,说服力有限。
和旗舰模型对比没意义。 有些媒体报道把它和 Claude Opus 4.8 比——9B 和旗舰级模型不在一个赛道上。它的真正对标对象是同级别的开源推理模型:Qwen3.5-9B、DeepSeek-R1-Distill-Qwen-7B。在这些对比中,Qwythos 的优势是可信的。
争议的核心:蒸馏的伦理边界
Anthropic 的服务条款明确写着:用户不得将 Claude 的输出用于训练竞品模型。Empero AI 不仅用了,还公开承认了,还以 Apache 2.0 许可发布了。这在法律上是否构成违规目前没有定论,但在行业里已经吵翻了。
支持方的逻辑:蒸馏是技术,不是偷窃。用一个模型的输出训练另一个模型,在技术上属于知识迁移,类似于人类学习优秀范例后写出自己的文章。而且 Anthropic 的条款太宽泛——如果严格执行,"不得用 Claude 输出训练竞品"意味着所有用 Claude 写代码、写文章的用户都在技术上违规,这显然不合理。
反对方的逻辑:条款是合同,违反合同就是违约。Anthropic 投入数十亿美元训练 Claude,Empero AI 用它的输出白嫖一个竞品,还不藏着掖着。如果人人蒸馏,谁还做原创模型?闭源厂商会收紧 API 限制,最终伤害整个生态。
我的看法:这场争议的本质不是"Qwythos-9B 好不好用",而是"开源生态的边界在哪里"。两边的逻辑都站得住,所以这事才拧巴。这不是一个简单的"对错"问题,而是行业规则还在演进中的信号。
本地部署方案
Qwythos-9B 的部署门槛确实低,这也是它受到关注的原因之一。
量化方案与显存需求
| 量化 | 体积 | 显存需求 |
|---|---|---|
| Q4_K_M | ~5.5 GB | 5-6 GB(推荐) |
| Q5_K_M | ~6.5 GB | 7-8 GB |
| Q8_0 | ~9 GB | 10-11 GB |
| FP16 | ~18 GB | 20+ GB |
一张 RTX 3060(12GB)跑 Q5 量化版,一张 RTX 4050(6GB)跑 Q4 版。推荐用 LM Studio,在应用内搜索 Qwythos-9B 量化版,点击下载就能跑,不需要手动配置。
1M 上下文:理论值 vs 实际
Qwythos-9B 声称支持 1M token 上下文,但在消费级硬件上:
| 硬件 | 实际可用的上下文 |
|---|---|
| 8GB VRAM(Q4) | 16K-32K token |
| 12GB VRAM(Q5) | 32K-64K token |
| 24GB VRAM(Q8) | 64K-128K token |
YaRN rope-scaling 通过数学变换扩展了上下文窗口,但扩展后的注意力机制在长文本上的质量会下降。1M 上下文需要 A100 80GB 级别的硬件才能实际验证。对绝大多数用户,16K-128K 是实际可用范围,这个范围已经覆盖了大多数日常任务。
推荐工具
| 工具 | 适合人群 |
|---|---|
| LM Studio | 非技术用户,GUI 一键加载 |
| llama.cpp | 开发者,命令行灵活配置 |
| Ollama | 快速体验,自动量化 |
与同类模型对比
| 维度 | Qwythos-9B | DeepSeek-R1-Distill-Qwen-7B | Qwen3.5-9B |
|---|---|---|---|
| 上下文窗口 | 1M(理论) | 128K | 128K |
| 函数调用 | 原生支持 | 不支持 | 原生支持 |
| 审查 | 无审查 | 有审查 | 有审查 |
| 许可证 | Apache 2.0 | MIT | Apache 2.0 |
| 部署门槛 | 5-6GB(Q4) | 4-5GB(Q4) | 5-6GB(Q4) |
Qwythos-9B 的差异化优势是 1M 上下文(理论值)+ 无审查 + 原生函数调用,这个组合在同级别中不多见。如果你需要本地跑一个无审查的、支持函数调用的推理模型,它确实是最方便的选择。
但如果你更看重推理质量的稳定性,DeepSeek-R1-Distill-Qwen-7B 可能更靠谱——它的蒸馏来源是 DeepSeek 自家的 R1 模型,不涉及跨厂商条款争议。
蒸馏的法律趋势
Qwythos-9B 不是第一个蒸馏争议。2024-2025 年间已有多个类似案例,趋势很清楚:闭源厂商正在通过条款和 API 限制逐步收紧蒸馏空间。未来用闭源模型输出训练开源模型,法律风险会越来越大。
对开发者来说,更安全的路径是:用开源模型输出训练开源模型(没有条款问题),或者用自研数据训练。Empero AI 自研的 rethink 工具生成的思维链数据本身就是合法的——问题只在于 Claude 输出那部分。
该用还是不该用
如果你是一个本地部署爱好者,Qwythos-9B 值得试试。 9B 参数、Q4 量化 5GB VRAM、思维链推理、原生函数调用。LM Studio 点两下就能跑。
如果你关注行业伦理,Qwythos-9B 是一个标志性事件。 不管站在哪边,这件事都会影响未来开源 AI 生态的规则制定。
如果你是企业用户,谨慎评估法律风险。 Apache 2.0 允许商用,但训练数据来源可能在未来引发法律纠纷。概率不高,但不能忽略。
- 模型卡:huggingface.co/empero/qwythos-9b
- Empero AI 官网:empero.ai
- Anthropic 服务条款:anthropic.com/terms