开源模型 Kimi K3 与闭源 Fable 5 对比测试:多数任务开源模型够用,路由层成护城河
2026/7/23 6:52:45 网站建设 项目流程

【导语:此前有分析讨论 Anthropic 的 Fable 5 比开源模型贵三倍的商业模式能否撑住,如今 AI 推理平台 Fireworks AI 给出硬数据,对 Kimi K3 和 Fable 5 进行对照测试,得出了一系列有价值的结论。】


开源与闭源模型测试结果差距小

AI 推理平台 Fireworks AI 跑了 1030 个真实 agent 任务,将 Kimi K3(Moonshot 的开源模型)和 Fable 5 放在同一 harness 里对照测试。在 SWE - bench 类任务上,K3 拿到 92.4%,Fable 拿到 92.6%,差距不到 0.3 个百分点。但在长 agentic 循环里,K3 的成本能做到 Fable 的五十分之一。

多类型任务测试凸显模型强项

这 1030 个任务分为五类,包括 SWE 类真实仓库 bug 修复(460 题)、终端运维类长链路操作、算法题、六语言交叉实现、法律 agent 任务,且每个任务都是完整 agent 循环,并非单次推理。

两个模型各有优势,K3 在符号数学和开发工具链上更强,在终端任务里拿到 11 个 solo win(Fable 为 7 个),在安全加密类集群里表现突出。Fable 在 Web 和数据可视化上更好,在 Java、Python、C++ 方面领先于 K3,但 JavaScript 和 Rust 表现基本持平。

路由选择让模型组合效果更佳

Fireworks 做了一个 oracle router,每次任务选择更便宜的正确模型,结果通过率达 93%,高于任何一个单模型。K3 被选中了 72 - 96% 的任务,这表明大多数时候开源模型就足以胜任任务。

Prompt caching 使 K3 成本更低

K3 的 token 量更大(SWE 平均 55 轮、130 万 token,而 Fable 是 21 轮、13 万 token),但成本反而低,原因在于 Prompt caching。K3 虽轮数多、token 多,但命中的基本都是缓存,实际推理成本极低。而 Fable 在终端任务里容易陷入循环,64 轮、150 万 token,还经常超时,成本翻了十倍不止。

开源趋势下闭源模型压力增大

Fireworks 认为「单一模型既浪费,也不再是最佳方案」,建议把 K3 作为默认底座,多数任务用开源模型即可,少数复杂场景再选用 Fable 级别的闭源模型,路由层才是关键竞争力。

值得注意的是,Fireworks 是推理平台,没有站队动力。且 Moonshot 上周宣布 K3 会开源权重,这会让闭源模型面临更大的价格压力。

编辑观点:此次测试显示开源模型 K3 在性能和成本上优势明显,开源趋势下闭源模型需调整策略,路由层技术将成竞争焦点。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询