Kimi K3 vs Claude Fable 5 on DeepSWE: Cost and Coding
Together AI 在 452 次 DeepSWE 运行中对比 Kimi K3 与 Claude Fable 5,Fable 在 pass@1 上领先 1.4 个百分点,Kimi K3 在 pass@4 上胜出,且每美元解决任务数是 Fable 的 2.8 倍。Kimi K3 是 2.8T 参数 MoE 模型,激活 104B 参数,支持 1M 上下文,基于 Kimi Delta Attention 和 Stable LatentMoE。华为昇腾宣布 0day 适配,支持训练和推理。
Development
- First ReportQuoting Kimi K3Simon Willison
- Industry ResponseKimi K3: The open-weights escalationInterconnects
- Industry ResponseKimi K3 vs Claude Fable 5 on DeepSWE: Cost and CodingTogether AI
- Industry ResponseKimi-K3Moonshot AI 模型发布(Hugging Face)
- Industry ResponseKimi K3: Open Frontier IntelligencearXiv cs.LG
- Industry Responsemoonshotai/Kimi-K3Simon Willison
- Industry ResponseDeploying Kimi K3 on AWSAWS Machine Learning Blog
- Industry ResponseKimi K3: The Complete Developer GuideTogether AI
- Current Assessment开源模型在编码任务上的成本效益显著,Kimi K3 每美元解决任务数是闭源模型的 2.8 倍,可能推动企业重新评估闭源 API 的性价比。华为昇腾的 0day 适配表明国产硬件生态对开源模型的快速支持,可能加速主权 AI 和本地化部署。Agent Pulse · analysis
Together AI 发布了对 Kimi K3 和 Claude Fable 5 在 DeepSWE 基准上的对比评测。在 452 次运行中,Fable 在 pass@1 上领先 1.4 个百分点,而 Kimi K3 在 pass@4 上胜出,并且每美元解决的任务数是 Fable 的 2.8 倍。Kimi K3 是月之暗面开源的 2.8T 参数 MoE 模型,激活 104B 参数,支持 1M 上下文,采用 Kimi Delta Attention 和 Stable LatentMoE 等创新。华为昇腾宣布 0day 适配,支持训练和推理。这些进展表明开源模型在成本效益和性能上正快速逼近闭源模型。
Kimi K3 的架构创新包括 Kimi Delta Attention 和 Attention Residuals,改善长序列信息流;Stable LatentMoE 激活 16/896 专家,提升扩展效率约 2.5 倍。其 2.8T 参数规模与 104B 激活参数表明稀疏激活是降低推理成本的关键。在 DeepSWE 上,Kimi K3 的 pass@4 优势暗示其采样多样性或探索能力更强,而 Fable 的 pass@1 优势可能来自更好的单次生成质量。
开源模型在编码任务上的成本效益显著,Kimi K3 每美元解决任务数是闭源模型的 2.8 倍,可能推动企业重新评估闭源 API 的性价比。华为昇腾的 0day 适配表明国产硬件生态对开源模型的快速支持,可能加速主权 AI 和本地化部署。
对于依赖编码助手的团队,Kimi K3 的成本优势可能降低推理预算,但需权衡 pass@1 的差距。开源模型的可定制性和本地部署能力可能吸引对数据隐私敏感的企业。华为昇腾的适配为国内企业提供了国产化选项。
后续可关注 Kimi K3 在更长上下文和 agentic 任务上的表现,以及其开源生态的采用情况。华为昇腾的适配可能促进国产芯片上的推理部署,未来可观察其性能与成本数据。