Kimi Cookbook

This chapter is available in Chinese only. The content below has not been translated.

03 / 第三章

挑模型 · K3、K2.7-Code 与 K2.6.

输入框那个模型名, 我自己也很久没换过 —— 直到 K3 来了: 2.8 万亿参数、1M 上下文, 思考再也关不掉。这章我把三颗在列的脑子摆上解剖台, 四件典型活一笔一笔算账: 哪件配哪颗、为什么、大概多少钱。

MD海报

输入框那个模型名, 我自己也很久没点开换过。多数时候确实不用换 —— Kimi 默认就给你当前最强那颗脑子。但 2026 年 7 月 16 日之后, 那颗脑子换了: K3 发布, 旗舰易主。 这章不做参数党。先花两分钟认清三颗在列的脑子各管哪段 —— 然后我把四个典型任务放上解剖台, 一笔一笔算出各自该用哪颗、花多少钱。读完你应该能对任何一件活, 说出「它配哪颗、为什么、大概多少钱」。

I

三颗在列的脑子, 各管一段.

重活归 kimi-k3: 2.8 万亿参数 MoE、1M 上下文、思考永远开(顶层 reasoning_effort 目前只有 max 一档, 关不掉)—— 长链路编码、百万 token 长料、反复推的知识工作归它, 它也最贵。1注 1Kimi K3 官方博客(2026-07-16)—— 2.8 万亿参数 MoE(896 专家、每 token 激活 16)、1M token 上下文、原生视觉;思考固定 max 档,low / high 档后续上线;「full model weights will be released by July 27, 2026」,协议随技术报告公布;自评整体仍「trails the most powerful proprietary models」(点名 Claude Fable 5 与 GPT 5.6 Sol),Limitations 承认用户体验有明显差距、可能替用户做意料外的决定;建议 64 张以上加速卡部署;编码负载缓存命中率超九成(厂商口径)。激活参数量官方未公布。6注 6Kimi 开放平台 · API 总览 —— 思考经 SDK 的 extra_body 传 thinking 参数:kimi-k2.6 可选关闭,kimi-k2.7-code 恒为 enabled(传 disabled 报错);kimi-k3 不使用 thinking 参数,走顶层 reasoning_effort(当前仅 max 一档)。截至 2026-07-17。编码专线归 kimi-k2.7-code: 1 万亿参数、256K, 思考强制开启; 高速变体 kimi-k2.7-code-highspeed 输出约 180 tokens/s、价格翻倍, 适合交互式结对。2注 2Kimi 开放平台 · 模型列表 —— kimi-k3 为「迄今能力最强的模型」;kimi-k2.7-code-highspeed 输出约 180 tokens/s(短上下文可达 260);kimi-k2 全系 2026-05-25 已下线;kimi-k2.5 与 moonshot-v1 系列停止向新用户开放,2026-08-31 全平台下线。截至 2026-07-17。5注 5Hugging Face · moonshotai/Kimi-K2.7-Code 模型卡 —— 1 万亿参数 MoE、激活约 320 亿,256K 上下文,仅思考模式(不可关闭),权重 Modified MIT 开源。Kimi-K2.6 卡同规模同协议、思考可选。截至 2026-07-17,moonshotai org 下无任何 K3 权重。日常归 kimi-k2.6: 同样 256K、多模态, 思考可选可关, 还能走 Batch 批量(六折)—— K3 反而不在 Batch 内。3注 3Kimi 开放平台 · 定价(chat-k3 及 chat-k27-code / chat-k26 / chat-k25 同路径各页)—— 每百万 token(缓存命中 / 缓存未命中输入 / 输出):kimi-k3 ¥2.00 / ¥20.00 / ¥100.00,国际站 $0.30 / $3.00 / $15.00;kimi-k2.7-code ¥1.30 / ¥6.50 / ¥27.00,高速版 ¥2.60 / ¥13.00 / ¥54.00;kimi-k2.6 ¥1.10 / ¥6.50 / ¥27.00;kimi-k2.5 ¥0.70 / ¥4.00 / ¥21.00。截至 2026-07-17。4注 4Kimi 开放平台 · Batch API 定价 —— 批量为标准价六折,仅支持 kimi-k2.7-code / kimi-k2.6 / kimi-k2.5;kimi-k3 不在 Batch 内。截至 2026-07-17。至于 kimi-k2.5: 新用户已经用不了, 老用户也只能用到 2026 年 8 月 31 日, 别把新活再绑上去。2注 2Kimi 开放平台 · 模型列表 —— kimi-k3 为「迄今能力最强的模型」;kimi-k2.7-code-highspeed 输出约 180 tokens/s(短上下文可达 260);kimi-k2 全系 2026-05-25 已下线;kimi-k2.5 与 moonshot-v1 系列停止向新用户开放,2026-08-31 全平台下线。截至 2026-07-17。 K2.6 时代, 我给的原则是「活简单就关思考」。这个开关在 K2.6 上还在, 写法没变:
from openai import OpenAI
 
client = OpenAI(api_key="YOUR_KIMI_API_KEY",
                base_url="https://api.moonshot.cn/v1")  # 与 OpenAI 兼容
 
resp = client.chat.completions.create(
    model="kimi-k2.6",
    messages=[{"role": "user", "content": "把这段会议纪要按议题归类, 列出待办"}],
    extra_body={"thinking": {"type": "disabled"}},  # 关思考: 活简单、要秒回时
)
print(resp.choices[0].message.content)

关掉思考的最小调用(仅 kimi-k2.6 支持;K3 与 K2.7-Code 的思考关不掉, 传 disabled 会报错)

「开源」这一条顺带说清。K2 系列的权重早就挂在 Hugging Face 上(Modified MIT, 可下载、可商用); K3 官方自称「全球首个开放 3T 级模型」, 但截至 2026-07-17 权重还没放出 —— 官方承诺 7 月 27 日前发布。1注 1Kimi K3 官方博客(2026-07-16)—— 2.8 万亿参数 MoE(896 专家、每 token 激活 16)、1M token 上下文、原生视觉;思考固定 max 档,low / high 档后续上线;「full model weights will be released by July 27, 2026」,协议随技术报告公布;自评整体仍「trails the most powerful proprietary models」(点名 Claude Fable 5 与 GPT 5.6 Sol),Limitations 承认用户体验有明显差距、可能替用户做意料外的决定;建议 64 张以上加速卡部署;编码负载缓存命中率超九成(厂商口径)。激活参数量官方未公布。5注 5Hugging Face · moonshotai/Kimi-K2.7-Code 模型卡 —— 1 万亿参数 MoE、激活约 320 亿,256K 上下文,仅思考模式(不可关闭),权重 Modified MIT 开源。Kimi-K2.6 卡同规模同协议、思考可选。截至 2026-07-17,moonshotai org 下无任何 K3 权重。承诺不是现货: 现在就要数据不出门的读者, 能搬回家的仍是 K2.6 和 K2.7-Code。何况官方建议的部署配置是 64 张以上加速卡 —— 这颗脑子本来也不是给一张消费级显卡准备的。1注 1Kimi K3 官方博客(2026-07-16)—— 2.8 万亿参数 MoE(896 专家、每 token 激活 16)、1M token 上下文、原生视觉;思考固定 max 档,low / high 档后续上线;「full model weights will be released by July 27, 2026」,协议随技术报告公布;自评整体仍「trails the most powerful proprietary models」(点名 Claude Fable 5 与 GPT 5.6 Sol),Limitations 承认用户体验有明显差距、可能替用户做意料外的决定;建议 64 张以上加速卡部署;编码负载缓存命中率超九成(厂商口径)。激活参数量官方未公布。

II

我把四件典型活放上解剖台.

下面四个任务, 我把 token 画像全摆出来, 价格用开放平台标准价逐笔算(每百万: K3 输入 ¥20 / 命中 ¥2 / 输出 ¥100;K2.7-Code 与 K2.6 输入 ¥6.5 / 命中 ¥1.1–1.3 / 输出 ¥27;高速版输入 ¥13 / 输出 ¥54)。3注 3Kimi 开放平台 · 定价(chat-k3 及 chat-k27-code / chat-k26 / chat-k25 同路径各页)—— 每百万 token(缓存命中 / 缓存未命中输入 / 输出):kimi-k3 ¥2.00 / ¥20.00 / ¥100.00,国际站 $0.30 / $3.00 / $15.00;kimi-k2.7-code ¥1.30 / ¥6.50 / ¥27.00,高速版 ¥2.60 / ¥13.00 / ¥54.00;kimi-k2.6 ¥1.10 / ¥6.50 / ¥27.00;kimi-k2.5 ¥0.70 / ¥4.00 / ¥21.00。截至 2026-07-17。你自己任务的账, 照这个格式套就行。

#任务一 · 通读 300 页 PDF, 出一份结构化纪要.

画像: 300 页中文约 20 万 token 输入, 纪要约 3 千 token 输出, 一次过。K3: 输入 20×0.2 + 输出 100×0.003 ≈ ¥4.3(追问时前缀走缓存, 再砍到 ¥0.7)。K2.6 / K2.7-Code: 6.5×0.2 + 27×0.003 ≈ ¥1.4 差价三倍, 但别急着选便宜的: 256K 的两颗塞 200K 材料只剩一成的余量, 提示词和输出再一挤, 要么砍料要么分段 —— 分段丢的是「贯穿三百页的主线」这类全局判断。我的结论很直接: 10 万 token 以内的料, K2.6 上;逼近或超过 20 万, 这 ¥3 是买「一次吃完不丢全局」, 值。

#任务二 · 编码 agent 跑一个跨 10 文件的功能改动.

画像: agent 长链路, 20 轮迭代, 每轮平均 3 万 token 输入(仓库上下文, 前缀大量重复 —— 厂商称编码负载缓存命中率超九成, 按九成算)、2 千输出。合计输入 60 万(54 万命中 + 6 万未命中)、输出 4 万。1注 1Kimi K3 官方博客(2026-07-16)—— 2.8 万亿参数 MoE(896 专家、每 token 激活 16)、1M token 上下文、原生视觉;思考固定 max 档,low / high 档后续上线;「full model weights will be released by July 27, 2026」,协议随技术报告公布;自评整体仍「trails the most powerful proprietary models」(点名 Claude Fable 5 与 GPT 5.6 Sol),Limitations 承认用户体验有明显差距、可能替用户做意料外的决定;建议 64 张以上加速卡部署;编码负载缓存命中率超九成(厂商口径)。激活参数量官方未公布。按百万 token 计: K3: 0.06×20 + 0.54×2 + 0.04×100 ≈ ¥6.3;K2.7-Code: 0.06×6.5 + 0.54×1.3 + 0.04×27 ≈ ¥2.2;高速版同口径约 ¥4.3。 单看标价 K3 贵三倍, 但编码活要算的是「做对一次的成本」。独立 DeepSWE 榜(统一 harness): K3 修复率 69%, K2.7-Code 31% —— 把币值除以修复率, K3 约 ¥9 一次成功, K2.7-Code 约 ¥7。7注 7DeepSWE 官方榜单(页面标注更新于 2026-07-17,113 个任务、16 个模型,统一 mini-swe-agent harness)—— kimi-k3[max] 69%±5%,第 4(榜首 gpt-5.6-sol[max] 73%±3%,单任务成本 $4.65 为前五中第二低);kimi-k2.7-code 31%±1%,第 14。独立第三方实测,这是独立榜首个收录 K3 的成绩。差距远没有标价悬殊, 而且还没算你盯着返工的时间。我的结论: 日常小改 K2.7-Code;一改错就要重来好几轮的难活, K3 买的是「一次过」。赶时间的结对场景换高速版 —— 翻倍的价格买的是你不等, 后台任务别碰它。

#任务三 · 一千条评论打标签(批量、可等).

画像: 每条 500 输入 + 50 输出, 共 50 万输入、5 万输出, 走 Batch 六折(仅 K2.7-Code / K2.6 / K2.5)。4注 4Kimi 开放平台 · Batch API 定价 —— 批量为标准价六折,仅支持 kimi-k2.7-code / kimi-k2.6 / kimi-k2.5;kimi-k3 不在 Batch 内。截至 2026-07-17。K2.6 Batch: (6.5×0.5 + 27×0.05) × 0.6 ≈ ¥2.8, 单条不到 0.3 分钱。K3 不在 Batch 内, 标准价跑这批要 ¥15 —— 五倍多的钱, 买的是根本不会用的旗舰推理。 打标签这种「答错一眼能看出来」的活, 顺手把 K2.6 的思考也关了, 又快又便宜。我的结论: 能批量的活永远先想 Batch + K2.6, 这是整张价目表上性价比最高的一格。

#任务四 · 日常问答与文档小修(高频、零碎).

画像: 每次 2 千输入 + 5 百输出, 一天几十次。这种量级下三颗模型的单答成本都在一分钱上下 —— 价格在这里根本不构成决策变量。我的结论: 日常零碎活, 默认 K2.6 关思考;只有答案质量连续几次不满意, 才把这一类活升档。升档的触发器是「连续不满意」, 不是「万一这次难呢」。 我把四个任务收成一张表, 下次对着活直接找行:
你的活用哪颗单次成本量级一句话边界
10 万 token 内的摘要 / 翻译 / 归类kimi-k2.6(关思考)几毛答错一眼能看出的活, 不配旗舰
20 万 token 级长料一次吃完kimi-k3几元分段会丢全局判断的活
编码 agent · 日常小改kimi-k2.7-code几元修复率 31% 档, 简单活够使
编码 agent · 难活一次过kimi-k3~¥6「做对一次的成本」反而接近
交互结对 · 赶时间k2.7-code-highspeed翻倍买的是人不等, 后台别用
批量千级条目的处理kimi-k2.6 · Batch单条几厘六折, 性价比最高的一格

III

价格与跑分, 都分两摞看.

解剖台之外, 还有两条宏观线要拎清: 标价说明它把自己摆在哪; 而跑分, 你得先分成两摞, 再决定信不信。 先看价格。两年前 K2.5 卖 ¥4 / ¥21 的那个 Kimi 已经走远了: 从 K2.6 涨价六成, 到 K3 直接定在 frontier 价位(国际站 $3 / $15)—— 它要抢的从来不是「便宜」那张货架。3注 3Kimi 开放平台 · 定价(chat-k3 及 chat-k27-code / chat-k26 / chat-k25 同路径各页)—— 每百万 token(缓存命中 / 缓存未命中输入 / 输出):kimi-k3 ¥2.00 / ¥20.00 / ¥100.00,国际站 $0.30 / $3.00 / $15.00;kimi-k2.7-code ¥1.30 / ¥6.50 / ¥27.00,高速版 ¥2.60 / ¥13.00 / ¥54.00;kimi-k2.6 ¥1.10 / ¥6.50 / ¥27.00;kimi-k2.5 ¥0.70 / ¥4.00 / ¥21.00。截至 2026-07-17。冲省钱该看 DeepSeek 那本; 选 Kimi, 是冲这套栈和这颗脑子。
模型定价截至 2026-07
模型输入缓存命中输出上下文
kimi-k3旗舰 · 思考永远开20.002.00100.001M
kimi-k2.7-code编码专线 · 强制思考6.501.3027.00256K
kimi-k2.7-code-highspeed编码高速版 · 约 180 tokens/s13.002.6054.00256K
kimi-k2.6平价通用 · 思考可关 · Batch 六折6.501.1027.00256K
kimi-k2.5上代 · 2026-08-31 下线4.000.7021.00256K

¥ / 百万 token · 官方 platform.kimi.com 定价; K3 不在 Batch 批量折扣内。

再看跑分 —— 先分两摞。第一摞, 厂商自评: K3 发布博客里的数字, 多数是官方用自家 harness 跑出、未经第三方榜单收录; 而官方在同一篇博客里写明, 整体表现仍「trails the most powerful proprietary models」, 点名 Claude Fable 5 和 GPT 5.6 Sol, 并在 Limitations 里承认与这两家有「a noticeable gap in user experience」, 还警告 K3 有过度自主倾向。1注 1Kimi K3 官方博客(2026-07-16)—— 2.8 万亿参数 MoE(896 专家、每 token 激活 16)、1M token 上下文、原生视觉;思考固定 max 档,low / high 档后续上线;「full model weights will be released by July 27, 2026」,协议随技术报告公布;自评整体仍「trails the most powerful proprietary models」(点名 Claude Fable 5 与 GPT 5.6 Sol),Limitations 承认用户体验有明显差距、可能替用户做意料外的决定;建议 64 张以上加速卡部署;编码负载缓存命中率超九成(厂商口径)。激活参数量官方未公布。第二摞, 独立实测: 发稿时刚开始落地 —— DeepSWE 官方榜(2026-07-17 更新, 全榜统一 mini-swe-agent harness)已收录 K3: 69%±5%、16 个模型第 4, 距榜首 73% 只差 4 个点、误差棒与二三位重叠, 单任务成本 $4.65 在前五里第二低; 同一张榜上 K2.7-Code 是 31%±1、第 14。SWE-bench Verified 则仍无 K3 条目, Kimi 最好成绩还是 K2.5 的 70.8%。7注 7DeepSWE 官方榜单(页面标注更新于 2026-07-17,113 个任务、16 个模型,统一 mini-swe-agent harness)—— kimi-k3[max] 69%±5%,第 4(榜首 gpt-5.6-sol[max] 73%±3%,单任务成本 $4.65 为前五中第二低);kimi-k2.7-code 31%±1%,第 14。独立第三方实测,这是独立榜首个收录 K3 的成绩。8注 8SWE-bench Verified 官方榜单数据(官方 GitHub 原始 JSON)—— Kimi 最佳条目为 mini-SWE-agent + Kimi K2.5(high reasoning)70.8%(2026-02-17),同期榜首 79.2%;K2.6 与 K2.7-Code 从未提交;K3 发布不足 48 小时,截至 2026-07-17 无任何条目。第三摞, 偏好榜: Code Arena(WebDev)榜上 K3 以 1679 分登顶(约 48 万票)—— 但它是人类盲投的 Elo 偏好榜, 偏好不等于正确性。9注 9Code Arena(WebDev)官方榜单(Arena Intelligence 运营,2026-07-17 亲见)—— Kimi K3 以 1679 分居首(约 48 万票)。人类盲投的 Elo 偏好榜,比执行类基准软;偏好不等于正确性,本书仅作参照。 所以「什么时候回 frontier」这条线没变, 只是更好说了: 一锤定音的最难活(架构级的编码、多跳推理、不能错的输出)回 Claude / GPT —— 这不是我替它谦虚, 是 Moonshot 自己写在发布博客里的。1注 1Kimi K3 官方博客(2026-07-16)—— 2.8 万亿参数 MoE(896 专家、每 token 激活 16)、1M token 上下文、原生视觉;思考固定 max 档,low / high 档后续上线;「full model weights will be released by July 27, 2026」,协议随技术报告公布;自评整体仍「trails the most powerful proprietary models」(点名 Claude Fable 5 与 GPT 5.6 Sol),Limitations 承认用户体验有明显差距、可能替用户做意料外的决定;建议 64 张以上加速卡部署;编码负载缓存命中率超九成(厂商口径)。激活参数量官方未公布。K3 值得付钱的场景同样清楚: 百万 token 一次吃完的长料、要跑很久的 agent 任务、国内直连的顺手, 以及(7 月 27 日之后)可自托管的开放权重。中间的日常活, K2.6 依旧够用。
01

把你最近卡住的一件活, 按解剖台格式算一遍

拆出输入 / 输出 / 轮数, 套第二节的单价, 算出 K3 与 K2.6 各自多少钱 —— 十分钟, 这张账比任何跑分都懂你。
02

同一提示词, 在 K3 和 K2.6 上各跑一遍

就拿那件卡住你的活当考题, 两边各跑一次, 记下质量差和账单差 —— 这才是替你定制的那张榜。
03

给自己写一条「什么活才配 K3」

按算出来的账定线, 贴在看得见的地方。挡位是最后 10% 的微调, 不是把活说清楚的替代。

选模型, 选的是思考深度 和账单厚度.

选模型, 选的是思考深度 和账单厚度.

Kimi x Zhaphar

讨论

讨论.

评论区初始化中…