← Back to Blog
By GenCybers.inc

Kimi K3 发布解读:2.8T、1M 上下文、API 价格与早期用户反馈

截至 2026 年 7 月 17 日,Kimi K3 已正式上线。本文基于官方博客、API 文档、Hacker News 与第三方评测,梳理 K3 的参数、1M 上下文、API 价格与首批用户反馈。

Kimi K3 发布解读:2.8T、1M 上下文、API 价格与早期用户反馈

截至 2026 年 7 月 17 日,Moonshot AI 已正式发布 Kimi K3。如果只看规格,这次更新已经足够显眼:2.8T 参数、1M token 上下文、原生视觉、多端可用、OpenAI 兼容 API,再加上官方明确把它定位为面向 long-horizon codingknowledge workreasoning 的旗舰模型,K3 很自然会被视为 Kimi 体系迄今最重要的一次升级。

但这次发布真正值得关注的,不只是“参数更大了”,而是 Moonshot 明显在把 Kimi K3开放权重旗舰agent 工作流底座 的方向推进。与此同时,首批开发者反馈也很快给这股热度降了温:能力确实强,但目前偏慢、偏贵、偏啰嗦,而且推理强度还不够可控。

如果你最近也在关注中国模型的前沿竞争节奏,可以先结合我们之前写的 中国 LLM 现状观察 一起看;而如果你更关心开放权重与 API 产品化之间的平衡,DeepSeek V4 预览版上线分析 也能提供一个很好的参照系。

Kimi K3 这次到底发布了什么?

根据 Moonshot AI 在 2026 年 7 月 16 日 发布的 官方博客Kimi K3 的几项核心信息已经比较清楚:

  • 总参数量 2.8T
  • 1M token 上下文窗口
  • 原生视觉能力
  • 基于 Kimi Delta Attention(KDA)Attention Residuals(AttnRes)
  • 官方将其描述为 “world's first open 3T-class model”

不过,这里有一个必须说清楚的时间点差异。

官方博客同时写明,Kimi K3 已经可以在 Kimi.comKimi WorkKimi CodeKimi API 上使用,但 完整模型权重要到 2026 年 7 月 27 日前后才会发布,更完整的技术报告也会随后公开。也就是说,截至 2026 年 7 月 17 日,K3 已经是一个正式可用的产品,但还不是“权重已经全部放出来”的完成态。

这点很重要,因为很多人看到“open 3T-class model”时,容易直接理解成“已经完整开源”。更准确的表述应该是:Moonshot 已经把 K3 明确定位成开放权重路线的一代旗舰,但权重发布日期晚于模型上线日期。

如果你想先看最直观的成绩,官方 benchmark 和 coding benchmark 大致如下: Kimi K3官方benchmark结果 Kimi K3官方Coding benchmark结果

如果你更关心前端生成场景,第三方 Arena 榜单也提供了一个补充视角: Kimi K3 Arena 前端编码排名

API 侧已经上线,而且定位比 K2.6 更激进

Kimi API 文档索引Quickstart 可以确认,kimi-k3 已经进入 Moonshot 的正式 API 产品线,接入方式依然是熟悉的 OpenAI-compatible 风格,基础 base_url 仍然是:

https://api.moonshot.ai/v1

这意味着,如果你的现有工具链原本就支持 OpenAI 兼容接口,迁移到 Kimi K3 的工程门槛并不高。Moonshot 的文档索引里还列出了多篇围绕 Kimi K3 的接入说明,包括:

  • Kimi K3 Quickstart
  • Kimi K3 API Tool Calling Best Practices
  • Build an Agent with Kimi K3
  • Use Kimi API in Codex
  • Use Kimi in Claude Code
  • Use Kimi in Cline

这组文档结构本身已经释放出一个很明确的产品信号:K3 并不是只想做“聊天更聪明一点”的模型,而是明显在为 coding agent、tool calling 和多工具工作流准备。

价格出来了,但它不再是“便宜替代品”路线

Kimi K3 的另一条关键信息,是官方已经同步公开了 API 定价。

根据官方博客和 Flagship Model Kimi K3 Pricing 页面,当前价格为:

计费项价格
Cache-hit input$0.30 / 1M tokens
Cache-miss input$3.00 / 1M tokens
Output$15.00 / 1M tokens

如果你对 Kimi 之前几代模型有印象,这组数字会立刻传达出一个变化:K3 不再走“靠极低价格抢眼球”的路线。

Simon Willison 的首日观察 里,他特别指出,Kimi K3 的输入/输出定价已经来到与 Anthropic Claude Sonnet 系列接近的区间,而且比 Kimi K2.6 明显更贵。换句话说,Moonshot 这次不是在卖“更便宜的中国替代品”,而是在卖 更接近 frontier 档位的开放旗舰能力

这也解释了为什么首批社区讨论里,很多人并没有把注意力放在“好便宜”上,而是在问另一个更现实的问题:它的真实使用成本,是否真的比闭源前沿模型更划算?

官方想强调的,不只是参数和价格

如果把官方博客完整读下来,你会发现 Moonshot 真正想强调的是另一件事:K3 更像一个长时程任务执行模型,而不是单轮聊天模型。

官方给出的 showcase 和 benchmark 叙事,大多围绕这些场景展开:

  • 长时程代码编写与仓库导航
  • GPU kernel 优化
  • 从零构建 GPU 编译器
  • 带视觉反馈的前端、游戏和 CAD 类开发
  • 研究型知识工作与交互式报告生成
  • 多轮、多工具、多子代理协作

这也是为什么官方博客会专门强调 Kimi K3 在架构上采用 KDAAttnRes 和更高稀疏度的 Stable LatentMoE,并声称相较 Kimi K2 带来了大约 2.5 倍的 overall scaling efficiency。这些说法当然仍然属于官方口径,但至少可以看出 Moonshot 这次的主叙事并不是“我们也有一个更大的通用模型”,而是:

我们在试图把超大开放模型推向真正可用的 agent 工作流。

官方 benchmark 说明了什么?

结合上面的官方配图,再看正文里的 benchmark 叙述,最核心的一句总结其实已经写在开头:Kimi K3 的整体表现仍然落后于 Claude Fable 5GPT 5.6 Sol,但在 Moonshot 的评测集中,稳定超过了其余被纳入对比的模型。

如果只抓几项更容易理解的结果,大致可以这样概括:

  • 在多项 coding benchmark 上,Kimi K3 已经明显进入第一梯队
  • agentic workflowtool use 任务上,它的定位也非常明确
  • reasoning / knowledge / vision 维度上,官方分数显示它不是短板型产品,而是想做全面旗舰

但更值得注意的是官方写法本身。Moonshot 没有把 K3 包装成“已经全面超过闭源头部模型”,反而明确承认它和 Fable 5GPT 5.6 Sol 仍有差距。这个口径相对克制,反而让官方 benchmark 更值得读。

当然,benchmark 归 benchmark,真实体验仍然要看第三方和首批用户反馈。

第三方观察:能力进了前排,但速度和 verbosity 是代价

截至 2026 年 7 月 17 日,比较值得参考的第三方观察之一是 Artificial Analysis 的 Kimi K3 页面

Artificial Analysis Kimi K3页面

这家评测站点给出的几个数字很有代表性:

  • Kimi K3Artificial Analysis Intelligence Index57(作为对比,Claude Fable 560GPT-5.6-Sol-Max59
  • 它的输出速度大约是 62 tokens/s
  • 这个速度 低于同价位推理模型的中位数
  • 它在 Intelligence Index 评测中总共生成了 130M output tokens
  • 这个输出量显著高于同价位模型中位数,说明它 非常 verbose

Artificial Analysis 对它的总结很直接:智能水平已经进入领先区间,但它偏慢、偏贵,而且非常啰嗦。

这组观察和官方叙事并不矛盾。Moonshot 想卖的是“前沿能力”,而不是“最省 token 的效率王”。只是当模型进入真实 API 计费环境后,更强的推理往往也意味着更多 token、更长等待时间和更高实际成本

首批社区反馈最在意什么?

如果把 Hacker News 讨论串Simon Willison 的首日上手 放在一起看,社区最在意的问题主要集中在四个方向。

1. 目前只有 max reasoning,推理力度不够可控

官方博客已经写明,Kimi K3 在发布时默认使用 max thinking effort,低强度和高强度模式会在后续更新中引入。

这不是小问题。因为在许多生产环境里,开发者最需要的不是“永远最强”,而是能在质量、速度和成本之间自己做权衡。首发阶段只有 max,意味着 K3 现在更像一台全油门运转的机器。

Simon Willison 在首日测试里也明确提到,K3 当前只有一个 reasoning effort,而这件事在成本上“看得见摸得着”:一个简单的“生成一只骑自行车的鹈鹕 SVG”测试,就消耗了 16,658 output tokens,其中 13,241 是 reasoning tokens

2. 输出偏长,真实成本未必像单价看起来那么美好

HN 讨论里一个很高频的观点是:不能只看每百万 token 的标价,还得看模型为了完成同一任务到底会“烧掉”多少 reasoning tokens。

这也是为什么一些评论者会说,哪怕 Kimi K3 的名义价格低于 Claude Fable 5GPT 5.6 Sol如果它为了拿到相近结果要消耗更多推理 token,实际成本优势也会被迅速吃掉。

Artificial Analysis 也给了一个更可比较的指标:它测得 Kimi K3cost per task 大约是 $0.94,已经和 GPT 5.6 Sol$1.04 很接近。这个数字并不意味着 K3 没价值,但它足以说明:K3 不是那种靠价格碾压闭源前沿模型的产品。

3. 速度不算快,而且有人遇到了 timeout

HN 上一位完成初步 benchmark 的开发者提到,Kimi K3 只支持 max reasoning,而且模型本身比较慢;他还遇到了部分请求超时,以及编码演示在默认超时设置下失败的问题。

这类反馈和 Artificial Analysis 给出的“速度低于同价位中位数”是互相印证的。对一些能容忍等待的深度任务来说,这不一定构成致命问题;但如果你的工作流高度交互式、需要频繁往返,K3 的首发体验可能还不够顺手。

4. 工具调用和 schema 兼容性还有磨合空间

HN 同一条 benchmark 反馈里还提到,Moonshot 在部分 tool calling / response format schema 场景下存在兼容性问题,例如 tools.function.parameters 中使用 anyOf 时被接口拒绝。

这类问题不一定代表 K3 的工具能力弱,更可能说明:模型能力已经上线了,但周边 API 兼容层、工程实现和第三方 agent 框架适配还在追赶。

对普通聊天用户来说,这种细节不明显;但对已经在做 agent 产品、自动化工作流或 coding harness 的团队来说,这类边角兼容问题往往就是“能否马上进生产”的分水岭。

这篇文章最重要的结论

如果把截至 2026 年 7 月 17 日 已经公开的信息压缩成一句话,我会这样描述 Kimi K3

它已经是 Moonshot 迄今最有野心的一代旗舰模型,也是中国开放权重路线里非常值得关注的一步;但在首发阶段,它更像一台能力很强、工程味很重、还在继续打磨的人型引擎,而不是一款已经把速度、成本和开发者体验都调到最顺手状态的“成熟日用品”。

换句话说,K3 现在最适合三类人重点关注:

  1. 正在评估 开放权重旗舰 新进展的开发者和研究者
  2. 需要 长时程 coding / tool use / 多代理工作流 的团队
  3. 想观察中国模型是否已经逼近闭源头部产品体验边界的人

反过来说,如果你的优先级是:

  • 最低延迟
  • 最强价格优势
  • 最稳定的 schema / tool 兼容性
  • 立刻进生产、尽量少踩坑

那么截至今天,Kimi K3 更适合先 跟踪、试用、做 benchmark,而不是直接重仓。

常见问题

Kimi K3 现在已经完整开源了吗?

还不能这么说。根据 Moonshot 在 2026 年 7 月 16 日 的官方博客,Kimi K3 已经正式上线可用,但完整模型权重预计在 2026 年 7 月 27 日发布。截至 2026 年 7 月 17 日,更准确的表述是:产品已发布,完整权重尚未放出。

Kimi K3 的最大卖点是什么?

目前最明确的卖点有四个:2.8T 参数规模、1M 上下文、原生视觉能力,以及对 long-horizon coding / knowledge work / agent workflow 的明确优化。

Kimi K3 现在最明显的短板是什么?

从官方限制和首批用户反馈看,主要是四点:只有 max reasoning、输出偏长、速度不算快、工具链兼容性还在磨合。

相关资源

来源声明

本文来自 merchmindai.net。分享或转载本文时,请注明出处,并附上原文链接。

原文链接:https://merchmindai.net/blog/zh/post/kimi-k3-release-api-pricing-user-feedback