---
url: /lm/kimi-k3/introduction.md
description: >-
  Kimi K3 是月之暗面（Moonshot AI）于 2026 年开源的 2.8 万亿参数 MoE
  大模型，原生支持百万上下文与原生视觉，是当下最火的开源大模型之一。本文带你快速认识它是什么、能干什么、怎么上手。
---

# 认识 Kimi K3：月之暗面开源的 2.8 万亿参数"超级智能体"

你有没有过这种体验：让大模型帮你写个网页，代码噼里啪啦给你甩过来，结果一运行全红，来回改了八遍还是跑不起来。问题不在你，在于大多数模型是"闭着眼睛写代码"——它根本看不见自己写的页面长啥样。

2026 年 7 月，月之暗面（Moonshot AI）甩出一颗"核弹"：**Kimi K3**，总参数 **2.8 万亿**，全球首个开放的 3T（万亿）级模型。最离谱的是它的"视觉在环（vision in the loop）"能力——它写代码、截图看效果、再改、再看，像个真人在那儿调界面。这玩意儿一开源，直接把 Arena 前端代码榜干到全球第一，把一众美国闭源模型踩在脚下。

> 有分析师说，这是"又一个 DeepSeek 时刻"。我倒觉得，它更像一个会自己干活、还能边干边看结果的"实习生 2.0"——而且不用你手把手教。

## 什么是 Kimi K3

Kimi K3 是月之暗面（Moonshot AI）的旗舰多模态推理模型，**2026 年 7 月 16 日发布、7 月 27 日开源权重**。它不是简单地把参数堆大，而是用了一套自研架构 + 稀疏专家路由，专门为了"长程自主任务"而生——也就是那种要连续干几十步、要调工具、要看截图、要查资料的活儿。

说白了，K2 时代 Kimi 还是个"长文本聊天高手"，K3 直接进化成了"能端到端交付的 Agent"。月之暗面自己都承认，论综合智能它暂时还排在 Claude Fable 5 和 GPT-5.6 Sol 之后，但在编程、视觉理解、长程任务这条线上，它已经摸到前沿级门槛了。

## Kimi K3 有什么特点

* **2.8 万亿参数 MoE 稀疏架构**：896 个专家里，每个 token 只激活 16 个，激活参数约 500 亿，推理不靠"暴力全开"。
* **原生百万上下文**：1,048,576 token，是预训练阶段就支持的"真·长上下文"，不是事后用位置插值硬撑的"假长上下文"。
* **原生多模态视觉**：同一模型里理解文本、图像、视频，不需要外接视觉适配器（不再有"看不懂图"的割裂感）。
* **KDA + AttnRes 自研架构**：Kimi Delta Attention 管长序列的信息流，Attention Residuals 管深层梯度不丢失，两者撑起了 2.8T 的扩展效率（比 K2 提升约 2.5 倍）。
* **视觉在环（vision in the loop）**：截图 → 改代码 → 看效果 → 再改，形成自动化反馈闭环，特别适合游戏开发、UI 设计、CAD。
* **OpenAI 兼容 API**：换个 `base_url` 就能用，从 K2 迁移到 K3 基本是一行代码的事。

> 一句话：它的聪明不是"参数大"三个字能概括的。2.8T 是容量上限，真正厉害的是把规模转化成了"能干活的真实能力"。

## Kimi K3 能用在哪（真实案例）

别光看参数吓人，这模型的案例是真能端到端交付的，月之暗面在技术报告里写得明明白白：

* **长程编码与工程**：GPU 内核优化、从零写类 Triton 编译器 MiniTriton、芯片设计。最夸张的一个案例——K3 在 **一次 48 小时自主运行**中，用开源 EDA 工具完成了芯片的设计、优化与验证：4mm² 面积、100MHz 时序收敛、仿真解码吞吐超 **8,700 tokens/s**，一颗"为模型服务、由模型设计"的芯片就这么出来了。
* **深度研究与知识工作**：一份"42 年 AI ASIC 产业研究"交互式网站，靠 **2,800+ 次搜索/抓取、1,100+ 次数据拉取、覆盖 1.1 万多页内容**生成；GWTC-5 引力波分析则用 **20+ 个并发子智能体**分析了 391 个引力波事件，产出科学可视化与文献综述。
* **多模态创作**：用 56 段素材自动剪出预告片，处理片段挑选、节拍同步、音频；还能做 3Blue1Brown 风格的架构动画讲解视频。
* **国产算力适配**：**华为宣布昇腾（Ascend）0-day 适配 K3**，成为首个跑在国产硬件上的开放 3 万亿级模型；阿里云百炼也上线了 K3。

> 先别上头。这些案例很硬，但本地部署门槛也不低——完整权重约 **1.5TB（96 个 safetensors 分片）**，官方建议在 **64 张及以上加速卡的超节点**上跑。对个人而言，老老实实薅 API 最香。

## 初体验：怎么上手 Kimi K3

普通开发者根本不用自己扛 64 张卡，先跑通 API 最实在：

```bash
pip install openai
```

```python
from openai import OpenAI

client = OpenAI(base_url="https://api.moonshot.cn/v1", api_key="你的KEY")
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "用三句话介绍你自己"}],
    temperature=1.0,
    max_tokens=4096,
    extra_body={"reasoning_effort": "max"},  # low / high / max，默认 max
)
print(resp.choices[0].message.content)
```

想自己部署也行，官方给了 vLLM / SGLang 的 recipe，8 卡张量并行起步：

```bash
# 先拉权重
modelscope download --model moonshotai/Kimi-K3 --local_dir ./Kimi-K3

# vLLM 起服务
pip install -U vllm
vllm serve ./Kimi-K3 \
  --served-model-name kimi-k3 \
  --tensor-parallel-size 8 \
  --max-model-len 1048576 \
  --trust-remote-code
```

价格参考（API）：输入 **$3 / 百万 token**（缓存命中 $0.30）、输出 **$15 / 百万 token**，比同档闭源模型便宜一截，这也是它敢叫板前沿闭源模型的底气之一。

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
