---
url: /lm/deepseek/introduction.md
description: >-
  DeepSeek 是什么？一文读懂深度求索开源大模型 V3、R1、V4 系列，1.6万亿参数 MoE、1M 上下文、MIT 开源、本地部署与 API
  接入，国产大模型入门首选。
---

# 认识DeepSeek：从开源黑马到1.6万亿参数的国产大模型标杆

先说个让我这种"调包侠"有点破防的事。

2025 年初，一家叫\*\*深度求索（DeepSeek）\*\*的中国公司，用一款叫 **R1** 的推理模型，把整个硅谷搅得天翻地覆——而它开源，MIT 协议，权重直接甩到 Hugging Face 上，谁都能下。一年半后，2026 年 8 月 13 日，它又把 **1.6 万亿参数**的旗舰 **V4 Pro 正式版**开源上线，输入价格只有海外同级闭源模型的零头。

> 当别人还在为闭源模型的定价权争得面红耳赤，有人已经把"厨房"连锅端给你了。

这不是什么遥不可及的信仰充值，而是每个写代码、做数据、搞 AI 应用的人，今天就能用上的真家伙。这篇文章不打算把 DeepSeek 拆成论文讲，只想帮你"打开一扇窗"——知道它是什么、能干什么、怎么上手，就够了。

## 什么是 DeepSeek

**DeepSeek（深度求索）** 是一家中国 AI 公司，主打一件事：把前沿大模型做到**开源、能打、还便宜**。

它不是一个单一模型，而是一整个**开源模型家族**，按时间线一路打怪升级：

* **DeepSeek-V3（2024-12）**：671B 参数的 MoE 基座模型，开源，性价比起点。
* **DeepSeek-R1（2025-01）**：推理模型（强化学习训练），能把"思考过程"显式展示出来，开源 MIT，一度让全球开发者疯狂本地部署。
* **DeepSeek-V3.1 / V3.2（2025）**：混合推理架构，一个模型同时支持"思考"与"不思考"两种模式。
* **DeepSeek-V4（2026-04 预览 / 2026-08 正式版）**：分 **V4-Flash**（284B 总参、13B 激活，主打便宜快）和 **V4-Pro**（1.6T 总参、49B 激活，旗舰），全面拥抱 **Agent 与 Coding** 场景。

一句话理解：**DeepSeek 是国产开源大模型的"扛把子"，你想用开源大模型，绕不开它。**

## 它有什么特点

* **真·开源，MIT 协议**：权重直接放 Hugging Face / ModelScope，允许商用、允许蒸馏、允许拿去训练自己的小模型。这在动辄"开源但不开放权重"的圈子里，属实清流。
* **MoE 混合专家架构**：总参数巨大（V4-Pro 1.6 万亿），但每次推理只激活一小部分（49B），既保住知识容量，又把算力和显存压下来——"大而精"才是真省钱。
* **百万级上下文**：V4 系列默认 **1M（100 万）token** 上下文，最长可输出 **38.4 万 token**。装下整个代码库、几十份文档、长长一串工具调用记录，Agent 干活不再"记性差"。
* **可切换的思考强度**：Non-Think（秒回）/ Think High（复杂分析）/ Think Max（极限推理）三档，按任务复杂度挑，不用每次都等它"冥想"半天。
* **Agent 能力拉满**：V4-Pro 正式版大幅强化智能体能力，原生支持 **Tool Calls、JSON 输出、Responses API**，并兼容 **OpenAI 与 Anthropic 双协议**——你原来接 GPT 的代码，改个 Base URL 就能无缝切到 DeepSeek。
* **地板级定价**：V4-Pro 输入（缓存未命中）3 元 / 百万 token、输出 6 元 / 百万 token；而海外同级闭源旗舰普遍是"美元 / 百万 token"。同样第一梯队能力，价格差了一个数量级。

> 开源模型的真正威力，不是"免费"，而是**把模型底座从特定算力的依赖里解耦**——你下载权重自己跑，不再被单一云端服务卡脖子。

## 模型家族速览

| 模型 | 发布时间 | 定位 | 关键规格 | 协议 |
| --- | --- | --- | --- | --- |
| DeepSeek-V3 | 2024-12 | 通用基座 | 671B MoE | MIT |
| DeepSeek-R1 / R1-0528 | 2025-01 / 05 | 推理模型 | 685B，128K 上下文（开源版） | MIT |
| DeepSeek-V3.1 / V3.2 | 2025 | 混合推理 | 思考 / 非思考一体 | MIT |
| DeepSeek-V4-Flash | 2026-07 正式版 | 高性价比 | 284B / 13B 激活，1M 上下文 | MIT |
| DeepSeek-V4-Pro（0813） | 2026-08-13 | 旗舰 Agent | 1.6T / 49B 激活，1M 上下文 | MIT |

## 它都在哪些地方被用起来了

**场景一：云厂商集体"上车"。** 2025 年初 R1 发布后，国内主流云厂商在数天内集体上线 DeepSeek 模型服务，企业不用自建算力、不用招算法团队，开个 API Key 就能把大模型接进业务系统——智能客服、合同摘要、代码审查，都是现成落点。

**场景二：开发者本地私有化部署。** 对数据不能出域的团队，把 **R1（685B，128K 上下文，MIT）** 权重拉下来，用本站讲过的 [Ollama](/ollama/introduction) 或 [vLLM](/vllm/introduction) 在自己的显卡上跑，一份数据都不用上传第三方，安全感拉满。

**场景三：开源生态的"围剿"主力。** 据 Hugging Face《2026 春季全球开源 AI 生态报告》，**中国开源模型下载占比已达 41%，首次超过美国**；DeepSeek 正是这场"开源围剿闭源"的核心推手。说人话就是：大家用脚投票，开源模型真香。

> 大模型这盘棋，2026 年的主题已经从"谁更聪明"变成了"谁更开放、更便宜、更能本地跑"。DeepSeek 恰好站在所有正确答案的那一边。

## 初体验：怎么把它跑起来

最轻量的上手，三种姿势任选：

1. **网页 / App 直接聊**：打开 chat.deepseek.com，登录即用，免费额度足够日常体验 V4 系列。

2. **调 API**：注册 DeepSeek 开放平台拿 Key，`base_url` 不变，把 `model` 设成 `deepseek-v4-pro` 或 `deepseek-v4-flash` 就行。兼容 OpenAI SDK，原来调 GPT 的代码基本不用改：

   ```python
   from openai import OpenAI

   client = OpenAI(
       base_url="https://api.deepseek.com",
       api_key="你的DEEPSEEK_API_KEY",
   )

   resp = client.chat.completions.create(
       model="deepseek-v4-pro",
       messages=[{"role": "user", "content": "用一句话解释什么是 MoE 架构"}],
   )
   print(resp.choices[0].message.content)
   ```

3. **本地部署**：想私有化或离线玩，去 Hugging Face / ModelScope 下权重，配合 [Ollama](/ollama/introduction) 或 [vLLM](/vllm/introduction) 一键起服务（V4-Pro 1.6T 太重，本地先拿 R1 / V3 练手更现实）。

进阶玩家还能试试 **DeepSeek Harness**——2026-08-13 同步公测、MIT 开源的编程智能体框架，对标 Codex / Claude Code，"一切皆插件"，想做自己的 AI 程序员可以从它入手。

## 进阶

DeepSeek 的更新快得像坐火箭，今天这篇只是帮你认个门。想追它的最新模型、看官方评测细节、学本地部署实操，建议把本站 [Ollama](/ollama/introduction)、[vLLM](/vllm/introduction)、[LangChain](/langchain/introduction) 几篇一起啃了，串起来就是一套"开源大模型落地全家桶"。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
