---
url: /lm/mistral-large-4/introduction.md
description: >-
  Mistral Large 4（ML4，代号 le Chonk）是什么？2026 年 10 月 6 日发布公开预览，1.05 万亿总参数、490
  亿激活参数的原生多模态 MoE 模型，3800 块 Grace Blackwell 在欧盟境内从零训练，160+ 语言，Cybench 93%、漏洞复现修复
  82% 全球第一，月底开放权重。五分钟搞懂这个"中国之外最强开源模型"。
---

# 认识 Mistral Large 4：1 万亿参数只激活 490 亿，欧美最强开放权重模型到底强在哪

先讲一件每个做安全的人都遇到过的窝火事。

你在复现一个开源组件的漏洞，想让模型帮你把 PoC 写出来、再顺手给出补丁。结果前沿闭源模型礼貌地回你一句："抱歉，我无法协助完成该请求。"——你明明是在**修**漏洞，不是**挖**漏洞，但在它眼里这两件事长得一模一样。

更荒诞的数字在这儿：在"复现真实漏洞并修复"这道测试题上，**Claude Opus 5.5 和 GPT-6 Astra 得分接近 0**。不是它们不会，是它们**拒绝执行**。而 2026 年 10 月 6 日刚发布的 **Mistral Large 4**（简称 ML4，代号 **le Chonk**）在同一道题上拿了 **82%**，是所有模型里的最高分。

> 这道 82 分的题，一半考能力，一半考"它愿不愿意干"。而"愿意干"这件事，闭源厂商替你决定，开放权重模型让你自己决定。

这就是 ML4 最值得聊的地方——它不是又一个"跑分又高了一点点"的模型，它是一道关于**AI 主权**和**能力归属**的试纸。

## 什么是 Mistral Large 4

**Mistral Large 4 是法国 Mistral AI 于 2026 年 10 月 6 日发布公开预览（Public Preview）的旗舰模型：一个 1 万亿级总参数、490 亿激活参数的原生多模态稀疏 MoE 模型，官方称其为"中国之外最强的开放权重模型"，权重将于 2026 年 10 月底开放下载。**

先把几个容易被误读的点拆清楚：

**第一，"1 万亿"是总参数，不是跑起来的成本。** 按 Mistral 官方文档的口径，ML4 是 **1.05 万亿总参数 + 490 亿每 token 激活参数 + 16 亿参数的视觉编码器**。稀疏 MoE 的意思是：专家网络全部存着，每个 token 只调度相关的那一小撮。所以**你的账单和显存按 490 亿算，你的知识容量按 1.05 万亿算**。

顺手给个参照：DeepSeek V4 Pro 也是 1.6 万亿总参数配 490 亿激活——**两者推理算力 footprint 基本打平**。所以"1T vs 1.6T"这个对比没什么意义，真正要盯的是激活参数和单位 token 成本。

**第二，它是原生多模态，不是"文本模型外挂个 CLIP"。** 文本和图片一起进、文本出。官方演示的场景挺实在：工程图纸、PDF、卫星影像。在 Dense 200 视觉定位基准上，ML4 拿 **42%**，GPT-6 Astra 是 **41%**——**一个开放权重模型，在某一项视觉能力上压过了前沿闭源模型**。

**第三，它是"从零训"的，不是蒸馏出来的。** Mistral 特别强调这一点（明显是在回应美国官方对中国厂商"蒸馏"的指控）。训练跑在 **3,800 块 NVIDIA Grace Blackwell GPU** 上，机房是 Mistral 自建的**欧洲数据中心**，预览版 API 也跑在同一套设施上。

**第四，多语言是刻进训练数据里的。** 语料覆盖 **160 多种自然语言，包含欧盟全部官方语言**。这点对做欧洲业务的团队是硬指标，不是锦上添花。

**第五，也是最重要的一条：现在你只能"用"，还不能"拥有"。** 预览期只有 API，**权重本月底才放**（有报道具体到 10 月 27 日），而且**开源协议到现在还没公布**，官方文档只标了个 "Open"。所以严格讲，今天它是"一个你能调用的预览 API + 一个你还没法拥有的模型"。

> 我知道这话听着像泼冷水。但"开放权重"这四个字现在越来越像预售——先发跑分，权重排期。**在权重和许可证真正落地之前，所有"开源模型"的称号都只是承诺。**

## 它有什么特点

* **网络安全是它最锋利的那把刀。** Artificial Analysis Cyber Index 全球**前五**，官方称大幅领先中国以外所有开放权重模型；"复现漏洞并修复"子项 **82%**，为所有模型最高；Cybench（40 道安全竞赛题）解出 **93%**，是开放权重模型已报告的最高分之一。
* **那 82% 里有一半是"不拒绝"换来的。** 我必须把话说清楚：Claude Opus 5.5、GPT-6 Astra 在这道题上接近 0 分，**是因为它们拒答**，不是因为它们菜。所以这个分数更准确的理解是——**ML4 是目前最愿意、也最能真正动手做安全工作的开放模型**，而不是"它比 Opus 更懂安全"。这个区别对渗透测试和漏洞研究团队很重要，对其他人没那么重要。
* **编码不是它的强项，别被"旗舰"两个字骗了。** DeepSWE v1.1 **61.7%**、SWE-Atlas-QnA **59.4%**、Terminal-Bench 4.0 **28.3%**。作为对照，GPT-6 Astra 和 Claude Opus 5.5 在 DeepSWE 上大约 **74%**——**差了 12 个点，这个差距是真实的**。Terminal-Bench 只有 28.3% 也说明：长程终端操作依然很难，别指望它替你跑完一整个重构。
* **但"编码智能体综合指数"它排到了 49.8%，官方称超过 DeepSeek V4 Pro 0813 和 Qwen3.8-Max。** 这个和上面那条不矛盾：综合指数是加权口径，单项是裸分。**看你想比什么。**
* **企业自动化才是它的舒适区。** AutomationBench（**657 个真实业务工作流**，横跨 Gmail、Google Sheets、Slack、Salesforce）拿 **59.9%**，官方称领先 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。这个基准比 SWE-bench 更接近"公司里真要干的活"。
* **人类盲评第二，仅次于 Claude Opus 5。** Surge AI 做的双盲人工评测（1–5 分，隐藏模型身份）里，ML4 Preview 拿 **3.74**，排五模型第二：Claude Opus 5 **4.22**、GLM-5.3 **3.60**、Kimi K3 **3.59**、GLM-5.2 **3.40**。
  **盲评是我最看重的那类分数**——它绕开了"针对基准刷分"这个行业通病。
* **长程知识工作也不差：AA-Briefcase 1393 Elo。**
* **防护没因为"放开"而崩。** 在 Lakera 公开的 B3 AI 安全基准上抵御了 **93.3%** 的攻击。当然这是基准成绩，不等于能防住所有提示注入。
* **价格比前沿闭源便宜，而且预览期打了对折。** 官方价目：每百万 token 输入 **$1.36**、输出 **$4.18**、缓存输入 **$0.14**；预览促销价 **$0.68 / $2.09 / $0.07**——**正好一半**。
* **能自托管，这才是"主权"的字面意思。** 权重放开后可以私有云 / 本地部署。社区粗估模型体积约 **240GB**，跑起来**至少 8 张 A100 80GB**（社区估算，官方尚未给出显存指引）。量化版大概率会在权重放出后几天内跟上，门槛会降一大截。

> 一句话概括它的性格：**它不是"更聪明的 GPT"，它是"一个不会在关键时刻跟你说不的模型，而且你能把它搬回自己机房"。**

## 用在哪儿

**先看真实客户。** Mistral 官方说已服务 **125+ 家企业**，公开点名的包括 **Airbus（空客）、ASML（阿斯麦）、HSBC（汇丰）**。在 ML4 的训练过程中，官方列出的合作行业是**金融、工程、制造、物流、制药、科研、航运、公共部门**——注意这个名单，全是"出事就要命"的行业，也全是**数据不能随便出境**的行业。

**场景一：企业安全运营与漏洞研究。** 这是 ML4 的主战场。内部测试里它被证明能干**恶意代码分析、漏洞优先级排序、编写检测规则**。真正打动人的不是 82% 这个数，而是 Mistral 那个论点：**防守方要证明一个漏洞真实存在，往往得先把它复现出来——而闭源模型的安全护栏恰恰会挡住这一步。** 对有合规要求的安全团队，这是刚需。

**场景二：欧盟境内、数据不出境的 AI 部署。** ML4 提供由 Mistral 端到端自营的**欧洲部署**，独立于其他数字服务提供商，受欧盟法律管辖。对欧盟公共部门、金融机构、医疗、国防承包商来说，用美国托管的闭源模型在 GDPR 和欧盟 AI 法案下是**实打实的法律敞口**，ML4 直接把这个障碍拆了。

**场景三：金融与法律专业工作流。** 官方单独列了 **Finance Agent** 和 **Harvey's Legal Agent** 两个评测，并称在金融、法律等企业负载上达到开源模型 SOTA。Harvey 是法律 AI 领域头部公司，这个合作含金量不低。

**场景四：技术图纸 / 文档 / 遥感图像理解。** 原生多模态 + Dense 200 视觉定位 42%（超 GPT-6 Astra 的 41%）。制造业图纸、长 PDF、卫星影像——这类"图里带字、字里带坐标"的活，正是视觉定位的发力的地方。

**场景五：企业流程自动化。** AutomationBench 59.9%，覆盖 657 个业务流程。跨系统、多步骤、要读邮件要改表格的活，比写代码更适合它。

**不适合的地方我也直说**：纯编码能力落后前沿闭源约 12 个点，长程终端任务只有 28.3%，**别把整个研发流程切到它上面**；另外它是预览版，官方明说"仍在持续改进中"，**你今天测到的不是月底下载到的那个模型**。

> 冷水必须泼满：这一节里所有分数**全部是厂商自报（vendor-reported）**，DeepSWE / Terminal-Bench / SWE-Atlas-QnA 三项还是 Artificial Analysis 在该 harness 公开发布前私下评测的数字。**截至目前没有任何中立实验室复现过。** 在第三方跑分出来之前，这些数字请当"声明"读，别当"事实"读。

## 初体验

现在的路径只有一条：**Mistral Studio 的预览 API**。控制台地址是 `console.mistral.ai`，注册拿 key 就能调。

预览端点的模型 ID，各家报道写法不完全一致（有写 `mistral-large-4-0` 的，也有写 `mistral-large-4-preview` 的），**以你控制台里实际显示的名字为准**——预览期标识还在动，这是常态。

**装 SDK：**

```bash
pip install -U mistralai
```

**最简对话：**

```python
from mistralai import Mistral
import os

client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])

resp = client.chat.complete(
    model="mistral-large-4-preview",   # 以控制台显示为准
    messages=[
        {"role": "user", "content": "用一句话解释什么是稀疏 MoE，别用比喻。"}
    ],
)
print(resp.choices[0].message.content)
```

**图片 + 文本（原生多模态）：**

```python
resp = client.chat.complete(
    model="mistral-large-4-preview",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "这张图纸里标注的关键尺寸有哪些？逐条列出来。"},
                {"type": "image_url", "image_url": "https://example.com/drawing.png"},
            ],
        }
    ],
)
```

**三个建议：**

一是**先把上下文口径对齐**。官方标称 **100 万 token**，但 Artificial Analysis 在其测试配置上读到的是 **524,288**——差了一倍。你要按 1M 去设计长文档流程，最好先自己压测一次实测窗口。

二是**记录下你测的模型版本和配置**。官方明说模型还在变，预览结果只是快照。**不记版本，月底权重出来你就没法判断是变好了还是变差了。**

三是**先跑通再省钱**。预览期价格打对折（$0.68 / $2.09），但**低输出单价不代表低总成本**——一个任务反复失败重试五次，省下的那点钱全还回去了。拿你真实的业务流跑一遍，看成功率，再算账。

## 进阶

如果这篇文章你只记住一件事，我希望是这个判断：**2026 年开源模型竞争的维度，已经从"谁的分高"变成"这个能力归谁管"。**

Mistral 联合创始人兼首席科学家 Guillaume Lample 在 WIRED 的采访里说了句我觉得比所有跑分都值钱的话：

> "有时候人们喜欢大谈美国 vs 欧洲 vs 中国，但真正重要的是**拥有这个模型**——哪怕对美国公司也一样。你用闭源模型，没人保证它明天还在。"

这句话之所以成立，是因为 2026 年已经发生过一次真实的警示：美国政府曾以"可能被用于发动网络攻击"为由，对 OpenAI 和 Anthropic 的模型分发施加临时限制。**当"能不能用"这个开关掌握在别人手里时，能力再强也是租来的。** 而网络安全恰恰是最不能接受"中途断供"的领域——**一次事件响应进行到一半被告知模型不能用了，这本身就是安全事故。**

所以 ML4 真正的卖点不是 1 万亿参数，是这三条同时成立：**前沿级能力 + 开放权重 + 欧盟境内端到端自营部署**。它卖的是"能力的确定性"。

再补一层背景：Mistral 在 2026 年 9 月完成了 **30 亿欧元 D 轮、估值 210 亿欧元**，是欧洲科技公司史上最大的一笔股权融资；收入据报道一年涨了约 20 倍。**它不再是那个"陪跑的小厂"了。** 从训练、定制到强化学习，ML4 用的就是 Mistral 通过 **Mistral Forge** 卖给客户的同一套环境——**自己吃自己的狗粮**，这件事比跑分更能说明工程成熟度。

冷水照例泼满：

**第一，权重没放、协议没公布。** 在许可证文件真正出现之前，"开源"只是营销词。1 万亿参数的模型，能不能商用、能不能改、要不要报备，全看那张纸怎么写。**这是月底最该盯的东西，不是跑分。**

**第二，全部跑分都是厂商自报。** 而且 ML4 在红队窗口期给到合作伙伴的是**降低内容审核、强化网络攻防能力**的版本，公开预览和那个版本不是一回事。**你测到的和官方宣传的，未必是同一个模型。**

**第三，1 万亿参数的自托管不是闹着玩的。** 社区估 ~240GB、8×A100 80GB 起步。**开放权重免掉了按 token 计费的风险，但把服务成本整个甩给了你。** 这笔账得自己算——对绝大多数团队，调用 API 比自建便宜得多，**自建的理由应该是"数据不能出境"或"不能依赖第三方"，从来不是"省钱"。**

我的建议很具体：**别一上来就切主力流程。** 挑一件你业务里**最容易被闭源模型拒绝、但又是正当合规**的活——比如漏洞复现验证、敏感日志分析、合规文档审查——用 ML4 的预览 API 跑 50 次，统计两件事：**成功率**，和**被拒次数**。把这两个数和你现在用的闭源方案并排一放，**"能力归谁管"这个问题就不再是抽象的立场之争，而是一张能拿去汇报的表。**

月底权重放出来那天，先看许可证，再看显存，最后才看跑分。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
