Skip to content

认识 Mistral Large 4:1 万亿参数只激活 490 亿,欧美最强开放权重模型到底强在哪 ​

先讲一件每个做安全的人都遇到过的窝火事。

你在复现一个开源组件的漏洞,想让模型帮你把 PoC 写出来、再顺手给出补丁。结果前沿闭源模型礼貌地回你一句:"抱歉,我无法协助完成该请求。"——你明明是在修漏洞,不是挖漏洞,但在它眼里这两件事长得一模一样。

更荒诞的数字在这儿:在"复现真实漏洞并修复"这道测试题上,Claude Opus 5.5 和 GPT-6 Astra 得分接近 0。不是它们不会,是它们拒绝执行。而 2026 年 10 月 6 日刚发布的 Mistral Large 4(简称 ML4,代号 le Chonk)在同一道题上拿了 82%,是所有模型里的最高分。

这道 82 分的题,一半考能力,一半考"它愿不愿意干"。而"愿意干"这件事,闭源厂商替你决定,开放权重模型让你自己决定。

这就是 ML4 最值得聊的地方——它不是又一个"跑分又高了一点点"的模型,它是一道关于AI 主权和能力归属的试纸。

什么是 Mistral Large 4 ​

Mistral Large 4 是法国 Mistral AI 于 2026 年 10 月 6 日发布公开预览(Public Preview)的旗舰模型:一个 1 万亿级总参数、490 亿激活参数的原生多模态稀疏 MoE 模型,官方称其为"中国之外最强的开放权重模型",权重将于 2026 年 10 月底开放下载。

先把几个容易被误读的点拆清楚:

第一,"1 万亿"是总参数,不是跑起来的成本。 按 Mistral 官方文档的口径,ML4 是 1.05 万亿总参数 + 490 亿每 token 激活参数 + 16 亿参数的视觉编码器。稀疏 MoE 的意思是:专家网络全部存着,每个 token 只调度相关的那一小撮。所以你的账单和显存按 490 亿算,你的知识容量按 1.05 万亿算。

顺手给个参照:DeepSeek V4 Pro 也是 1.6 万亿总参数配 490 亿激活——两者推理算力 footprint 基本打平。所以"1T vs 1.6T"这个对比没什么意义,真正要盯的是激活参数和单位 token 成本。

第二,它是原生多模态,不是"文本模型外挂个 CLIP"。 文本和图片一起进、文本出。官方演示的场景挺实在:工程图纸、PDF、卫星影像。在 Dense 200 视觉定位基准上,ML4 拿 42%,GPT-6 Astra 是 41%——一个开放权重模型,在某一项视觉能力上压过了前沿闭源模型。

第三,它是"从零训"的,不是蒸馏出来的。 Mistral 特别强调这一点(明显是在回应美国官方对中国厂商"蒸馏"的指控)。训练跑在 3,800 块 NVIDIA Grace Blackwell GPU 上,机房是 Mistral 自建的欧洲数据中心,预览版 API 也跑在同一套设施上。

第四,多语言是刻进训练数据里的。 语料覆盖 160 多种自然语言,包含欧盟全部官方语言。这点对做欧洲业务的团队是硬指标,不是锦上添花。

第五,也是最重要的一条:现在你只能"用",还不能"拥有"。 预览期只有 API,权重本月底才放(有报道具体到 10 月 27 日),而且开源协议到现在还没公布,官方文档只标了个 "Open"。所以严格讲,今天它是"一个你能调用的预览 API + 一个你还没法拥有的模型"。

我知道这话听着像泼冷水。但"开放权重"这四个字现在越来越像预售——先发跑分,权重排期。在权重和许可证真正落地之前,所有"开源模型"的称号都只是承诺。

它有什么特点 ​

  • 网络安全是它最锋利的那把刀。 Artificial Analysis Cyber Index 全球前五,官方称大幅领先中国以外所有开放权重模型;"复现漏洞并修复"子项 82%,为所有模型最高;Cybench(40 道安全竞赛题)解出 93%,是开放权重模型已报告的最高分之一。
  • 那 82% 里有一半是"不拒绝"换来的。 我必须把话说清楚:Claude Opus 5.5、GPT-6 Astra 在这道题上接近 0 分,是因为它们拒答,不是因为它们菜。所以这个分数更准确的理解是——ML4 是目前最愿意、也最能真正动手做安全工作的开放模型,而不是"它比 Opus 更懂安全"。这个区别对渗透测试和漏洞研究团队很重要,对其他人没那么重要。
  • 编码不是它的强项,别被"旗舰"两个字骗了。 DeepSWE v1.1 61.7%、SWE-Atlas-QnA 59.4%、Terminal-Bench 4.0 28.3%。作为对照,GPT-6 Astra 和 Claude Opus 5.5 在 DeepSWE 上大约 74%——差了 12 个点,这个差距是真实的。Terminal-Bench 只有 28.3% 也说明:长程终端操作依然很难,别指望它替你跑完一整个重构。
  • 但"编码智能体综合指数"它排到了 49.8%,官方称超过 DeepSeek V4 Pro 0813 和 Qwen3.8-Max。 这个和上面那条不矛盾:综合指数是加权口径,单项是裸分。看你想比什么。
  • 企业自动化才是它的舒适区。 AutomationBench(657 个真实业务工作流,横跨 Gmail、Google Sheets、Slack、Salesforce)拿 59.9%,官方称领先 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。这个基准比 SWE-bench 更接近"公司里真要干的活"。
  • 人类盲评第二,仅次于 Claude Opus 5。 Surge AI 做的双盲人工评测(1–5 分,隐藏模型身份)里,ML4 Preview 拿 3.74,排五模型第二:Claude Opus 5 4.22、GLM-5.3 3.60、Kimi K3 3.59、GLM-5.2 3.40。 盲评是我最看重的那类分数——它绕开了"针对基准刷分"这个行业通病。
  • 长程知识工作也不差:AA-Briefcase 1393 Elo。
  • 防护没因为"放开"而崩。 在 Lakera 公开的 B3 AI 安全基准上抵御了 93.3% 的攻击。当然这是基准成绩,不等于能防住所有提示注入。
  • 价格比前沿闭源便宜,而且预览期打了对折。 官方价目:每百万 token 输入 $1.36、输出 $4.18、缓存输入 $0.14;预览促销价 $0.68 / $2.09 / $0.07——正好一半。
  • 能自托管,这才是"主权"的字面意思。 权重放开后可以私有云 / 本地部署。社区粗估模型体积约 240GB,跑起来至少 8 张 A100 80GB(社区估算,官方尚未给出显存指引)。量化版大概率会在权重放出后几天内跟上,门槛会降一大截。

一句话概括它的性格:它不是"更聪明的 GPT",它是"一个不会在关键时刻跟你说不的模型,而且你能把它搬回自己机房"。

用在哪儿 ​

先看真实客户。 Mistral 官方说已服务 125+ 家企业,公开点名的包括 Airbus(空客)、ASML(阿斯麦)、HSBC(汇丰)。在 ML4 的训练过程中,官方列出的合作行业是金融、工程、制造、物流、制药、科研、航运、公共部门——注意这个名单,全是"出事就要命"的行业,也全是数据不能随便出境的行业。

场景一:企业安全运营与漏洞研究。 这是 ML4 的主战场。内部测试里它被证明能干恶意代码分析、漏洞优先级排序、编写检测规则。真正打动人的不是 82% 这个数,而是 Mistral 那个论点:防守方要证明一个漏洞真实存在,往往得先把它复现出来——而闭源模型的安全护栏恰恰会挡住这一步。 对有合规要求的安全团队,这是刚需。

场景二:欧盟境内、数据不出境的 AI 部署。 ML4 提供由 Mistral 端到端自营的欧洲部署,独立于其他数字服务提供商,受欧盟法律管辖。对欧盟公共部门、金融机构、医疗、国防承包商来说,用美国托管的闭源模型在 GDPR 和欧盟 AI 法案下是实打实的法律敞口,ML4 直接把这个障碍拆了。

场景三:金融与法律专业工作流。 官方单独列了 Finance Agent 和 Harvey's Legal Agent 两个评测,并称在金融、法律等企业负载上达到开源模型 SOTA。Harvey 是法律 AI 领域头部公司,这个合作含金量不低。

场景四:技术图纸 / 文档 / 遥感图像理解。 原生多模态 + Dense 200 视觉定位 42%(超 GPT-6 Astra 的 41%)。制造业图纸、长 PDF、卫星影像——这类"图里带字、字里带坐标"的活,正是视觉定位的发力的地方。

场景五:企业流程自动化。 AutomationBench 59.9%,覆盖 657 个业务流程。跨系统、多步骤、要读邮件要改表格的活,比写代码更适合它。

不适合的地方我也直说:纯编码能力落后前沿闭源约 12 个点,长程终端任务只有 28.3%,别把整个研发流程切到它上面;另外它是预览版,官方明说"仍在持续改进中",你今天测到的不是月底下载到的那个模型。

冷水必须泼满:这一节里所有分数全部是厂商自报(vendor-reported),DeepSWE / Terminal-Bench / SWE-Atlas-QnA 三项还是 Artificial Analysis 在该 harness 公开发布前私下评测的数字。截至目前没有任何中立实验室复现过。 在第三方跑分出来之前,这些数字请当"声明"读,别当"事实"读。

初体验 ​

现在的路径只有一条:Mistral Studio 的预览 API。控制台地址是 console.mistral.ai,注册拿 key 就能调。

预览端点的模型 ID,各家报道写法不完全一致(有写 mistral-large-4-0 的,也有写 mistral-large-4-preview 的),以你控制台里实际显示的名字为准——预览期标识还在动,这是常态。

装 SDK:

bash
pip install -U mistralai

最简对话:

python
from mistralai import Mistral
import os

client = Mistral(api_key=os.environ["MISTRAL_API_KEY"])

resp = client.chat.complete(
    model="mistral-large-4-preview",   # 以控制台显示为准
    messages=[
        {"role": "user", "content": "用一句话解释什么是稀疏 MoE,别用比喻。"}
    ],
)
print(resp.choices[0].message.content)

图片 + 文本(原生多模态):

python
resp = client.chat.complete(
    model="mistral-large-4-preview",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "这张图纸里标注的关键尺寸有哪些?逐条列出来。"},
                {"type": "image_url", "image_url": "https://example.com/drawing.png"},
            ],
        }
    ],
)

三个建议:

一是先把上下文口径对齐。官方标称 100 万 token,但 Artificial Analysis 在其测试配置上读到的是 524,288——差了一倍。你要按 1M 去设计长文档流程,最好先自己压测一次实测窗口。

二是记录下你测的模型版本和配置。官方明说模型还在变,预览结果只是快照。不记版本,月底权重出来你就没法判断是变好了还是变差了。

三是先跑通再省钱。预览期价格打对折($0.68 / $2.09),但低输出单价不代表低总成本——一个任务反复失败重试五次,省下的那点钱全还回去了。拿你真实的业务流跑一遍,看成功率,再算账。

进阶 ​

如果这篇文章你只记住一件事,我希望是这个判断:2026 年开源模型竞争的维度,已经从"谁的分高"变成"这个能力归谁管"。

Mistral 联合创始人兼首席科学家 Guillaume Lample 在 WIRED 的采访里说了句我觉得比所有跑分都值钱的话:

"有时候人们喜欢大谈美国 vs 欧洲 vs 中国,但真正重要的是拥有这个模型——哪怕对美国公司也一样。你用闭源模型,没人保证它明天还在。"

这句话之所以成立,是因为 2026 年已经发生过一次真实的警示:美国政府曾以"可能被用于发动网络攻击"为由,对 OpenAI 和 Anthropic 的模型分发施加临时限制。当"能不能用"这个开关掌握在别人手里时,能力再强也是租来的。 而网络安全恰恰是最不能接受"中途断供"的领域——一次事件响应进行到一半被告知模型不能用了,这本身就是安全事故。

所以 ML4 真正的卖点不是 1 万亿参数,是这三条同时成立:前沿级能力 + 开放权重 + 欧盟境内端到端自营部署。它卖的是"能力的确定性"。

再补一层背景:Mistral 在 2026 年 9 月完成了 30 亿欧元 D 轮、估值 210 亿欧元,是欧洲科技公司史上最大的一笔股权融资;收入据报道一年涨了约 20 倍。它不再是那个"陪跑的小厂"了。 从训练、定制到强化学习,ML4 用的就是 Mistral 通过 Mistral Forge 卖给客户的同一套环境——自己吃自己的狗粮,这件事比跑分更能说明工程成熟度。

冷水照例泼满:

第一,权重没放、协议没公布。 在许可证文件真正出现之前,"开源"只是营销词。1 万亿参数的模型,能不能商用、能不能改、要不要报备,全看那张纸怎么写。这是月底最该盯的东西,不是跑分。

第二,全部跑分都是厂商自报。 而且 ML4 在红队窗口期给到合作伙伴的是降低内容审核、强化网络攻防能力的版本,公开预览和那个版本不是一回事。你测到的和官方宣传的,未必是同一个模型。

第三,1 万亿参数的自托管不是闹着玩的。 社区估 ~240GB、8×A100 80GB 起步。开放权重免掉了按 token 计费的风险,但把服务成本整个甩给了你。 这笔账得自己算——对绝大多数团队,调用 API 比自建便宜得多,自建的理由应该是"数据不能出境"或"不能依赖第三方",从来不是"省钱"。

我的建议很具体:别一上来就切主力流程。 挑一件你业务里最容易被闭源模型拒绝、但又是正当合规的活——比如漏洞复现验证、敏感日志分析、合规文档审查——用 ML4 的预览 API 跑 50 次,统计两件事:成功率,和被拒次数。把这两个数和你现在用的闭源方案并排一放,"能力归谁管"这个问题就不再是抽象的立场之争,而是一张能拿去汇报的表。

月底权重放出来那天,先看许可证,再看显存,最后才看跑分。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区