认识 GLM-5.3:智谱没换基座,却把编程能力干上了开源第一
这两年我们被"参数竞赛"驯化得有点厉害:模型变强,无非是堆参数、换基座、加数据。谁家发新模型不喊一句"万亿参数",都显得不够诚意。
结果 2026 年 8 月 14 日,智谱(Z.ai)发布 GLM-5.3,官方博客第一句话直接把这套叙事掀了:"Scaling post-training is all we did." ——基座没换,参数没加,一个月里干的全是后训练。就这么着,内部编程基准涨了 50%。
更离谱的是副产品。他们顺手拿模型去扫真实开源项目,在 269 个项目里挖出 2436 个漏洞,其中 1097 个中高危。最老的那个 bug,1981 年就埋进代码里了——比这篇文章的大部分读者岁数都大,平均每个漏洞在代码里躺了 26.6 年才被发现。
我一直觉得"后训练"这词听着像边角料优化。GLM-5.3 算是给了个响亮的反例:同一个大脑,送去集训一个月,回来就换了个人。天花板可能压根不在参数上,而在你有没有本事给它造出足够真实的"练功房"。
什么是 GLM-5.3
GLM-5.3 是北京智谱华章(智谱 AI / Z.ai)的最新旗舰模型,2026 年 8 月 14 日发布,主打两件事:前沿编程能力和涌现出来的网络安全能力。
它最特殊的地方在于身世——用的是和 GLM-5.2 完全相同的基座模型,所有能力提升 100% 来自后训练阶段:更多的长程任务环境、更多样的任务类型、更长的训练时间。智谱自己在博客里说得很坦白,"我们可能还远没摸到这个基座的智能上界"。
支持 1M(约 105 万 token)上下文、最大输出 128K token,目前只处理文本模态(想让它看图,得换别人)。参数规模官方这次没披露,公开报道普遍称总参数约 7430 亿的 MoE 架构——这数字姑且听着,官方口径里它压根不是重点。
GLM-5.3 有什么特点
- 纯后训练拿下开源编程 SOTA:Terminal-Bench 3.0 从 GLM-5.2 的 4.6 分飙到 28.3 分(同期 Kimi K3 是 17.4),DeepSWE v1.1 从 46.2 → 66.9,Agents' Last Exam (CLI) 从 23.8 → 28.5,公开榜上开源第一。
- Token 效率提升,不是靠"多说话"堆分数:Max 档位下 34.5% 准确率、每任务约 7.5 万 输出 token;GLM-5.2 是 23.4%、约 9.6 万。High 档更狠——约 5 万 token 拿到 31.4%,把用了 12 万 token 才 29.5% 的 Claude Opus 4.8 按住了。
- 网络安全能力"意外涌现":CyberGym 得 84.5%,开源第一,还略超 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%);ExploitBench 从 24.4% 翻倍到 54.4%;ExploitGym 六小时完成数从 39 项干到 130 项。
- 后训练三件套全公开:IndexShare 管长上下文、SAO 管长程任务强化学习、slime 管大规模异步训练(已开源,训练侧 Megatron + rollout 侧 SGLang,长程编码 RL 端到端吞吐提升 2.3 倍以上)。
- 思考模式不给关了:API 里
thinking.type只支持enabled,改用reasoning_effort的 low / high / max 三档控制深度,默认 max。 - 三协议兼容:OpenAI Chat Completion、OpenAI Response、Anthropic Message 都能对接,迁移基本是改个 model ID 的事。
- 两周后开源权重:发布时明确说了,等安全评估与模型加固做完就放——也就是 8 月底前后会出现在开放下载渠道。
一句"最强开源模型"要拆开看:CyberGym 确实是全场第一,但 ExploitBench 54.4% 对比 Mythos 5 的 78.0%、ExploitGym 六小时 130 项对比 247 项,差距还挺实在。官方自己那句总结特别克制——当前差距最大的方向,恰恰也是能力增长最快的方向。
GLM-5.3 能用在哪(真实案例)
- 真实开源项目的安全审计:这是最硬的案例。智谱从 GLM-5.2 起就联合国内多家安全团队拿模型扫真实代码库,经专家复核、筛选、去重后,GLM-5.3 在 269 个开源项目中发现 2436 个漏洞——Critical 107 个、High 990 个、Medium 1286 个、Low 53 个。覆盖系统内核、浏览器引擎、开源基础设施、Web 应用和网络协议,影响跨度长达 45 年。他们还专门建了个公开的漏洞披露台账,目前 53 个已公开、2383 个仍在协调披露中(所以权重才要延后两周放)。
- 端到端的软件工程活儿:训练环境已经不是刷编程题了,而是"给你一个计算集群、代码库、内部文档和实验结果,自己去定位训练栈瓶颈、做优化、跑实验,最后交付可量化的端到端加速"——有些任务资深工程师也得干好几天。
- 终端与 CLI 自动化:Terminal-Bench 3.0 从 4.6 到 28.3 这个跨度,直接把"丢给它一个 shell 让它自己干完"从演示变成了可用。
- 已经能用上的地方:GLM Coding Plan 已全量上线,可在 ZCode、Claude Code、Cline、Cursor、Trae、OpenCode 等主流编程智能体里直接调;智谱自家还同步上了效率工具 AutoClaw;阿里云百炼也已由 Z.AI 直供上线该模型。
省钱细节值得单独说:新版 Coding Plan 按积分计费,非高峰时段只消耗标准积分的 50%。高峰是工作日 14:00–18:00(UTC+8),也就是说晚上和周末全天都是半价。ZCode 侧还有 98%+ 的缓存命中率加成。
初体验:怎么上手 GLM-5.3
最省事的还是走 API。它兼容 OpenAI 协议,换个 base_url 就完事:
pip install openaifrom openai import OpenAI
client = OpenAI(
api_key="你的KEY",
base_url="https://open.bigmodel.cn/api/paas/v4",
)
resp = client.chat.completions.create(
model="glm-5.3",
messages=[{"role": "user", "content": "审查这段代码,找出潜在的安全漏洞"}],
extra_body={
"thinking": {"type": "enabled"}, # 只能 enabled,写 disabled 会报错
"reasoning_effort": "high", # low / high / max,默认 max
},
)
print(resp.choices[0].message.content)官方自家 SDK 也可以,语义更直白:
pip install zai-sdk从 GLM-5.2 迁移的三个坑,照着改就行:
model改成glm-5.3;- 把
thinking.type: "disabled"全部改成"enabled"——不改直接换 model ID,请求会失败; - 别偷懒留着默认的
max。默认档的思考输出比 GLM-5.2 长出一倍多,简单问答用low、常规编码用high,账单会好看很多。
想本地部署的,再等等——权重发布两周后开放(约 8 月底),到时候配 vLLM / SGLang 起服务是常规操作。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
