Skip to content

认识 Hy4 preview:腾讯混元开源的 770B 生产力模型

一个模型发布当天,有 5354 人在排队等它干活。

这不是什么限量球鞋发售,是 2026 年 8 月 28 日腾讯混元 Hy4 preview 上线 WorkBuddy 的真实截图。同一天,腾讯股价午后最高冲到 462.2 港元,收涨 1.65%。

说真的,两年前你要跟我说"混元能让这么多人排队等",我大概会回你一句"别闹了"。那时候业内对混元的评价,用某位 AI 研究员的话说是——长期"躺平"。转折点发生在 2025 年 12 月,1998 年出生的清华姚班、普林斯顿博士、ReAct 和思维树的共同提出者姚顺雨空降腾讯首席 AI 科学家。2026 年 1 月底,混元把预训练、强化学习、数据、评估的底层基础设施全部推倒重建。从那以后,平均每两个月一个大版本。

4 月 Hy3 preview,7 月 Hy3 正式版(发布一周调用量比 Hy2 涨了 68 倍),8 月 28 日 Hy4 preview。这节奏,确实有点东西了。

官方 README 里有一句话我很喜欢:"we would rather ship early and hear what breaks"——我们宁愿早点发布,听听哪里会崩。这年头敢把"未完待续"写在脸上的团队,不多了。

什么是 Hy4 preview

Hy4 preview 是腾讯混元(对外品牌 Tencent Hy Team)的新一代旗舰大语言模型,2026 年 8 月 28 日发布并开源,总参数 770B、每 token 激活 49B、上下文窗口突破 1M(1,048,576)token,权重采用 Apache 2.0 协议——没有任何月活阈值,没有自定义商用条款,没有"年营收超过 XX 亿要报备"那种弯弯绕绕。

上一代 Hy3 是 295B/21B、256K 上下文。Hy4 相当于两个月时间,总参数翻了 2.6 倍,上下文翻了 4 倍。

但真正值得琢磨的不是参数,是它的定位。官方这次不喊"通用",改口叫**"为生产力而生"**。姚顺雨反复讲过一个思路:不训练刷榜的做题家,关心模型在真实场景好不好用。所以 Hy4 的数据是跟腾讯内部软件工程、游戏、金融、安全这些领域的顶尖专家共建的,再跟 WorkBuddy、CodeBuddy 做产品级的 Co-Design。

还有一个小八卦:Hugging Face 文件页显示 780B,官方口径是 770B。差的这 10B 是内置的 MTP 投机解码层(10B 总参 / 0.7B 激活),770B 指的是 backbone。两家都没说错,只是算不算"附赠品"的区别。

Hy4 preview 有什么特点

  • 770B / 49B 的 MoE 稀疏架构:78 层,第 1 层 dense FFN,其余 77 层是 MoE——每层 256 个路由专家 + 1 个共享专家,每个 token 只激活 top-8 路由 + 1 共享。257 个专家里只点 9 个,所以它的算力开销跟一个中等规模 dense 模型差不多,而不是"770B 那么恐怖"。
  • 1M 原生上下文:1024K,不是事后靠位置插值硬撑上去的。
  • Gated DSA + IndexCache 注意力:用的是 DeepSeek 那条稀疏注意力路子(Gated DeepSeek Sparse Attention),加 IndexCache 做跨层稀疏索引复用。残差通路换成 4 路 identity Hyper-Connections(iHC),让层与层之间的信息流更宽。说人话:从超长上下文里挑重点看,信息多路并行传
  • 内置 MTP 投机解码:原生 10B 的 multi-token-prediction 层,官方部署方案默认开 3 步投机解码,这是它能在 8 卡上跑到可用吞吐的关键。
  • Apache 2.0,商用零负担:可以直接进商业产品,不用做任何署名手续。这点比一些"开源但有条件"的许可证省心太多。
  • 只有两档思考模式high(默认,深度链式思考)和 no_think。没有 medium,没有 budget 滑块,传别的值直接报错。粗暴,但好理解——要质量就 high,要速度就 no_think
  • 诚实说:它是纯文本模型。官方原话是「Hy4 preview 和 Hy3 均为大语言模型,暂不具备多模态能力」。别拿它跑图跑视频。

一句话:770B 是它的"容量上限",49B 激活才是你要付的账单。这买卖划算不划算,得看它能不能真替你干活。

Hy4 preview 能用在哪(真实案例)

软件工程:从"写代码"到"交付工程"

官方列了 12 项 benchmark,其中能从公开报道里确认的几项:

BenchmarkHy4 previewHy3备注
Terminal-Bench 2.185.470.8本月开源权重里最高的 agentic-terminal 分
DeepSWE64.328.0长程软件工程,直接翻倍还多
Toolathlon-Verified74.1工具调用能力
APEX-Agents (pass@1)37.1Kimi K3 是 37.2,差 0.1
SWE-bench Multilingual82.9纯文本模型里的强 repo 级成绩
GPQA Diamond92.3科学推理

腾讯内部还做了一次盲测:163 名内部专家、203 个工程任务,在 WorkBuddy 环境里打分。Hy4 preview 均分 2.99/4.00,GLM-5.3 是 2.92,Kimi K3 是 2.94。官方用词很克制——"略优于"。

先泼盆冷水:这 12 项跑分全部是腾讯自述,发布当天没有 Artificial Analysis 收录,没有 HF Open LLM Leaderboard 数据,也没有社区独立实测。数字先看着,等第三方复现出来再下结论不迟。

比起分数,我倒觉得腾讯新闻那位记者的实测更有参考价值。他用一句很糙的 prompt 让它做谷歌财报页,17 分钟后交付了结构清晰的汇总页——数据来源自己找到 SEC 和谷歌 IR 资料包,中途会判断信源可靠性、交叉验证、跑工具校验数据后再写代码。他的评价是:"同时承担了研究员和前端工程师的角色。"

另一个前端案例约束极其变态:Three.js r184 + DRACOLoader,7 个 GLB 模型(故宫、布达拉宫、黄鹤楼、天坛、长城、福建土楼、莫高窟),明确禁止用占位几何体和网络图片糊弄,三栏布局 296px / 自适应 / 336px,配色宣纸 #F7F2E5 配靛蓝 #22406A,宋体,验收标准是"安静、理性、东方、博物馆化"。审美这东西难量化,但能按这套约束交付,说明它把设计意图吃进去了。

科学研究:它开始解决真正的难题

  • 分子动力学:配合 Hyra,在已高度优化的 JAX 实现上再提速 2.0×,32,512 原子的磷脂双分子层跑到 54.9 ms/step,单张高端 GPU 能塞下 30 万原子。
  • 低温量子输运器件设计:自主完成量子散射求解器构建、五势垒结构稳健优化、独立含时演化验证,高能阻带平均泄漏率从 48.2% 降到 4.8%,还顺手生成了一个可交互调参的模拟器。
  • 三维 Blaschke–Lebesgue 问题(百年经典几何难题):体积下界从 0.380799 推进到 0.41104,Meissner 四面体猜想上界 0.41986,只剩约 2% 的 gap。完整证明挂在 Hyra-results 仓库。

最硬核的一点:它参与了自己的研发

这是我觉得整个发布里最值得琢磨的部分,比跑分有意思得多。

Hy4 preview 首次参与了自己的研发全链路——训练方法、数据策略、评估体系、底层算子的自动优化。流程是:模型提方案 → 跑实验 → 看结果继续迭代 → 实验产生的代码和日志回流到下一轮。官方称之为"初步的递归自我改进闭环"。

具体成果是实的:它自己分析推理系统瓶颈,围绕算子融合和通信优化做了多轮改进,端到端吞吐相比基线提升 31.8%,在 4K–256K 上下文、1–64 并发下都稳定有效。拆开看,prefill 侧 +3%~7%,decode 侧 +44%~69%

闭环到底有多深不好判断,但 decode 侧 40% 以上的增益是实打实跑出来的。

AI 优化 AI 的算力效率——这个闭环如果能持续下去,长期价值可能超过任何一次单纯的参数膨胀。至少比"我又把参数翻了一倍"这种叙事性感。

初体验:怎么上手 Hy4 preview

最省事:直接用产品

Hy4 preview 已经在 WorkBuddy(办公,workbuddy.cn / workbuddy.ai)和 CodeBuddy(写代码,codebuddy.cn / codebuddy.ai)国内版、国际版,以及元宝、ima 同步首发。在线入口是 https://aistudio.tencent.com/

限时免费两周,免费期到 2026 年 9 月 10 日 23:59(WorkBuddy 侧口径,CodeBuddy 官方只说"同步开展两周限时免费",没单独给截止日期)。免费期内每天有额度上限,触顶后消耗积分,繁忙时要排队——前面那个 5354 人的队列就是这么来的。想试趁早。

调 API:OpenAI 兼容,换个 base_url 就行

国内走腾讯云 TokenHub,海外走 OpenRouter(模型 ID 是 tencent/hy4-preview,上下文标 1.05M,最大输出 64K)。

渠道输入输出缓存命中
腾讯官方(国内)6 元 / 百万 token18 元 / 百万 token0.3 元 / 百万 token
OpenRouter$0.834 / 百万 token$2.501 / 百万 token$0.042 / 百万 token

作为参照:DeepSeek V4 Pro 是 $0.66 / $1.98(off-peak),Qwen3.8 Max 是 $2 / $6,Kimi K3 是 $3 / $15。Hy4 处在中间偏下的位置——它不是预算型模型,比 DeepSeek V4 Flash($0.22/$0.66)贵一截。

python
from openai import OpenAI
import os

client = OpenAI(
    base_url="https://openrouter.ai/api/v1",   # 或腾讯云 TokenHub 的 endpoint
    api_key=os.getenv("OPENAI_API_KEY"),
)

resp = client.chat.completions.create(
    model="tencent/hy4-preview",
    messages=[{"role": "user", "content": "用三句话解释什么是 MoE 稀疏架构"}],
    temperature=0.9,   # 官方推荐 temperature=0.9, top_p=1.0
    top_p=1.0,
    # 默认是 high(深度思考);要速度就传 no_think
    extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}},
)
print(resp.choices[0].message.content)

自己部署:先掂量一下显卡

权重开源在 Hugging Face(tencent/Hy4-preview)、GitHub(Tencent-Hunyuan/Hy4-preview)、ModelScope、GitCode、CNB,同时提供原版 BF16 和 FP8 量化版Hy4-preview-FP8,官方主推的部署目标)。

门槛:BF16 约 1.5TB,FP8 约 770GB,FP8 版也要 8 卡才跑得动。这不是工作站模型,别指望单卡。

bash
# vLLM 起服务,8 卡张量并行
vllm serve tencent/Hy4-preview-FP8 \
  --tensor-parallel-size 8 \
  --served-model-name hy4-preview

想进一步压体积可以用配套的 AngelSlim 量化工具。SGLang 也走同样的路子(TP=8 + FLASHMLA_SPARSE 稀疏注意力后端 + MTP 投机解码),官方有预构建镜像。

提醒一句:这个模型 8 月底才发布,vLLM / SGLang 的社区支持还在快速迭代。稳妥起见建议从源码编译,或者直接用官方预构建镜像,别拿你生产环境的稳定版本硬上。另外,海光深算 DCU 已经宣布完成 Hy4 preview 推理全流程的 Day0 适配,走国产算力的同学可以关注一下。

已知的坑,官方自己承认的

  • "聪明且慢热":复杂任务下长思考、过度自我验证,眼看要出结果了它还要再验一轮,交付时长偏长。等的过程挺煎熬。自部署用户可以传 no_think 直出。
  • 没有多模态:跑图、跑视频会切到别的模型,照常消耗积分。
  • 所有性能数据都是腾讯自述,等第三方实测出来可能有出入。

进阶

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区