认识 Qwen3.8-Omni-Flash:第一个学会"先看哪儿再决定看多久"的全模态模型
先甩一组数据,你自己感受一下它的反直觉程度。
同一道题、同一个模型,去理解一段长视频:
- 传统做法(把视频从头到尾看完):OmniVideoBench 准确率 63.4,每道题烧掉约 145,736 个 token。
- 新做法(让它自己决定看哪儿):准确率 67.8,每道题只用了 79,117 个 token。
看得更少,反而懂得更多,还便宜了 45.7%。
这不是什么魔法,是把人类排查监控录像的那套逻辑教给了模型:你不会盯着三个小时的录像一帧一帧看,你会先问"发生了什么事",然后快进到可疑的时间点,凑近看清楚,不对再换一段。
2026 年 9 月 18 日,阿里千问团队发布的 Qwen3.8-Omni-Flash,核心卖点就是这件事。官方给它的 slogan 很直白:Omni Senses. Agentic Delivery.——全模态感知,智能体式交付。
一句话翻译:以前的多模态模型负责告诉你视频里有什么,它负责把活干完。
但在开香槟之前,有一件事必须先说清楚:这个模型没有开源权重。 我知道,这在一篇发在开源社区的文章里听起来有点扫兴,但糊弄过去才是对读者不尊重——具体的差别我在最后会专门讲,先说正事。
多模态模型这两年的进化路线,正在从"我看见了什么"转向"我帮你把它做完了"。前者是搜索引擎的活,后者才是助理的活。
什么是 Qwen3.8-Omni-Flash
Qwen3.8-Omni-Flash 是千问团队下一代原生全模态模型,一个模型同时吃进文本、图像、音频、视频四种输入,上下文窗口 100 万 token。
注意"原生"(Omni / native)这个词,它不是把四个单模态模型用路由粘在一起,而是一个模型一套权重通吃四种模态。这也是它和市面上那些"文本模型外挂视觉编码器"方案的根本区别——后者在多模态一起上场时,经常出现明显的单 modality 能力掉血,而官方这次特意晒了文本和视觉的分数,就是为了证明全模态训练没有拖垮它的老本行。
关键规格速览:
| 项目 | 参数 |
|---|---|
| 发布时间 | 2026 年 9 月 18 日 |
| API 名称 | qwen3.8-omni-flash |
| 输入模态 | 文本、图像、音频、视频 |
| 输出模态 | 文本、语音(29 种语言 + 7 种方言) |
| 上下文窗口 | 1M token |
| 单请求上限 | 视频最长 2 小时、音频最长 3 小时 |
| 语音识别 | 74 种语言 + 39 种中国方言 |
| 推理档位 | reasoning_effort:xhigh(默认)/ medium / low |
| 权重是否已开源 | 否,仅 API 提供服务 |
| 实时变体 | Qwen3.8-Omni-Flash-Realtime(qwen3.8-omni-flash-realtime) |
还有一类版本值得单独盯一眼:Qwen3.8-Omni-Flash-Realtime。它不是"快一点的同一个模型",而是走 WebSocket / WebRTC 的实时流式版本,一边说话一边出声,官方实测首 Token 延迟约 591ms,首音频包延迟约 978ms,音频 RTF 0.1538——RTF 远小于 1,意味着它生成语音的速度比你说话快得多,实时对话不会因为"它在想"而卡住。
它有什么特点
1. Agentic 长音视频理解(我认为这是全场最有价值的一项)
模型从你的问题出发,规划要看哪些片段,然后由粗到细多轮取证,而不是上来就全量处理。官方测下来,这个套路在多个长视频基准上都是"升分 + 降 token"的双赢:
| 基准 | 静态全量理解 | Agentic 取证 | token 变化 |
|---|---|---|---|
| OmniVideoBench | 63.4 | 67.8 | 145,736 → 79,117(-45.7%) |
| Video-MME-v2 | 65.0 | 71.3 | 降低 |
| LVOmniBench | 63.3 | 73.6 | 降低 |
LVOmniBench 这一项涨了 10.3 分,反超 Gemini 3.8 Flash 的 70.7,拿到榜单最佳。"少看一点,看得准一点"这件事在工程上是有普适价值的——它本质是把注意力预算从"固定采样"改成"按需分配"。
2. 音频能力,尤其是"谁在说话"
官方口径是音视频能力接近 Gemini 3.8 Flash,整体音频能力超过它。最夸张的一项在 AliMeeting 会议数据集:多说话人识别的 DER(分离错误率)从上一代的 88.11 降到 3.35,cpWER 从 89.61 降到 17.18。
数字好看到有点不真实——这也是为什么我在结尾要泼冷水。但即便按保守理解,会议场景终于能用了这件事,基本可以确认。
3. 端到端交付,而不是给你一段描述
这是它和上一代最大的分野。官方演示的三条流水线都是交付成品:
- Music2MV:给一首歌,理解曲式、节奏、情绪、人声与乐器变化,输出逐句带时间戳歌词,然后规划角色、场景、分镜,直接生成 MV。
- 短剧出海:说话人感知对话识别 → 会话翻译 → 角色音色克隆与配音 → 音频重混 → 自动质检,一条流程交付国际版成片。
- 长片影视解说:全片理解 → 抽取关键情节 → 写解说词 → 配音配乐 → 剪辑渲染 → 原声与解说智能混流(自动调节语速音量)。
以前这三条流水线,每条背后都是一堆模型和一堆人工。现在是一次请求。
4. 顺手交出的两份答卷:文本与视觉没掉队
| 能力 | 基准 | 得分 |
|---|---|---|
| 代码 | SWE-bench Pro | 63.3 |
| 代码 | LiveCodeBench v6 | 92.6 |
| 办公协作 | CoWorkBench | 75.3 |
| GUI 智能体 | AndroidWorld | 87.1 |
| 长视频推理 | LVBench | 76.9 |
| 数学视觉 | MathVision(含代码解释器) | 96.2 |
全部是官方表里的最佳档位。全模态训练常常以牺牲单模态为代价,这次看起来没有。
5. 用模型优化模型
这条藏在发布页中后段的实验,我个人认为比上面所有分数都更有想象空间:
让 Qwen3.8-Omni-Flash 自己去优化一个更小的模型(Qwen2.5-Omni-3B)的四川话识别能力,12 小时预算,全程无人参与——它自己选 benchmark、自己跑基线、自己去听识别错的音频样本找规律、构建 3,413 条针对性训练数据、跑了四轮实验、并把没涨分的改动回滚了。
结果:字符错误率从 25.79% 降到 15.30%,相对提升约 40.7%。
大模型负责理解数据、设计实验、推动迭代,小模型负责实际部署——如果这条闭环跑通了,做模型就不再是一条只能靠人力堆的流水线。
它能用在哪(真实场景与数据)
先声明:下面这批数字来自千问团队官方发布页,不是第三方复现。看厂商自报数据,我习惯性先打个折——但即便打折,这些场景的方向感是明确的。
场景一:会议,从"纪要"到"行动"
官方 demo 是丢进去一小时会议录像,端到端完成跨音视频说话人联合识别、分离、转写、身份对齐,然后生成纪要、行动项、风险分析,甚至直接调工具发邮件、派任务、开始写代码。
以前这是三个模型的活(ASR + 视觉 + 文本摘要)加一段手写胶水代码,现在是一个 API 调用。AliMeeting 上 3.4 的 DER 如果能在你的会议室里复现个七成,会议工具这个赛道就得重算一遍成本结构。
场景二:把视频变成资产
- Video2Note:几小时的教程视频 → 带关键截图、时间戳、步骤说明的 PDF 笔记。
- Omni Skill Creator:一段操作录屏 → 一份可复用、可分享的 Agent
Skill.md。这个我特别喜欢——它把"老员工的肌肉记忆"变成了可版本管理的配置文件。 - omni-memory:给长视频建立"谁在场、谁说了什么、怎么说的、当时什么声音"的音视频长期记忆。
场景三:视频内容的工业化生产
短剧出海、短剧解说、MV 这三类都属于"量大人贵"的苦活。官方给的例子是穆祉丞 Maschine AI 做音乐视频、红豆短剧做出海译制。价格端配合得很激进:音频输入每小时 API 价格下降超 98%,音视频输入每小时下降超 93%——这个降幅直接改写了"常开音频接口"的单位经济性。
场景四:实时交互
Realtime 变体上,官方给了两个有意思的场景:一是实时口语陪练,联合建模发音与语义,能理解口音和非标准表达并实时生成标准发音示范;二是全模态空间音频感知——结合空间声音(支持立体声与 FOA)和画面判断声源方向与距离,官方称其为首个能通过声音定位目标的全模态模型,用途是机器人"听到声音→定位→导航过去"。
初体验:怎么上手 Qwen3.8-Omni-Flash
路径 A:直接调 API(最简单)
模型已在千问 AI 平台(chat.qwen.ai)和阿里云百炼开放,兼容 OpenAI 风格接口:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
resp = client.chat.completions.create(
model="qwen3.8-omni-flash",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": [
{"type": "video_url", "video_url": {"url": "https://example.com/meeting.mp4"}},
{"type": "text", "text": "请按发言人整理会议纪要,并列出行动项。"},
]},
],
# 推理深度按需切换,成本立竿见影
extra_body={"reasoning_effort": "medium"},
)
print(resp.choices[0].message.content)想省钱就把 reasoning_effort 从默认的 xhigh 往下调 —— 简单活用 low,复杂任务才上 xhigh。
路径 B:装插件,让现有 Agent 直接长出眼睛和耳朵(推荐)
这条才是开源的部分。千问把配套工具链 Qwen-MM-Plugins 以 Apache 2.0 开源了,仓库维护得很勤(最近一次提交就在 9 月 18 日,并且已经把默认 Omni 模型切到 qwen3.8-omni-flash)。
# 一行脚本,交互式菜单选 Agent Harness 和插件
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash
# 后续更新已安装的能力
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash -s -- update不想跑脚本的话,直接跟你的 Agent 说人话也行:
Help me install the core, api, and omni-related plugins from https://github.com/QwenLM/Qwen-MM-Plugins.
支持的 harness:Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code、Gemini CLI 等,另有 WorkBuddy、DeepSeek Harness、Hermes Agent、opencode 的手动适配文档。
每个能力以「Skill + 可选 MCP server」的形式独立安装,按需勾选:
| 插件 | 干什么 |
|---|---|
core | 让主模型本地直读图片、视频帧、PDF、Office、代码、数据、3D/NIfTI 文件(默认本地模式不需要 API Key) |
api | 图像理解、OCR、目标定位、音视频转写、说话人分离、事件分析、SAM3 分割 |
omni-chatcut | MV 生成、长片影视解说、保留原音色的视频翻译 |
omni-video2note | 教程视频 → 带插图的 PDF 笔记 |
omni-skill-creator | 演示视频 → 可复用 Agent Skill.md |
omni-memory | 长视频的音视频长期记忆 |
装完之后,直接在对话里引用文件就行:
@meeting.mp4 转写并标出说话人和时间戳。
@tutorial.mp4 生成一份带关键截图的 PDF 笔记,输出到 /absolute/path/tutorial-notes.pdf。
@weekly_report_sop.mp4 把这段写周报的录屏整理成一个 Skill.md。
@song.mp3 按这首歌的节奏和内容生成一支 MV。依赖上,仓库用 uv 提供的 uvx 按需装 Python 依赖,视频和文档类工作流需要 ffmpeg;安装器自带 Configure 和 Verify 两个动作,先配置再自检,别跳过。
路径 C:实时交互
npm install -g qwen-live-harness
qwen-live-harness init
qwen-live-harness进阶
现在来泼冷水,这次必须先说最大的那盆。
第一,也是最关键的:Qwen3.8-Omni-Flash 没有开源权重。
截至 2026 年 9 月 18 日,Hugging Face 的 Qwen 组织下没有 Qwen3.8-Omni 仓库,官方发布页也通篇没提开放权重;千问上一次放出 Omni 系权重还是 2025 年 9 月的 Qwen3-Omni-30B-A3B,此后 Omni 线一直是 API-only。Omni 这条线,是千问明确选择留给自己的护城河。
说得更直白些:这次发布里,真正能下载、能改、能自建的是 Apache 2.0 的 Qwen-MM-Plugins 工具链,模型能力本身你得付费调 API。 别看到"Qwen 开源"四个字就默认可以本地跑——这轮全然不同。
我理解这个选择(全模态模型的训练与推理成本摆在那儿),但作为开源社区站,我必须把这句话写在前面:你可以信任它的能力,但你不能掌控它的存在。 如果哪天它下线或涨价,你的全部业务跟着抖。
第二,所有评测都是厂商自报。 尤其是 AliMeeting 那个 88.11 → 3.35 的 DER 跳变,第三方尚未复现,有分析认为增益里相当一部分可能来自周边音频处理工程,而非纯模型能力。换到你自己的会议室录音上跑一遍之前,别把它当既成事实。
第三,Agentic 取证的省 token 效果依赖 harness。 官方数字是用 Qwen Code 跑出来的;换别的编排框架,省幅未必能复制。
第四,这是同日发布。 没有社区独立基准,没有生产规模的长跑报告。新模型发布头两周的数据,永远要打折看。
所以我的建议很具体:先别做架构决策,先做一次校验。 用 core 插件(它本地免费)打底,配一张最便宜的额度,把你自己手上那份"最难啃的长视频"丢进去——不是官方 demo 那种精修素材,而是光线差、有回声、四个人抢话的真实会议录像。看它的发言人分离能不能顶住,这一个大考过了,其它分才有意义。
退一步说,即便权重没放开,Qwen-MM-Plugins 这套把"让 Agent 长眼睛长耳朵"工程化、标准化成 Skill + MCP 的做法,本身就已经把答案给你了——它开源的那部分,正是你真正需要自己掌控的那部分。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
