---
url: /lm/qwen-omni-flash/introduction.md
description: >-
  Qwen3.8-Omni-Flash 是阿里千问团队 2026 年 9 月 18 日发布的原生全模态模型，支持文本/图像/音频/视频四种输入与 1M
  上下文，Agentic 长视频理解让 OmniVideoBench 准确率从 63.4 升到 67.8、token 消耗反降 45.7%，音频输入每小时
  API 价格下降超 98%。配套 Qwen-MM-Plugins 与 Qwen-Live Harness 以 Apache 2.0
  开源。本文带你快速认识它是什么、强在哪、怎么上手，以及那个必须先说清楚的前提。
---

# 认识 Qwen3.8-Omni-Flash：第一个学会"先看哪儿再决定看多久"的全模态模型

先甩一组数据，你自己感受一下它的反直觉程度。

同一道题、同一个模型，去理解一段长视频：

* **传统做法（把视频从头到尾看完）**：OmniVideoBench 准确率 **63.4**，每道题烧掉约 **145,736** 个 token。
* **新做法（让它自己决定看哪儿）**：准确率 **67.8**，每道题只用了 **79,117** 个 token。

**看得更少，反而懂得更多，还便宜了 45.7%。**

这不是什么魔法，是把人类排查监控录像的那套逻辑教给了模型：你不会盯着三个小时的录像一帧一帧看，你会先问"发生了什么事"，然后快进到可疑的时间点，凑近看清楚，不对再换一段。

2026 年 9 月 18 日，阿里千问团队发布的 **Qwen3.8-Omni-Flash**，核心卖点就是这件事。官方给它的 slogan 很直白：**Omni Senses. Agentic Delivery.**——全模态感知，智能体式交付。

一句话翻译：以前的多模态模型负责**告诉你视频里有什么**，它负责**把活干完**。

但在开香槟之前，有一件事必须先说清楚：**这个模型没有开源权重。** 我知道，这在一篇发在开源社区的文章里听起来有点扫兴，但糊弄过去才是对读者不尊重——具体的差别我在最后会专门讲，先说正事。

> 多模态模型这两年的进化路线，正在从"我看见了什么"转向"我帮你把它做完了"。前者是搜索引擎的活，后者才是助理的活。

## 什么是 Qwen3.8-Omni-Flash

**Qwen3.8-Omni-Flash 是千问团队下一代原生全模态模型，一个模型同时吃进文本、图像、音频、视频四种输入，上下文窗口 100 万 token。**

注意"原生"（Omni / native）这个词，它不是把四个单模态模型用路由粘在一起，而是**一个模型一套权重通吃四种模态**。这也是它和市面上那些"文本模型外挂视觉编码器"方案的根本区别——后者在多模态一起上场时，经常出现明显的单 modality 能力掉血，而官方这次特意晒了文本和视觉的分数，就是为了证明**全模态训练没有拖垮它的老本行**。

关键规格速览：

| 项目 | 参数 |
| --- | --- |
| 发布时间 | 2026 年 9 月 18 日 |
| API 名称 | `qwen3.8-omni-flash` |
| 输入模态 | 文本、图像、音频、视频 |
| 输出模态 | 文本、语音（29 种语言 + 7 种方言） |
| 上下文窗口 | 1M token |
| 单请求上限 | 视频最长 2 小时、音频最长 3 小时 |
| 语音识别 | 74 种语言 + 39 种中国方言 |
| 推理档位 | `reasoning_effort`：`xhigh`（默认）/ `medium` / `low` |
| 权重是否已开源 | **否**，仅 API 提供服务 |
| 实时变体 | Qwen3.8-Omni-Flash-Realtime（`qwen3.8-omni-flash-realtime`） |

还有一类版本值得单独盯一眼：**Qwen3.8-Omni-Flash-Realtime**。它不是"快一点的同一个模型"，而是走 WebSocket / WebRTC 的实时流式版本，一边说话一边出声，官方实测**首 Token 延迟约 591ms，首音频包延迟约 978ms，音频 RTF 0.1538**——RTF 远小于 1，意味着它生成语音的速度比你说话快得多，实时对话不会因为"它在想"而卡住。

## 它有什么特点

**1. Agentic 长音视频理解（我认为这是全场最有价值的一项）**

模型从你的问题出发，规划要看哪些片段，然后**由粗到细多轮取证**，而不是上来就全量处理。官方测下来，这个套路在多个长视频基准上都是"升分 + 降 token"的双赢：

| 基准 | 静态全量理解 | Agentic 取证 | token 变化 |
| --- | --- | --- | --- |
| OmniVideoBench | 63.4 | **67.8** | 145,736 → 79,117（**-45.7%**） |
| Video-MME-v2 | 65.0 | **71.3** | 降低 |
| LVOmniBench | 63.3 | **73.6** | 降低 |

LVOmniBench 这一项涨了 10.3 分，反超 Gemini 3.8 Flash 的 70.7，拿到榜单最佳。**"少看一点，看得准一点"这件事在工程上是有普适价值的**——它本质是把注意力预算从"固定采样"改成"按需分配"。

**2. 音频能力，尤其是"谁在说话"**

官方口径是**音视频能力接近 Gemini 3.8 Flash，整体音频能力超过它**。最夸张的一项在 AliMeeting 会议数据集：**多说话人识别的 DER（分离错误率）从上一代的 88.11 降到 3.35，cpWER 从 89.61 降到 17.18。**

数字好看到有点不真实——这也是为什么我在结尾要泼冷水。但即便按保守理解，会议场景终于能用了这件事，基本可以确认。

**3. 端到端交付，而不是给你一段描述**

这是它和上一代最大的分野。官方演示的三条流水线都是**交付成品**：

* **Music2MV**：给一首歌，理解曲式、节奏、情绪、人声与乐器变化，输出逐句带时间戳歌词，然后规划角色、场景、分镜，直接生成 MV。
* **短剧出海**：说话人感知对话识别 → 会话翻译 → 角色音色克隆与配音 → 音频重混 → 自动质检，一条流程交付国际版成片。
* **长片影视解说**：全片理解 → 抽取关键情节 → 写解说词 → 配音配乐 → 剪辑渲染 → **原声与解说智能混流**（自动调节语速音量）。

以前这三条流水线，每条背后都是一堆模型和一堆人工。现在是一次请求。

**4. 顺手交出的两份答卷：文本与视觉没掉队**

| 能力 | 基准 | 得分 |
| --- | --- | --- |
| 代码 | SWE-bench Pro | **63.3** |
| 代码 | LiveCodeBench v6 | **92.6** |
| 办公协作 | CoWorkBench | **75.3** |
| GUI 智能体 | AndroidWorld | **87.1** |
| 长视频推理 | LVBench | **76.9** |
| 数学视觉 | MathVision（含代码解释器） | **96.2** |

全部是官方表里的最佳档位。**全模态训练常常以牺牲单模态为代价，这次看起来没有。**

**5. 用模型优化模型**

这条藏在发布页中后段的实验，我个人认为比上面所有分数都更有想象空间：

让 Qwen3.8-Omni-Flash 自己去优化一个更小的模型（Qwen2.5-Omni-3B）的四川话识别能力，**12 小时预算，全程无人参与**——它自己选 benchmark、自己跑基线、自己去听识别错的音频样本找规律、构建 3,413 条针对性训练数据、跑了四轮实验、并把没涨分的改动回滚了。

结果：字符错误率从 **25.79% 降到 15.30%**，相对提升约 40.7%。

> 大模型负责理解数据、设计实验、推动迭代，小模型负责实际部署——如果这条闭环跑通了，做模型就不再是一条只能靠人力堆的流水线。

## 它能用在哪（真实场景与数据）

先声明：下面这批数字来自千问团队官方发布页，不是第三方复现。看厂商自报数据，我习惯性先打个折——但即便打折，这些场景的方向感是明确的。

**场景一：会议，从"纪要"到"行动"**

官方 demo 是丢进去一小时会议录像，端到端完成**跨音视频说话人联合识别、分离、转写、身份对齐**，然后生成纪要、行动项、风险分析，**甚至直接调工具发邮件、派任务、开始写代码**。

以前这是三个模型的活（ASR + 视觉 + 文本摘要）加一段手写胶水代码，现在是一个 API 调用。AliMeeting 上 3.4 的 DER 如果能在你的会议室里复现个七成，会议工具这个赛道就得重算一遍成本结构。

**场景二：把视频变成资产**

* **Video2Note**：几小时的教程视频 → 带关键截图、时间戳、步骤说明的 **PDF 笔记**。
* **Omni Skill Creator**：一段操作录屏 → 一份可复用、可分享的 Agent **`Skill.md`**。这个我特别喜欢——**它把"老员工的肌肉记忆"变成了可版本管理的配置文件。**
* **omni-memory**：给长视频建立"谁在场、谁说了什么、怎么说的、当时什么声音"的音视频长期记忆。

**场景三：视频内容的工业化生产**

短剧出海、短剧解说、MV 这三类都属于"量大人贵"的苦活。官方给的例子是穆祉丞 Maschine AI 做音乐视频、红豆短剧做出海译制。价格端配合得很激进：**音频输入每小时 API 价格下降超 98%，音视频输入每小时下降超 93%**——这个降幅直接改写了"常开音频接口"的单位经济性。

**场景四：实时交互**

Realtime 变体上，官方给了两个有意思的场景：一是**实时口语陪练**，联合建模发音与语义，能理解口音和非标准表达并实时生成标准发音示范；二是**全模态空间音频感知**——结合空间声音（支持立体声与 FOA）和画面判断声源方向与距离，官方称其为**首个能通过声音定位目标的全模态模型**，用途是机器人"听到声音→定位→导航过去"。

## 初体验：怎么上手 Qwen3.8-Omni-Flash

**路径 A：直接调 API（最简单）**

模型已在千问 AI 平台（chat.qwen.ai）和阿里云百炼开放，兼容 OpenAI 风格接口：

```python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)

resp = client.chat.completions.create(
    model="qwen3.8-omni-flash",
    messages=[
        {"role": "system", "content": "You are a helpful assistant."},
        {"role": "user", "content": [
            {"type": "video_url", "video_url": {"url": "https://example.com/meeting.mp4"}},
            {"type": "text", "text": "请按发言人整理会议纪要，并列出行动项。"},
        ]},
    ],
    # 推理深度按需切换，成本立竿见影
    extra_body={"reasoning_effort": "medium"},
)
print(resp.choices[0].message.content)
```

想省钱就把 `reasoning_effort` 从默认的 `xhigh` 往下调 —— 简单活用 `low`，复杂任务才上 `xhigh`。

**路径 B：装插件，让现有 Agent 直接长出眼睛和耳朵（推荐）**

这条才是开源的部分。千问把配套工具链 **Qwen-MM-Plugins** 以 **Apache 2.0** 开源了，仓库维护得很勤（最近一次提交就在 9 月 18 日，并且已经把默认 Omni 模型切到 `qwen3.8-omni-flash`）。

```bash
# 一行脚本，交互式菜单选 Agent Harness 和插件
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash

# 后续更新已安装的能力
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash -s -- update
```

不想跑脚本的话，直接跟你的 Agent 说人话也行：

> Help me install the core, api, and omni-related plugins from https://github.com/QwenLM/Qwen-MM-Plugins.

**支持的 harness**：Claude Code、CodeBuddy、Codex、Qoder、OpenClaw、Qwen Code、Gemini CLI 等，另有 WorkBuddy、DeepSeek Harness、Hermes Agent、opencode 的手动适配文档。

每个能力以「Skill + 可选 MCP server」的形式独立安装，按需勾选：

| 插件 | 干什么 |
| --- | --- |
| `core` | 让主模型本地直读图片、视频帧、PDF、Office、代码、数据、3D/NIfTI 文件（**默认本地模式不需要 API Key**） |
| `api` | 图像理解、OCR、目标定位、音视频转写、说话人分离、事件分析、SAM3 分割 |
| `omni-chatcut` | MV 生成、长片影视解说、保留原音色的视频翻译 |
| `omni-video2note` | 教程视频 → 带插图的 PDF 笔记 |
| `omni-skill-creator` | 演示视频 → 可复用 Agent `Skill.md` |
| `omni-memory` | 长视频的音视频长期记忆 |

装完之后，直接在对话里引用文件就行：

```
@meeting.mp4        转写并标出说话人和时间戳。
@tutorial.mp4       生成一份带关键截图的 PDF 笔记，输出到 /absolute/path/tutorial-notes.pdf。
@weekly_report_sop.mp4   把这段写周报的录屏整理成一个 Skill.md。
@song.mp3           按这首歌的节奏和内容生成一支 MV。
```

依赖上，仓库用 `uv` 提供的 `uvx` 按需装 Python 依赖，视频和文档类工作流需要 ffmpeg；安装器自带 **Configure** 和 **Verify** 两个动作，先配置再自检，别跳过。

**路径 C：实时交互**

```bash
npm install -g qwen-live-harness
qwen-live-harness init
qwen-live-harness
```

## 进阶

现在来泼冷水，**这次必须先说最大的那盆**。

**第一，也是最关键的：Qwen3.8-Omni-Flash 没有开源权重。**

截至 2026 年 9 月 18 日，Hugging Face 的 Qwen 组织下**没有 Qwen3.8-Omni 仓库**，官方发布页也通篇没提开放权重；千问上一次放出 Omni 系权重还是 2025 年 9 月的 Qwen3-Omni-30B-A3B，此后 Omni 线一直是 API-only。**Omni 这条线，是千问明确选择留给自己的护城河。**

说得更直白些：这次发布里，**真正能下载、能改、能自建的是 Apache 2.0 的 Qwen-MM-Plugins 工具链，模型能力本身你得付费调 API。** 别看到"Qwen 开源"四个字就默认可以本地跑——这轮全然不同。

我理解这个选择（全模态模型的训练与推理成本摆在那儿），但作为开源社区站，我必须把这句话写在前面：**你可以信任它的能力，但你不能掌控它的存在。** 如果哪天它下线或涨价，你的全部业务跟着抖。

**第二，所有评测都是厂商自报。** 尤其是 AliMeeting 那个 88.11 → 3.35 的 DER 跳变，第三方尚未复现，有分析认为增益里相当一部分可能来自周边音频处理工程，而非纯模型能力。**换到你自己的会议室录音上跑一遍之前，别把它当既成事实。**

**第三，Agentic 取证的省 token 效果依赖 harness。** 官方数字是用 Qwen Code 跑出来的；换别的编排框架，省幅未必能复制。

**第四，这是同日发布。** 没有社区独立基准，没有生产规模的长跑报告。**新模型发布头两周的数据，永远要打折看。**

所以我的建议很具体：**先别做架构决策，先做一次校验。** 用 `core` 插件（它本地免费）打底，配一张最便宜的额度，把你自己手上那份"最难啃的长视频"丢进去——不是官方 demo 那种精修素材，而是光线差、有回声、四个人抢话的真实会议录像。**看它的发言人分离能不能顶住，这一个大考过了，其它分才有意义。**

退一步说，即便权重没放开，**Qwen-MM-Plugins 这套把"让 Agent 长眼睛长耳朵"工程化、标准化成 Skill + MCP 的做法，本身就已经把答案给你了**——它开源的那部分，正是你真正需要自己掌控的那部分。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
