跳到正文
模型专题 · Qwen Omni

一个模型,听懂、看懂,
思考并开口

Qwen3.5-Omni 是最新托管旗舰,Qwen3-Omni-30B-A3B 是最新开放权重。本文从一段视频通话出发,讲清声音和画面怎样进入同一个“大脑”,回答又怎样变成可实时播放的语音。

先记住

最新 API ≠ 最新开放权重。Qwen3.5 能力更新、综合上限更高,但拿不到 checkpoint;想私有化,应看 Qwen3。

文本、图像、视频与音频汇入双核心模型,再输出文本、语音和工具动作的概念总览
四种输入汇入共享上下文;Thinker 决定“说什么”,Talker 决定“怎么说”。
256K上下文
6.25 Hz音频表示
201文本语言/变体
113 → 36语音输入 → 输出
235 ms*Flash 内部理论首包
01 · 版本地图

先把名字摆正:Qwen Omni 有两条发布轨道

“最近发布的 Qwen 模型”不一定是 Omni;技术报告公开也不等于权重开放。版本选择要先问:你要的是云端上限,还是可控的私有化底座?

1

Qwen-Audio

先听懂,再输出文字

2

Qwen2-Audio

语音聊天 / 音频分析

3

Qwen2.5-Omni

首个完整开放 Thinker–Talker

4

Qwen3-Omni

MoE + 因果语音生成

5

Qwen3.5-Omni

GDN + ARIA + 256K

云端轨 最新能力

Qwen3.5-Omni

Plus / Flash / Realtime,Hybrid-Attention MoE、GDN、ARIA、256K。仅 API / 托管,未开放权重。

Qwen3.5-Omni-PlusFlashRealtime
开放轨 最新 checkpoint

Qwen3-Omni-30B-A3B

Instruct / Thinking / Captioner,Apache 2.0,可本地研究与部署。A3B 只表示每步激活量,不是只需加载 3B。

InstructThinkingCaptioner
三个容易踩的坑 qwen3-omni-flash API 不等于可下载的 Qwen3-Omni-30B-A3B Qwen3.5-Omni 不支持显式 Thinking mode 更晚的文本 / VL 型号,不会自动变成新的 Omni 型号
02 · 先看懂 Omni

传统助手在“接力”,Omni 在“共同理解”

两条路线都能做语音助手。差别不是有没有 ASR 或声码器,而是原始声音、画面与文本是否进入同一上下文并被协同训练。

传统级联 · 三次接力
用户语音
ASR只留下文字
LLM理解与回答
TTS重新配音

可能丢失 哭腔、语速、重音、环境声,以及 ASR 没转对的细节。

Omni · 一份共享上下文
文字画面声音视频
理解层Thinker“他说了什么、看到了什么、该怎么回答?”
文字 / 工具Talker → 语音

保留下来 内容与非文字线索能一起参与理解、推理和表达。

白话到底是什么?

把 Thinker 想成导演:它同时看台词、画面和现场收音,先判断正在发生什么。Talker 是配音演员:它拿到导演持续递来的文本和上下文,再决定音色、停顿、语速和情绪。两者在一个系统里配合,但内部仍然有编码器、语音 tokenizer 和波形解码器——“端到端”不等于“只有一块模型”。

能力边界:它能接收文本、图片、音频、视频,能输出文本和语音;不能生成图片或视频
03 · 完整架构

一段视频通话,怎样穿过 Qwen3.5-Omni

先压缩感知信号,再对齐到同一条时间轴;Thinker 负责理解和行动,只有需要开口时才进入 Talker 与语音 codec 链路。

Qwen3.5-Omni 数据流:文本、音频、图像、视频经编码与时间对齐进入 Thinker,再流向文本工具输出和 Talker、RVQ、MTP、Code2Wav 语音输出
主路径:感知 → 时间对齐 → Thinker;需要开口时,再走 Talker → RVQ → MTP → Code2Wav。 查看原图 ↗
01

AuT

声音速记员。把连续 16 kHz 音频压成每秒 6.25 个表示,让论文研究中的超长音频能进入上下文;这不等于 API 可直接接收十小时。

02

Thinker

理解与组织答案的大脑。它看到共享上下文,生成文本,也可以提出工具调用。

03

MoE

像专家委员会:每道题只请少数专家上场,降低每一步计算;但全体专家的权重仍需放在机器上。

04

Talker

配音演员。它不重新决定事实,而是把持续到来的内容变成带音色、节奏和情绪的语音码。

标准 Attention

每次都翻越来越厚的档案

历史越长,要读取的 KV Cache 越多。精确回看能力强,但长音视频的带宽和显存压力会增长。

+
Gated DeltaNet

持续维护一页紧凑笔记

用递推状态吸收一部分历史信息。Qwen3.5 是混合架构,仍保留 Attention,因此 KV Cache 没有消失。

进阶:Qwen3.5 怎么训练出这种统一能力?展开三阶段训练带
S1

Encoder Alignment

先冻结语言模型,把音频、视觉编码器接进共同语义空间。

S2

General Stage

解冻全参数,用约 4T 多模态 token 在 32K 长度上共同训练。

S3

Long Context

把最大长度扩到 262,144,并提高长音频、长视频比例。

报告称总体预训练使用超过 1 亿小时音视频材料;AuT 与 Talker 另有各自训练口径,数据可能重叠,不能简单相加。

04 · 长音视频与实时语音

为什么它能记更久,也能更快开口

秘诀不是单个“神奇模块”,而是三件事协同:感知 token 更稀疏、音画共用时钟、文本与语音自适应交错。

Qwen2.5、Qwen3 与 Qwen3.5 音频表示速率对比,以及音频、视频、文本时间戳在 160 毫秒时间轴上的对齐
同一段 10 秒音频,表示数量约从 250 降到 63;这是音频编码表示,不是完整 API token 数。 查看原图 ↗
为什么 6.25 Hz 很关键?

10 秒声音只产生约 63 个 AuT 表示,相当于把逐字速记换成每 160 ms 一张“声音摘要卡”。卡片越少,长会议的序列越短,prefill、显存和带宽压力越低。代价是每张卡要压进更多信息,所以需要更强的编码器和训练数据。

论文研究设置 · 模型能力超过 10 小时音频以及约 400 秒 720P 视频(1 FPS)
当前非实时 API · 服务限制约 3 小时音频 / 1 小时视频文件、地域与协议限制还会变化,接入以最新文档为准
ARIA 用文本与语音两种逻辑进度解释单一交错序列,以及 RVQ 主码、MTP 残差码、Code2Wav 到波形的数据流
ARIA 实际生成的是一条统一交错序列;图中拆成文本、语音两种逻辑进度,只为看清“演员不能跑到提词器前面”。 查看原图 ↗
RVQ先画声音轮廓

Talker 先预测当前声学帧的主码。

MTP再补音色细节

固定步数补齐同一帧的残差信息。

Code2Wav立即变成波形

因果 ConvNet 不等待未来帧,能边生成边播放。

真实用户延迟

235 / 435 ms 只覆盖中间一段,不是 SLA

报告的内部模型路径 业务还要测
01用户说话时长不定
02VAD / 端点未计入
03网络上传未计入
04模型内部Thinker → Talker
05同一首包指标Flash 235 / Plus 435 ms*
06下行 / 缓冲未计入
07用户听见端到端终点

* Flash 235 ms 与 Plus 435 ms 是两个型号对同一个“首个可播放音频包”指标的替代结果,不是先后两段、也不能相加。条件为单并发、音频输入、内部 vLLM + torch.compile + CUDA Graph;GPU、卡数、精度和网络拓扑未公开,Plus 与 Flash 的资源分配也不同。

Flash · 音频235 / 298 / 352 ms并发 1 / 4 / 8
Flash · 视频426 / 891 / 1,625 ms并发 1 / 4 / 8
Plus · 音频435 / 619 / 955 ms并发 1 / 4 / 8
Plus · 视频651 / 1,515 / 1,980 ms并发 1 / 4 / 8
05 · 三代演进

从“能听会说”,走到“长上下文可服务”

三代变化可以压缩成三条主线:感知表示越来越稀疏;语音渲染越来越因果;长上下文的计算与缓存进入架构中心。

Qwen2.5-Omni、Qwen3-Omni、Qwen3.5-Omni 在架构、音频速率、时间对齐、语音渲染与上下文上的演进
MoE 改的是 FFN 专家路径,GDN 改的是序列记忆路径;它们是两个不同维度。 查看原图 ↗
① 感知25 → 12.5 → 6.25 Hz

同样十分钟声音,进入 Thinker 的表示序列约缩到四分之一。

② 发声块式 DiT → 因果 Code2Wav

从“攒一块再渲染”变成“当前帧完成就能播放”。

③ 记忆Dense → MoE;Attention → Hybrid/GDN

一个减少激活计算,一个减少部分长上下文状态读写。

06 · 能力、成绩与边界

它很强,但不是所有音视频任务都领先

下面是 Qwen3.5-Omni 技术报告中的发布方自评,Qwen3.5-Omni-Plus 对比 Gemini 3.1 Pro。不同 benchmark 量纲不同,只能逐行比较,不能合成一个万能总分。

Qwen3.5-Omni-PlusGemini 3.1 Pro↑ 越高越好 · ↓ 越低越好

Qwen 更强

MMAU通用音频理解 · ↑
Qwen 高
VoiceBench语音对话 · ↑
Qwen 高
FLEURS WER多语种识别 · ↓
Qwen 低
DailyOmni日常音视频问答 · ↑
Qwen 高

仍有差距

MMAR音频推理 · ↑
对照高
WorldSense真实世界音视频 · ↑
对照高
VideoMME + audio含音轨视频问答 · ↑
对照高
OmniGAIA音视频工具使用 · ↑
对照高
官方结果怎么读

Plus 接近同代文本模型,但不能叫“无损”

MMLU-Pro 为 85.9 vs 文本 Qwen3.5-Plus 的 86.8;LongBench v2 为 59.6 vs 60.2;BFCL-v4 函数调用为 63.3 vs 66.1。Flash 与 Plus 之间也有明显差距。

独立预印本 · 2026-06

能听出情绪,不代表会据此安全行动

实时语音系统在哭泣、恐惧、讽刺等高后果场景中,仍可能按字面指令行动。情绪应成为独立风险信号,进入规则或人工复核。

查看研究 ↗
独立预印本 · 2026-05

语音工具调用接近文本,参数值仍最危险

Qwen3-Omni 在一项实验中的 text-to-voice gap 仅 1.8 分;但错误常集中在参数值,业务中可能表现为金额、姓名、地址等关键字段错误。

查看研究 ↗
07 · API 与私有化

部署先做选择题,再看显存和价格

最关键的分叉不是“哪个 benchmark 高”,而是数据能否上云、是否需要双向实时、是否必须输出语音,以及你能否承担完整多阶段系统的显存。

Qwen Omni 部署决策树:云端 Plus、Flash、Realtime 与私有化 Instruct、Thinking、Captioner 的选择
先按数据边界和交互方式分流,再在质量、成本与输出形态之间取舍。 查看原图 ↗
云端质量优先qwen3.5-omni-plus...-plus-2026-03-15

复杂音视频、长上下文、Agent;回归测试固定快照。

云端成本 / 并发qwen3.5-omni-flash...-flash-2026-03-15

先做基线;Realtime 使用对应 -realtime 型号。

私有化完整语音Qwen3-Omni-30B-A3B-InstructApache 2.0

文本 + 语音;优先 vLLM-Omni,预留多卡空间。

显存不是看 A3B 猜出来的

15 秒视频,Instruct 已接近 80 GB

下面是官方给出的 Transformers + BF16 + FlashAttention 2 理论最低。还没算生产批处理、碎片和框架余量。

Instruct 有 Talker,可输出语音 Thinking 无 Talker,只输出文本,省约 10 GB MoE 降低每步计算,不会让未激活权重消失
15s视频
78.85 GB
68.74 GB
30s视频
88.52 GB
77.79 GB
60s视频
107.74 GB
95.76 GB
120s视频
144.81 GB
131.65 GB
InstructThinking0                 150 GB
验证 / 研究

Transformers ≥ 5.2

功能最直观,但官方提示 MoE 路径可能很慢;适合单请求验证,不要未经压测直接 serving。

生产首选

vLLM-Omni

支持 Thinker → Talker → Code2Wav、OpenAI-compatible API 与 Realtime;可以把阶段拆到不同 GPU。

另一条工程路线

SGLang-Omni

独立于普通 SGLang,提供 text-only 与完整语音多阶段配置;按硬件 recipe 实测。

多模态 token 直觉计算器

持续音频会成为成本主体

拖动音频时长,看输入和同长度语音输出大约产生多少 token。图片约每 32×32 像素 1 token;视频还要另算抽帧后的视觉 token。

输入音频420≈ 秒数 × 7 token
同长度语音输出750≈ 秒数 × 12.5 token
2026-07-17 北京地域价格快照展开每百万 token 标准价

Qwen3.5-Omni-Plus

文字/图像/视频输入$0.96

音频输入$7.29

仅文本输出$5.50

音频输出 token$29.29

Qwen3.5-Omni-Flash

文字/图像/视频输入$0.30

音频输入$2.48

仅文本输出$1.83

音频输出 token$9.90

非实时 API、美元标准价;Realtime、国际地域、促销与专属部署另计。正式 TCO 应以真实日志中的四类 token 和并发为准。

08 · 真正上线

不要只部署一个模型 endpoint

Omni 同时接触摄像头、麦克风、工具权限与可仿真的声音。能力越集中,系统越需要把隐私、授权、执行和观测拆开。

01 · 接入麦克风 / 摄像头VAD · 编码 · 限流
02 · 隐私PII / 人脸 / 声纹用途与保留策略
03 · 模型Qwen Omni文本 · 语音 · 候选调用
04 · 执行策略引擎白名单 · Schema · 权限
05 · 出口工具 / 人工确认高风险二次认证
全链路观测:模态 token · TTFT · 首音频 · RTF · 参数修改 · 截断 · 重试 · 人工接管
画面 / 声音里的 Prompt Injection

内容不是授权

屏幕文字、字幕、背景人物、广播都可能夹带指令。任何 Function Calling 都要经过身份、权限、Schema、额度与幂等校验。

声音复刻

像不像,不等于有权使用

建立所有者授权与撤销、合成标识、水印、审计和异常生成检测;高风险场景强制固定系统音色。

情绪与胁迫

把感知结果变成独立风险信号

害怕、哭泣、讽刺、犹豫不应被模型自行解释成授权。涉及资金、身份、医疗时进入人工复核。

版本与可复现

记录的不只是 model name

固定 snapshot、地域、框架 commit、容器、抽帧率、缩放尺寸、VAD、上下文截断和实际执行参数。

阶段 1

离线能力基线

Flash、Plus、现有 ASR→LLM→TTS 同集对比;只生成候选工具调用。

阶段 2

实时与压力测试

真实 WebSocket/WebRTC + VAD;测并发、抖动、插话、P95/P99 和 RTF。

阶段 3

影子流量与受控执行

先 shadow,再开放低风险工具;高风险始终二次确认。

09 · 来源与透明度

哪些是官方事实,哪些还没有答案

本页优先使用 Qwen / Alibaba 官方报告、文档和框架一手资料;两项外部结果均标为 2026 年 arXiv 预印本。动态型号、价格与限制核查于 2026-07-17;价格文档最近更新于 2026-07-10。

Qwen3.5 仍未公开

Plus / Flash 精确参数与专家配置、Attention/GDN 层比例、延迟硬件与并行设置、真实 API P95/P99、完整数据授权与声音复刻防滥用机制。

Qwen3 开放部署仍要实测

专家负载与跨卡路由、长音视频退化曲线、完整语音链路的官方低比特 checkpoint,以及同硬件不同 serving 框架的可复现实测。

最终判断

Qwen3.5-Omni 是当前 Qwen 全模态能力与实时服务设计的集大成者,适合把云端能力上限跑清楚;Qwen3-Omni 是当前最有研究和私有化价值的开放权重,但应把它当成约 35B 的多阶段系统,而不是“一张卡能跑的 3B 小模型”。