据每日经济新闻 2026-09-24 早参报道,千问在 9 月 23 日发布 Qwen-Audio-3.1 系列语音模型,ASR 降幅约 95%、Realtime 约 85%、TTS 约 70%。千问官方的发布页是前端渲染的,正文取不到,这条只当线索。本文核验日期 2026-09-24,数字全部来自阿里云百炼的官方模型文档页与官方模型价格页,两处在本机都能打开并抽取正文。
能核到的是模型确实上了:官方「语音识别」列表里已经有 qwen-audio-3.1-asr-flash、-filetrans、-streaming、-message 四个新 ID,音频生成列表里有 qwen-audio-3.1-tts-next,语音合成一节有 qwen-audio-3.1-tts-flash,语音对话一节有 qwen-audio-3.1-realtime-plus。
价格页把「按秒」换成了「按 Token」
这次最要紧的变化是计费单位。官方价格页在识别部分逐条写明差别:qwen-audio-3.1-asr-flash「按输入和输出 Token 数分别计费」,qwen-audio-3.0-asr-flash「按输入音频的秒数计费,输出不计费」。同样格式的说明在流式和离线两档上重复出现。
| 模型(华北 2 北京) | 计费单位 | 上一代 | 3.1 |
|---|---|---|---|
| asr-flash | 上一代按输入秒数/3.1 按输入输出 Token | 0.00022 元/秒,输出不计费 | 输入 0.8 元、输出 2.7 元(每百万 Token) |
| asr-flash-filetrans | 同上 | 0.00022 元/秒 | 输入 0.8 元、输出 2.7 元 |
| asr-flash-streaming | 同上 | 0.00033 元/秒 | 输入 6 元、输出 4.5 元 |
| asr-flash-message | 新增档 | — | 输入 6 元、输出 4.5 元 |
免费额度也换了写法:3.1 这一代写「100 万 Token」,上一代 asr-flash 系列和 qwen3-asr-flash 系列写「36,000 秒(10 小时)」,量纲不同,谁多谁少不能直接看数字。合成线同样换了单位:qwen-audio-3.0-tts-flash 按输入字符计费、1 元/万字符,qwen-audio-3.1-tts-flash 改成按输入输出 Token 计费,输入 1.5 元、输出 12 元(每百万 Token)。
一秒音频折多少 Token,官方给了两个数
把降幅算成钱绕不开换算率。官方价格页在实时语音对话一节写「总 Token 数 = 音频时长(单位:秒)* 12.5,不足 1 秒按 1 秒计算」,在千问 Audio 一节写「每一秒钟的音频对应 25 个 Token」;识别那一节只写按 Token 计费,没给折算率。
用这两个率算同一件事,结果差出一截。按 25 Token/秒,1 秒音频是 0.000025 百万 Token,乘 0.8 元约 0.00002 元,对比上一代 0.00022 元/秒约降 91%;按 12.5 Token/秒则是 0.00001 元,约降 95%,而这里只算了输入侧,输出侧那 2.7 元还没进账。报道里的 95% 对应的是后一套折算率。
所以这类百分比要连同折算率一起看。把 95% 直接乘进上一年度的语音支出,得到的是一个乐观值。
Realtime 那一档,价格表上没动
报道里 Realtime 的 85% 有出处,但出处微妙。价格表上音频输入 6 元/百万 Token 属于 qwen-audio-3.0-realtime-flash;而 qwen-audio-3.1-realtime-plus 的四项单价是文本输入 5 元、音频输入 40 元、文本输出 40 元、音频输出 150 元,和 qwen-audio-3.0-realtime-plus 一字不差。40 降到 6,比例正好是 85%。
plus 与 flash 是两个档位,能力与价格都不同。3.1 在价格表里目前只有 plus 一档:本来用 realtime-plus 的,换到 3.1 单价不变,省不下钱,收益全在能力上;按 85% 下调了预算的,那是把换档当成了降价。
能力那一侧在文档页上:上下文 262,144 Token、最大输入 245,760、最大输出 16,384,支持声音复刻与联网搜索,默认音色换成 longanqian_v3.1,enable_search 与 Function Calling 不能同时开启,限流 RPM 60、TPM 100,000。
计费说明里有一条容易漏:用户输入的音频和文本、模型输出的文本都计入上下文,在后续每一轮里作为输入再计费一次,模型输出的音频只在输出时计一次、不进上下文。轮数越多,重复计费越重,官方原文也建议控制单次会话轮数或适时新开会话。
选型分档差 7.5 倍,先按音频长度挑
同样是识别,3.1 四档从 0.8 元到 6 元(每百万 Token),相差 7.5 倍。官方在非实时语音识别指南里给了取法:「5 分钟以内的短音频使用 Qwen3-ASR-Flash,超过 5 分钟的长音频使用 Qwen-Audio-3.1-ASR-Flash-Filetrans、Fun-ASR 或 Qwen3-ASR-Flash-Filetrans」。实时字幕与直播对应 streaming 档,也在 6 元这一级。
限制也影响接入方式:asr-flash 上下文 8192 Token,最大输入 7168、最大输出 1024,filetrans 与 streaming 最大输入 8192。限流上,3.1 的 asr-flash 文档标 RPM 600,上一代 qwen3-asr-flash 标 RPM 100,这一条对批量转写排队时间的影响比单价更直接。
qwen-audio-3.1-tts-next 是另一个品种,官方归进「音频生成」:输入是文本加参考音频,一次生成人声、音效与环境音。限制比语音合成紧——输入上限 3000 字符,单次生成上限播客 240 秒、其他场景 120 秒,参考音频最多 3 条、单条最长 30 秒且不超过 10 MB,并发上限只有 RPS 3。要放进批量流水线,先算的是并发。
该动的地方与不用动的地方
只有短音频转写、调用量在 600 RPM 以内的,3.1 的 0.8/2.7 这一档可以换,理由不只单价,还有上一代的 100 RPM 限流。已在用 realtime-plus 的,3.1 这一档价格没变,换不换取决于是否真需要 26 万 Token 上下文、声音复刻或联网搜索。做播客和长音频的,先评估 tts-next 的能力边界:RPS 3 意味着它适合按条生成,不适合并发批量。
先别做的也清楚:在拿不到自己真实 Token 账单之前,不要把 95% 这类降幅写进预算表。
两处没有核实。千问官方发布原文没有打开,发布时间与全线降幅口径目前只有媒体转述;TTS 一节官方没给字符到 Token 的折算规则,TTS 约 70% 这个数字本文无法用价格页复现。本月早些时候用同样的读法看过 Qwen3.8-Omni-Flash 的定价与限制,那里真正会改流程的也是限流与输出模态;上一篇 Claude Opus 5.5 的发布 出现过同一份材料里三个百分比量三个对象的情况。这一篇的结论落在同一处:先统一口径,再谈降了多少。
本文由 AIGEO.GURU 官网日更流程整理:资料核验、初稿撰写与编辑校对过程有 AI 参与,发布前按本站编辑标准逐项自查。文中价格、限流与规格数字均来自 2026-09-24 实际打开的阿里云百炼官方文档页与官方模型价格页。发布时间与全线降幅口径来自媒体转述,千问官方发布原文未打开。本站没有调用该系列模型、没有产生账单,也没有做语音效果测试;文中的成本推算为按官方折算率与单价计算的结果,分析部分属于 AIGEO.GURU 的判断。