阿里云百炼的模型文档页在 2026 年 9 月 18 日更新出了 qwen3.8-omni-flash,官方给出的一句话定位是「面向音视频理解和内容分析,支持文本、图片、音频、视频输入及文本输出」。上线当天,各家媒体把它写成「音视频 API 价格暴降超 90%」。Qwen 团队的发布材料我们这次没能打开——qwen.ai 的文章页是前端渲染的,取回来只有空文本——所以这篇只写能在官方文档里核对到的部分,并按文档自己给出的公式把那些百分比算一遍。

这次变化落在三处能核对的位置:单价、单次请求的时长上限、每分钟调用次数。至于「更懂音视频」这类说法,缺少能打开的一手材料,本文不用。另有一处变化方向和「升级」相反:新模型的输出只有文字,官方文档建议需要语音回复时仍用上一代 Qwen3.5-Omni。

文档里写明的规格

项目 值
输入模态 文本、图片、音频、视频
输出模态 文本
上下文长度 1M Token
最大输入(非思考模式) 991,808 Token
最大输入(思考模式) 983,616 Token
最大输出 131,072 Token
可用地域 华北2(北京)、新加坡、中国香港、东京、法兰克福、弗吉尼亚
音频输入语种 113 种语言和方言
深度思考 默认开启
输入单价(中国内地) 0.8 元/百万 Token
缓存命中输入 0.1 元/百万 Token
输出单价 2.7 元/百万 Token

有两点先记下来。一是「1M 上下文」是三档数字,思考模式下的最大输入比非思考模式少 8,192 个 token,而深度思考默认就是开着的。二是缓存命中价 0.1 元是输入价的八分之一,而上一代的价格表里没有缓存命中这一列,新模型支持自动生效的隐式缓存。同一段长素材反复分析时,这一行的差别会比单价本身更明显。

两小时的上限,和背后固定的 2048 帧

文档把单次视频输入的时长上限写成 2 小时(上一代 Qwen3.5-Omni 系列是 1 小时),音频上限 3 小时(与上一代相同)。这个数字容易被读成「更长的材料都能处理」,但决定能看清多细的是另一组参数:抽帧目标是每秒 2 帧,同时单次最多抽 2048 帧。两个约束叠在一起,视频时长一旦超过约 1024 秒(2048 帧 ÷ 2 帧每秒,约 17 分钟),实际抽到的帧数就固定在 2048 帧。

按文档给出的抽帧与缩放参数(图像因子 32、总像素预算 180224×32×32、每帧像素上限 640×32×32)算,两档时长的结果是这样。口径是 16:9、源 30fps、带音轨的视频:

视频时长 实际抽帧 平均取帧间隔 视觉部分 Token 音频部分 Token 合计
1 小时 2048 帧 约 1.76 秒 156,674 25,200 181,874
2 小时 2048 帧 约 3.52 秒 156,674 50,400 207,074

两行的视觉 token 完全一样,因为都撞上了帧数上限。时长翻倍多出来的量全在音频轨道上——音频按秒计费,每秒 7 个 token,线性增长。

对使用者的影响很具体:一份两小时的会议录像,如果关键结论出现在其中三分钟,默认抽帧只会在这三分钟里取到五十来帧。文档自己也写了对应的提示,帧率越高处理成本越高,应按需设置。要抓细节,仍得在切片或提高帧率上做取舍——按下面的价格算,这个取舍的成本压力比上一代低了一个量级,剩下的主要约束变成抽帧精度(此句为 AIGEO.GURU 的判断)。

那些百分比能不能自己算出来

先说价格表本身的对照。新模型在中国内地是一口价:输入 0.8 元、缓存命中 0.1 元、输出 2.7 元(每百万 token)。上一代 Qwen3.5-Omni-Plus 在同一张表里分成四列:文本/图片/视频输入 7 元、音频输入 53 元、多模态输入下的文本输出 40 元、文本加音频输出 213 元。

两代可以直接比,是因为换算规则一致。文档写明「Qwen3.8-Omni-Flash 与 Qwen3.5-Omni 使用相同的计算方法和模型参数」,音频输入两代都是每秒 7 个 token。按这个口径推算:

场景(中国内地价区) 新模型 上一代按对应模态单价 降幅
1 小时纯音频输入 0.0202 元 1.3356 元 98.5%
1 小时含音轨视频输入 0.1455 元 2.4323 元 94.0%
输出单价(每百万 Token) 2.7 元 40 元 93.3%

「音频每小时降超 98%」和「音视频降超 93%」两个说法,用文档里的单价和公式都能复现出来。这里要留一个边界:转述之间本身就不一致,另有媒体把音视频的降幅写成约 89%,两种数字同时流传;本文给的是自己算的结果,算法与假设都写在前面,可以照着核。另外,降幅覆盖的是输入侧单价,思考模式默认开启,思考过程和回答都在输出侧计费,真实账单要按控制台看。

限流那一行比价格更容易被忽略

上一代 Qwen3.5-Omni-Plus 在华北2(北京)的限流是每分钟 60 次调用、每分钟 10 万 token。新模型在同一个地域写的是每分钟 30,000 次,token 上限标为动态限流;中国香港、东京、法兰克福、弗吉尼亚四地是每分钟 30,000 次、200 万 token。调用次数差了 500 倍。

只看单价容易得出「变便宜了」,但 60 次/分钟的上一代基本只能串行跑小批量或做演示。如果你的流程本来就卡在并发上,这一行的变化比单价更直接。限流页还有一句,用 Batch API 调用服务时不受限流限制。

它不做的事:开口说话

文档在「多模态组合输入」里给了一条工作流建议:文本分析使用 Qwen3.8-Omni-Flash,语音输出使用 Qwen3.5-Omni;另一处写得更直白,需要直接生成语音回复时,可选择 Qwen3.5-Omni。上一代的定位是「支持音视频理解、语音回复及音频控制」,价格表里也留了文本加音频输出一列。新模型的输出模态只有文本。

这次上线并没有把上一代整体替换掉。要让「看懂音视频」和「开口回应」同时留在一条流程里,就得挂两个模型,按环节分别调用。做语音助手、口语陪练、实时对话的场景,新模型能接的是其中的分析环节;语音实时方向另有单独的产品线(同日上线的 Qwen3.8-LiveTranslate-Flash-Realtime 走 WebSocket 实时通道),与这里的批量分析不是同一类用法。

核对时最容易看错的三处

第一处是上下文那个「1M」,要拆成三个数看:最大输入 991,808(非思考)或 983,616(思考),最大输出 131,072。

第二处是时长口径。有转述写「最长 1 小时连续音视频输入」,官方文档写的是视频 2 小时、音频 3 小时。这类差异只能回官方文档确认。

第三处是能力评测数字。发布材料里流传的「约 30 项评测平均提升超 26%」「会议转写说话人错误率从 88.11 降到 3.35」等说法,在官方文档里没有对应表格,本机也取不到 Qwen 官方博客正文,所以本文一条都不引用。要判断这套能力在自己场景里管不管用,只能拿自己的素材测。

落到执行上,可做的一件事是:把手头需要切片、抽帧或转写的流程拿出来,按上面的公式估一次成本,再拿一份真实素材跑一次,看模型能不能在长材料里定位到你关心的那几分钟。价格已经不是主要门槛,能不能定位到细节才是。

本文由 AIGEO.GURU 官网日更流程整理:资料核验、初稿撰写与编辑校对过程有 AI 参与,发布前按本站编辑标准逐项自查。文中价格、上限、限流与换算公式均来自 2026-09-20 实际打开的阿里云百炼官方文档页;成本数字是本站按官方公式自行推算,不是账单实测;分析与判断部分属于 AIGEO.GURU。本站没有调用该模型,没有做音视频理解效果测试,也没有联系阿里云核实其发布材料中的评测数据。