阿里巴巴旗下 Qwen 团队近日发布新一代原生全模态模型 Qwen3.8-Omni-Flash,把音频、视频理解与 AI 智能体能力进一步拧到了一起。它支持文本、图像、音频和视频四种输入,并提供100万 Token 上下文窗口;与上一代 Qwen3.5-Omni-Plus 相比,官方称其在29项基准测试中的平均成绩提升超过25%。

这次最大的变化不是堆能力,而是处理方式:它不是把语音识别、图像识别简单拼接,而是从模型层面原生处理不同类型的信息。阿里的意图很明确——让模型不只是"看懂"或"听懂"音视频,还能在理解之后规划任务、调用工具、把活干完。

阿里发布 Qwen3.8-Omni-Flash:原生全模态、百万上下文,音频成本砍掉 98%

音频是它最锋利的一面。在 WildClawBench-MM 多模态工具调用测试中,Qwen3.8-Omni-Flash 拿下71.0分,Gemini3.8Flash 为58.9分;DailyOmni 上85.1对84.0;SpotSoundBench 上67.2对39.7;MMAU 上81.8对76.9,四局全胜。多说话人会议识别的进步更是夸张:AliMeeting 测试中,说话人错误率 DER 从上一代的88.11骤降到3.35,带说话人归属的词错误率 cpWER 从89.61降到17.18。不过它并非全面领先——AgenticVBench 上 Gemini3.8Flash 拿45.0分、Qwen 为36.8分,OmniGAIA 上则是78.6对74.0,部分视频理解测试里 Gemini 同样占优,所以"逼近 Gemini"主要体现在整体音频和音视频能力上。

真正可能改写使用方式的是价格。Qwen 称音频输入的估算成本每小时下降超过98%,音频加视频输入每小时下降超过93%——按官方口径,每小时成本以两分钟素材的处理价乘以30计算,视频按720p、每秒1帧输入。阿里云公布的国际区域定价为每百万 Token 输入0.15美元、命中缓存的输入 Token0.016美元、每百万输出 Token0.47美元,中国大陆及部分区域价格另有不同。

配合100万 Token 上下文窗口(最大输入接近99.2万,思考模式下约98.4万,最大输出13.1万),开发者可以把超大规模的音频或视频直接塞给模型,不用再频繁切片、抽帧、串多个模型。模型还能处理113种语言和方言的音频输入,支持双声道立体声和四声道空间音频分析,并提供函数调用、联网搜索和上下文缓存。

应用方向上,Qwen 团队这次主打"智能体交付":模型能分析长视频、定位关键内容,再调工具完成视频编辑、内容整理、会议总结和字幕生成。配套方面已公布面向多模态智能体开发的 Qwen-MM-Plugins,并计划推出 Qwen-Live-Harness。目前 Qwen3.8-Omni-Flash 通过阿里云百炼提供服务,覆盖北京、新加坡、中国香港、日本东京、德国法兰克福和美国弗吉尼亚等区域;模型本身未直接开放权重,此次主要开放配套的多模态插件和开发工具。

超过98% 的音频成本降幅一旦兑现,长时间会议录音、播客、直播和海量视频素材的自动分析将变得前所未有的便宜,Qwen 与 Google Gemini 在多模态赛道上的贴身缠斗,也会因此再升一级。