千问于18日上线新一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频与视频输入及1M 长上下文,已在千问 AI 平台开放体验。该模型在此前编程、文本知识工作与 GUI 操作等通用 Agentic 能力之上,着重拓展以音视频为核心的 Agentic 应用,覆盖视频剪辑、MV 创作、影视制作与解说、音视频转图文摘要及音视频对话等需综合处理多模态内容的工作流。

在累计30项评测中,其平均得分较上一代 Qwen3.5-Omni-Plus 提升超26%。音视频 Agent、Coding 与长程任务方面,WildClawBench-MM 提升36.5分,AgenticVBench 提升22.3分,UniClawBench 取得69.6分;基础能力上,LongAudioSpan 提升8.3分,OmniVideoBench 提升9.6分,OmniCap-IF 的 CSR/ISR 分别提升8.5/14.1分,AliMeeting 的 DER/cpWER 由88.11/89.61降至3.35/17.18。

官方称其音视频能力接近 Gemini3.8Flash,音频能力整体超过后者;API 每小时音频输入价格降幅超98%,音视频输入价格降幅超93%。
为支撑长程工作流与实时交互,千问扩展了 Qwen-MM-Plugins 并开源 Qwen-Live Harness。在 Agentic Understanding 模式下,OmniVideoBench 准确率由63.4升至67.8,Token 消耗从145,736降至79,117,降幅约45.7%。

团队还将模型推向研发环节本身:12小时内自主完成评测集选择、数据构建与4轮迭代,累计构建3,413条训练数据,将 Qwen2.5-Omni-3B 的四川话识别字符错误率从25.79% 降至15.30%,相对下降约40.7%。同步推出的 Realtime 版本为首个支持"听声辨位"的全模态大模型。
.png)
发评论,每天都得现金奖励!超多礼品等你来拿
登录 在评论区留言并审核通过后,即可获得现金奖励,奖励规则可见: 查看奖励规则