阿里最新推出了全新的全模态模型「Qwen3.8-Omni-Flash」,专注于音频和视频的处理,涵盖视频剪辑、MV及电影制作、视听摘要和实时对话等多种应用。该模型支持100万token的上下文窗口,显著提升全模态性能,同时保持与同类纯文本模型相当的文本处理能力。最令人瞩目的是其价格和性能的对比,在29项基准测试中,Qwen3.8-Omni-Flash的平均得分比其前代高出25%以上,然而音频处理的API价格降低了98%以上,音视频的处理成本也下降了93%以上,展现了模型提升与成本下降的强烈反差。
在多个基准测试中,这款新模型在音频与视频相关的任务上超越了Gemini 3.8 Flash。具体分数显示,Qwen3.8-Omni-Flash在WildClawBench-MM中获得71.0的成绩,比前代提升了36.5,UniClawBench也取得了69.6。其核心能力持续增强,长音频理解、音视频推理、字幕生成和多说话人识别等任务的表现也显著提升,相关得分分别为82.7、63.4、28.2和89.7。
此次发布的另一个亮点是语言支持,语音识别覆盖74种语言,语音生成则支持29种语言,包括中文、英语、日语、法语、德语等主要语言。目前Qwen3.8-Omni-Flash已在千问AI平台上线。
阿里强调,尽管模型本身取得了重要进展,系统层面的问题仍需重视。音频与视频是智能体进入实际生产场景的重要媒介,但同时也带来了新的系统挑战,如长格式音频和视频在多轮推理过程中的高存储和传输成本。现有的智能体系尚未全面支持这一需求。
为应对这些挑战,阿里扩展了Qwen-MM-Plugins,增加了对长音频和视频的按需感知与工具调用能力,并开源了Qwen-Live Harness智能体框架,旨在基于Qwen3.8-Omni-Flash-Realtime API进行更高效的任务执行。不过,截至目前,相关的GitHub页面仍无法访问。
总之,此次发布的价格和性能变化直接传达出全模态能力成本正在快速降低的信号,而阿里将目光投向了更为复杂的系统框架及运行时环境,期待在处理长音频和视频时实现真正的突破。
发表评论