Qwen 团队发布原生多模态模型 Qwen3.8-Omni-Flash
Qwen 团队发布原生多模态模型 Qwen3.8-Omni-Flash,面向跨文本、音频和视频的长程智能体任务训练,涵盖视频编辑以及长音频、长视频翻译。它采用 Qwen3.8-Next 的稀疏混合专家设计,上下文窗口为一百万 token。联合训练策略在保持文本性能的同时,把智能体能力迁移到音频和视频任务。
模型同时附带两个开源框架。Qwen-MM-Plugins 为现有智能体框架补充音频和视频支持,Qwen-Live-Harness 负责实时多模态交互,包括上下文与记忆管理、工具使用和子智能体委派。Qwen3.8-Omni 论文介绍了该模型。