QwenチームがネイティブマルチモーダルのQwen3.8-Omni-Flashを発表
Qwenチームは、テキスト、音声、動画にわたる長期的なエージェントタスク向けに学習したネイティブマルチモーダルモデル、Qwen3.8-Omni-Flashを発表した。対象には動画編集と長尺の音声・動画翻訳が含まれる。Qwen3.8-NextのスパースMixture-of-Experts設計と100万トークンのコンテキストウィンドウを用い、共同学習戦略によってテキスト性能を維持しつつ、エージェントの技能を音声と動画のタスクへ引き継ぐ。
モデルにはオープンソースのフレームワークが2つ付属する。Qwen-MM-Pluginsは既存のエージェントハーネスに音声と動画の対応を追加し、Qwen-Live-Harnessはコンテキストとメモリの管理、ツール利用、サブエージェントへの委任を備えたリアルタイムのマルチモーダル対話を扱う。Qwen3.8-Omni論文がこのモデルを扱っている。