Switch language한국어
Back to the list

Qwen3.5-Omni learned to write code from spoken instructions and video without anyone training it to

TL;DR AI

Key summary

2 min read
  1. Alibaba released Qwen3.5-Omni, an omnimodal model that processes text, images, audio, and video.

  2. Qwen3.5-Omni-Plus claims state-of-the-art performance across benchmarks including 215 audio benchmarks, 215 audiovisual subtasks, five audio benchmarks, eight speech-recognition benchmarks, 156 language-specific translation tasks, and 43 language-specific recognition tasks.

  3. Reports say Omni-Plus outperforms Google's Gemini 3.1 Pro in overall audio comprehension, reasoning, recognition, translation, and dialog, while matching Gemini on overall audiovisual comprehension.

  4. Selected scores: audio comprehension (MMAU) 82.2 vs 81.1; music comprehension (RUL-MuchoMusic) 72.4 vs 59.6; VoiceBench dialog 93.1 vs 88.9.

  5. Speech recognition now covers 74 languages and 39 Chinese dialects (113 languages/dialects total); the previous Qwen3.5-Omni handled 11 languages and eight Chinese dialects.

Read the original