Что произошло
18 сентября 2026 года команда Qwen опубликовала в блоге анонс Qwen3.8-Omni-Flash, следующего поколения своей «всеядной» модели. Слово «omni» здесь означает, что одна модель работает с текстом, изображениями, звуком и видео без переключения между отдельными системами.
Модель доступна на платформе Alibaba Cloud с контекстным окном в 1 млн токенов, при этом качество работы с текстом, по словам разработчика, сопоставимо с чисто текстовой моделью того же размера.
Главные цифры из анонса: средний результат по 29 тестам вырос больше чем на 25% против Qwen3.5-Omni-Plus; цена часа аудио на входе по API снизилась больше чем на 98%, часа аудио с видео больше чем на 93%. В тестах на аудиовизуальных агентов, код и длинные задачи модель прибавила 36,5 балла на WildClawBench-MM и 22,3 балла на AgenticVBench, набрав 69,6 на UniClawBench.
По оценке разработчика, по совместной обработке звука и видео модель близка к Gemini 3.8 Flash, а по чистому звуку превосходит её.
Пересказ на русском с деталями вышел на 3DNews 19 сентября: распознавание речи поддерживает 74 языка и диалекта, синтез 29 языков.
Что такое контекст в 1 млн токенов и зачем он звуку и видео
Контекстное окно это объём, который модель держит в памяти за один запрос. Токен это единица текста размером в часть слова; для звука и видео токены получаются из секунд записи и кадров. Миллион токенов означает, что в один запрос помещается многочасовая запись совещания или длинное видео целиком, без нарезки на куски и потери связи между ними.
Подробно про то, как окно ограничивает нейросети и почему «больше» не всегда «лучше», мы писали в статье про контекстное окно нейросети.
Проблема больших записей в цене: обработать 3 часа видео покадрово это сотни тысяч токенов на каждый вопрос. Qwen3.8-Omni-Flash решает её «агентным пониманием»: модель отталкивается от вопроса, сама решает, какие участки смотреть и слушать, и сужает поиск за несколько проходов, не читая всё подряд.
В анонсе это показано на тесте OmniVideoBench: результат вырос с 63,4 до 67,8 балла, а расход токенов на запрос упал со 145 736 до 79 117, на 45,7%.
Что ещё выложено и как это использовать
Вместе с моделью команда расширила набор модулей Qwen-MM-Plugins для работы с долгими аудио и видео и открыла код Qwen-Live Harness: среды для непрерывного взаимодействия голосом и видео в реальном времени, с делегированием задач, памятью и управлением контекстом.
Для живого диалога есть отдельная версия Qwen3.8-Omni-Flash-Realtime, которая отвечает по ходу приёма потока и может вызывать инструменты прямо в разговоре.
Отдельно открыт модуль Video2Note: он превращает обучающее видео в структурированный конспект с ключевыми шагами, отобранными кадрами и выгрузкой в PDF. Для компаний с библиотекой видеоинструкций это готовый способ сделать из них текстовую базу знаний.
В анонсе есть и показательный эксперимент: модели дали 12 часов, чтобы улучшить распознавание сычуаньского диалекта у более компактной модели. Она сама отобрала тестовую выборку, замерила исходный результат, за 4 серии собрала 3 413 обучающих примеров и снизила долю ошибок в символах с 25,79% до 15,30%. То есть модель может не только пользоваться другими моделями, но и дообучать их.
Цифры и даты
| Что | Значение |
|---|---|
| Дата выхода | 18 сентября 2026 |
| Контекст | 1 млн токенов |
| Входы | текст, изображения, аудио, видео |
| Цена часа аудио по API | ниже на 98% против Qwen3.5-Omni-Plus |
| Цена часа аудио с видео | ниже на 93% |
| Средний прирост по 29 тестам | больше 25% |
| Языки | распознавание 74, синтез 29 |
| Экономия токенов при агентном просмотре видео | 45,7% на OmniVideoBench |
Что это значит для бизнеса
Первое: разбор звонков и встреч перестаёт быть выборочным. Когда час аудио дешевеет в 50 раз, можно прогонять через модель все звонки отдела продаж, а не 5% для контроля. Что даёт такой разбор и как его строить, мы описывали в статье про речевую аналитику; Qwen меняет в этой схеме только цену.
Второе: длинные записи можно не нарезать. Совещание на 3 часа или вебинар целиком помещаются в запрос, а ответ на вопрос «что решили по бюджету» находится по нужным минутам записи, без расхода токенов на остальное. Для расшифровки и протоколов это другой уровень удобства по сравнению с инструментами, которые разбирали в материале про расшифровку аудио в текст.
Третье: видеоинструкции превращаются в базу знаний. Video2Note делает из записи конспект с кадрами; для сервисных компаний, где обучение новичков живёт в видео, это способ получить текст для поиска и для ИИ-помощников.
Четвёртое: доступ и оплата. Модель живёт на платформе Alibaba Cloud, оплата по API требует зарубежного способа платежа; что из продуктов Qwen открывается из России и как это проверялось, разобрано в нашем обзоре Qwen. Цифры про цену и качество здесь пока по данным самого разработчика: независимых тестов на 21 сентября нет.
Что делать уже сейчас
- Собрать 3 записи, на которых вы бы проверяли модель: типовой звонок продаж, совещание на час и видеоинструкцию; заранее записать, какие ответы вы ждёте.
- Проверить доступ к платформе Alibaba Cloud и способ оплаты; если его нет, отложить внедрение и следить за появлением модели у посредников.
- Посчитать текущую стоимость расшифровки и разбора записей за месяц: это база, с которой сравнивать новую цену.
- Прогнать Video2Note на одной инструкции и оценить, годится ли конспект как основа для базы знаний.
- Для звонков отдела продаж составить список из 5 вопросов, которые модель должна отвечать по каждой записи, и проверить точность на 10 звонках руками.
Чего ждать
Alibaba выпускает модели Qwen сериями, и после Flash обычно появляются более крупные и более дешёвые версии, а также доступ через сторонние платформы. Реалистичный сценарий на осень: конкуренты ответят снижением цен на аудио и видео по API, а главным вопросом станет не качество, а то, у кого запись можно обработать целиком и дёшево. Независимые замеры цены и качества ожидаемы в ближайшие недели.
Частые вопросы
Это открытая модель, которую можно запустить у себя? Нет. Сама Qwen3.8-Omni-Flash доступна по API на платформе Alibaba Cloud; открыт код среды Qwen-Live Harness и модулей, включая Video2Note.
Понимает ли модель русскую речь? Русский есть в списке из 74 языков распознавания по данным разработчика. Качество на реальных звонках стоит проверить на своих записях.
Чем это отличается от расшифровки речи в текст? Расшифровка переводит звук в текст, а здесь модель отвечает на вопросы по записи, находит нужные фрагменты и работает с видео и звуком вместе, не превращая всё в текст заранее.
