Место #5 Повседневная экосистема — Ведущие ИИ-помощники
Alibaba / Qwen Team

Qwen3.8-Max

Qwen3.8-Max объединяет близкую к передовой модель с большой семьёй Qwen: чатом, глубоким исследованием, созданием изображений и видео, приложениями и API. Новый MoE-флагман Alibaba понимает текст, изображения и видео, имеет контекст 1M токенов и заметно дешевле самых дорогих передовых API. Max — это двигатель; Qwen Studio — мастерская вокруг него.

Обновлено 14 августа 2026 Multimodal1M ContextDeep Research
Лучше всего для

Qwen3.8-Max объединяет близкую к передовой модель с большой семьёй Qwen: чатом, глубоким исследованием, созданием изображений и видео, приложениями и API. Новый MoE-флагман Alibaba понимает текст, изображения и видео, имеет контекст 1M токенов и заметно дешевле самых дорогих передовых API. Max — это двигатель; Qwen Studio — мастерская вокруг него.

Почему он побеждает

У Qwen3.8-Max 2,4T параметров всего, 95B активных, контекст 1M и цена $2 за вход / $6 за выход на миллион токенов. Alibaba заявляет 93,0 в PaperBench, 82,8 в IFBench и 86,6 в Terminal Bench 2.1. Ранний снимок Frontend Code Arena ставит его на #4 с 1668 Elo; Qwen Studio добавляет исследование, инструменты изображений и видео.

Обратите внимание

Релиз совсем свежий. Большую таблицу тестов опубликовала сама Alibaba, ранние независимые тесты кода неоднозначны, а квоты и биллинг пока могут быть неудобными. Экосистема Qwen широка, но пока не так естественно встроена в привычные сервисы, как Google, Microsoft или OpenAI, особенно за пределами Азии.

01

Что это на самом деле

Qwen3.8-Max удобно представить как новый мощный двигатель в хорошо оснащённой мастерской. Двигатель — флагман Alibaba с 2,4 триллиона параметров, из которых на запрос активны 95 миллиардов. Мастерская — Qwen Studio с чатом, Deep Research, изображениями, видео и веб-артефактами. Для обычной задачи мастерская может значить почти столько же, сколько двигатель.

Сразу заметна цена: $2 за вход и $6 за выход на миллион токенов, кеш $0,25. Это даёт место для долгого анализа и второй проверки. Длинное рассуждение всё равно оплачивается как выход, поэтому не каждая задача дёшева. Но более дешёвая попытка позволяет проверять ответ, а не верить первой убедительной формулировке.

Модель рассматривает текст, изображения и видео в контексте до одного миллиона токенов. Стратегия, таблица, макет, скриншот панели и запись сломанного процесса могут лежать на одном столе. Это не идеальная память и не идеальное суждение, но исчезает часть неточных передач между исследованием и визуальной работой.

Результаты многообещающие, но не окончательные. Alibaba заявляет сильные показатели PaperBench, IFBench, OSWorld-Verified и Terminal Bench; ранний срез Frontend Code Arena ставит модель на #4 с 1668 Elo. Особенно интересны конкретные демонстрации автономной работы: по данным Alibaba, за 10–16 дней без надзора модель с пустой папки построила саморазвивающийся harness, сделала 265 коммитов, открыла 127 pull request и завела 151 issue. Компания также описывает конкурс мультимодальных диалогов, где точность выросла с 0,60 до 0,853 за 45 отправок, а также длительные симуляции проектирования чипов и электронной коммерции. Это отчёты Alibaba, не независимое подтверждение, но они хорошо показывают замысел команды: не один ответ, а длинная профессиональная цепочка работы.

Особая осторожность нужна в коде: 67,7 в SWE-bench Pro не выводит модель в лидеры по решению задач в реальных репозиториях, и первые баг-тесты разнятся. Красивый интерфейс и надёжное исправление старого проекта — разные умения. Поэтому Qwen3.8-Max заслуживает #5 как универсальная и экономная альтернатива: проверить его на ограниченной реальной задаче, перепроверить источники и дождаться независимых результатов.

Для повседневного выбора полезнее спросить не «самая ли это умная модель?», а «где сегодня теряется время?». Тот, кто постоянно переносит сведения между PDF, таблицами, скриншотами и короткими записями экрана, может выиграть от одной мультимодальной рабочей поверхности. Тот, чья работа уже живёт в Gmail, Google Docs, Outlook или корпоративной среде с настроенными правами, порой сэкономит больше времени со встроенным там помощником. Экосистема — это не только перечень функций, но и число передач работы между ними.

Демонстрации автономности стоит читать как кейсы, а не как обещание. Двести шестьдесят пять коммитов не доказывают, что каждый из них правильный, безопасный и пригодный для поддержки. Ценность в самом рисунке работы, который показывает Alibaba: разложить цель, применять инструменты, проверять результат и продолжать, не теряя контекста. Команде разумнее начать с небольшого обратимого процесса — исследования с источниками, прототипа или анализа по чек-листу — прежде чем отдавать агенту критическую задачу.

Есть и простое бытовое преимущество семейства Qwen: не обязательно заводить отдельный сервис для каждого шага. Можно начать с исследования, затем рассмотреть скриншот и подготовить черновик или визуальный материал в одном месте. Но удобство не должно превращаться в доверие вслепую: сохраняйте первоисточники, просите проверяемые ссылки и перепроверяйте выводы, от которых зависят деньги, репутация или важное решение.

С 14 августа первые веса Max действительно доступны. Загружаемый checkpoint работает с текстом, имеет нативный контекст 262 144 токена и расширяется примерно до 1,01M; хостируемый Max добавляет зрение, инструменты и миллион по умолчанию. 2,4T общих параметров всё равно требуют дата-центра, а коммерческие пороги лицензии нужно проверить до развёртывания.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Много флагманской мощности за доллар API: $2 за вход и $6 за выход на миллион токенов, кеш — $0,25; это примерно вдвое дешевле прежней выходной цены Kimi K3.
  • Модель видит не только текст: текст, изображения и видео с 1M токенов позволяют исследовать отчёт, скриншот, график и запись вместе.
  • Семейство Qwen — больше, чем чат: Qwen Studio объединяет Deep Research, веб-артефакты, генерацию изображений и видео, веб-, мобильные и настольные приложения.
  • Демонстрации автономной работы необычно конкретны: Alibaba сообщает о работе без надзора в течение 10–16 дней с пустой папки: модель построила саморазвивающийся harness, сделала 265 коммитов, открыла 127 pull request и завела 151 issue. Компания также сообщает о росте точности с 0,60 до 0,853 за 45 попыток в мультимодальном конкурсе. Это демонстрации Alibaba, но они показывают целевой масштаб профессиональной работы.
  • Первый фронтенд-сигнал конкурентен: в раннем срезе Frontend Code Arena — 1668 Elo (#4). Это полезный признак предпочтения интерфейса, не полный приговор инженерному качеству.
  • Переход от чата к продукту практичен: Qwen Studio и облако дают API, совместимые с OpenAI и Anthropic; агент не обязательно переписывать с нуля.

Честные ограничения

  • Главные цифры — данные производителя: harness, настройки и повторы меняют исход; таблица должна побудить к тесту, а не заменить его.
  • Решение задач в реальных репозиториях пока не стало явной победой: заявленные 67,7 в SWE-bench Pro уступают лучшим Claude, а ранние баг-тесты смешанные.
  • Широкий набор не означает встройку повсюду: Qwen Studio не живёт автоматически в Gmail, Office, календаре, браузере и корпоративных правах большинства людей.
  • 1M контекста — это ёмкость, не идеальная память: лишние страницы и расплывчатая цель всё ещё сбивают модель; большую работу следует делить.
  • Ранний доступ может быть шероховатым: пользователи сообщают о квотах, биллинге и скорости; сначала измерьте ограниченную задачу.
  • Открытый не значит маленький и безусловный: Qwen3.8-2.4T-A95B доступен на Hugging Face и ModelScope, но требует дата-центра. Лицензия вводит отображение имени и отдельное разрешение при крупных коммерческих порогах.
03

Результаты тестов

Frontend Code Arena — 1668 Elo (#4, ранний)

Ранний сигнал предпочтения готового фронтенда людьми; ранг ещё изменится.

PaperBench — 93,0 (данные Alibaba)

Заявленный производителем результат сложной исследовательской работы.

IFBench — 82,8 (данные Alibaba)

Сильное следование инструкциям по данным производителя.

Terminal Bench 2.1 — 86,6 (данные Alibaba)

Высокий результат терминального агента; различия harness важны.

SWE-bench Pro — 67,7 (данные Alibaba)

Достойный, но не лидерский результат ремонта.

04

Вердикт

Qwen3.8-Max заменяет Kimi K3 на #5 в Everyday Ecosystem: похожее раннее обещание передового уровня, меньшая стоимость и более широкая семья исследовательских и творческих инструментов. Он особенно интересен тем, кто чередует документы, визуальный ввод, исследование, изображения, видео и код. Место намеренно предварительное: широкие заявления ещё ждут независимой проверки, а повседневная интеграция не догнала лидеров. Проверяйте факты, код и важные результаты.

05

Часто задаваемые вопросы