Место #8 Повседневная экосистема — Ведущие ИИ-помощники
Alibaba / Qwen Team

Qwen3.8-Max

У Qwen3.8 теперь есть две важные версии: хост-продукт Qwen3.8-Max с функциями зрения, встроенными инструментами и контекстом по умолчанию на 1 миллион токенов, а также первый скачиваемый чекпойнт класса Max от Qwen. Открытая версия — это текстовая модель на 2,4 триллиона параметров в целом и 95 миллиардов активных, с нативным контекстом 262К, который можно расширить примерно до одного миллиона токенов.

Обновлено 30 августа 2026 г. Multimodal1M ContextDeep Research

Рейтинг обновлён Рейтинг в категории «Повседневная экосистема» пересматривался с момента последнего обновления этого обзора (30 августа 2026 г.). Место, указанное выше, всегда актуально. Сейчас № 1: Claude Opus 5.5

Лучше всего для

У Qwen3.8 теперь есть две важные версии: хост-продукт Qwen3.8-Max с функциями зрения, встроенными инструментами и контекстом по умолчанию на 1 миллион токенов, а также первый скачиваемый чекпойнт класса Max от Qwen. Открытая версия — это текстовая модель на 2,4 триллиона параметров в целом и 95 миллиардов активных, с нативным контекстом 262К, который можно расширить примерно до одного миллиона токенов.

Почему он побеждает

Qwen3.8-2.4T-A95B доступен на Hugging Face и ModelScope, с официальной поддержкой vLLM, SGLang и TokenSpeed. Alibaba заявляет о 93.0 на PaperBench и 86.6 на Terminal Bench 2.1. Хост-версия Max дополнительно предлагает ввод изображений/видео, режим без раздумий (non-thinking), встроенные инструменты, контекст 1М по умолчанию и стоимость API в размере $2/$6.

Обратите внимание

Это очень свежий релиз. Впечатляющая и обширная таблица бенчмарков предоставлена компанией Alibaba, а не независимой лабораторией; ранние независимые отчеты о возможностях программирования неоднозначны, а доступ, квоты и биллинг могут быть неудобными. Qwen становится все более целостной экосистемой, но ее интеграция с сервисами, которые уже используют многие читатели, по-прежнему менее бесшовная, чем у Google, Microsoft или OpenAI — особенно за пределами Азии.

01

Что это на самом деле

Qwen3.8-Max проще всего понимать как новый мощный двигатель, припаркованный в оживленной автомастерской. Двигатель — это флагманская модель Alibaba: дизайн разряженной смеси экспертов (sparse Mixture-of-Experts) с 2,4 триллионами параметров в сумме и 95 миллиардами активных на один запрос. Мастерская — это Qwen Studio, где этот двигатель соседствует с чатом, Глубоким Исследованием (Deep Research), генерацией изображений, генерацией видео и инструментами для создания веб-артефактов. Для обычного пользователя мастерская может иметь такое же значение, как и сам двигатель.

Ближайшая практическая привлекательность заключается в его ценности. Заявленный тариф QwenCloud составляет $2 за миллион токенов ввода и $6 за миллион токенов вывода, с кэшированным вводом по цене $0.25. Это не делает любую работу дешевой — долгие рассуждения тарифицируются как вывод — но это позволяет гораздо проще обосновать анализ с большим контекстом и многократные эксперименты, чем премиальные расценки абсолютных лидеров. Если Kimi K3 был способным универсалом, требовавшим тщательного контроля бюджета, то Qwen3.8-Max — это аналогично амбициозная альтернатива, которая оставляет больше места в бюджете для второй попытки и надлежащей проверки.

Она также спроектирована так, чтобы смотреть на проблему, а не просто читать о ней. Модель принимает текст, изображения и видео с контекстом до одного миллиона токенов. Представьте, что вы исследуете запуск продукта, и на одном столе у вас лежат стратегический документ, таблица, макет, скриншот панели управления и запись сбоя в рабочем процессе. Это не наделяет модель магической идеальной памятью или суждением, но устраняет несколько неудобных этапов перевода, которые обычно отделяют исследование от визуальной работы.

История семейства продуктов необычайно полезна для повседневной работы. Qwen Studio предлагает чат, Глубокое Исследование, генерацию изображений, генерацию видео и артефакты разработки. Скачиваемый чекпойнт не идентичен этому хост-продукту: он работает только с текстом, использует нативный контекст на 262К и может расширяться примерно до 1.01М; в то время как хост-версия Max добавляет зрение, поддержку режима без раздумий, встроенные инструменты и контекст 1М по умолчанию. Это различие предотвращает ситуацию, когда разрекламированная в карточке модели функция становится неприятным сюрпризом при развертывании.

Обещанный открытый релиз теперь стал реальностью. Qwen3.8-2.4T-A95B можно скачать с Hugging Face и ModelScope; у него 512 экспертов, из которых 10 маршрутизируемых плюс один общий эксперт активны на токен. Это все еще не модель для ноутбука: хранение и обслуживание 2,4 триллионов параметров — это проект масштаба дата-центра. Кастомная лицензия широка для обычного использования, но для очень крупных продуктов требуется указывать название модели, а крупным компаниям, предоставляющим услуги моделей или ИИ-помощников в кодинге/офисе, может понадобиться отдельная коммерческая лицензия.

Картина производительности многообещающая, но не полная. Alibaba сообщает об отличных результатах на PaperBench, IFBench, OSWorld-Verified, Terminal Bench 2.1, а также в обширной мультимодальной таблице. В первом срезе Frontend Code Arena модель Qwen3.8-Max занимает 4-е место с 1668 Elo. Еще интереснее то, что Alibaba описывает несколько необычайно конкретных демонстраций автономной работы: автономный запуск на 10–16 дней из пустой папки, в ходе которого была создана саморазвивающаяся тестовая среда, сделано 265 коммитов, открыто 127 пул-реквестов и залогировано 151 issue; мультимодальный конкурс намерений диалога, в котором точность выросла с 0.60 до 0.853 на 45 подачах; и длительные симуляции проектирования чипов и электронной коммерции. Это собственные отчеты Alibaba, а не независимая валидация, но они дают полезную картину профессиональной многоступенчатой работы, на которую нацелена команда. Независимой оценке еще предстоит выполнить медленную, немного скучную работу, которая делает рейтинги заслуживающими доверия.

Эта осторожность важнее всего в программировании. Заявленный результат Qwen в Terminal Bench силен, однако ее результат в 67.7 на SWE-bench Pro не ставит ее в один ряд с лидерами при решении проблем в реальных репозиториях. Несколько ранних практических тестов по исправлению багов также оказались неоднозначными. Бенчмарк может показать, что у модели есть мощный набор инструментов; но только повторяемый прогон на вашем собственном репозитории покажет, помнит ли она цель, использует ли правильные команды и исправляет ли баг, вместо того чтобы написать красиво объясненную новую ошибку.

Существуют и ограничения продукта. Доступность, квоты, биллинг и пропускная способность зависят от региона, а самостоятельный хостинг требует серьезной инфраструктуры и изучения лицензий. На данный момент Qwen3.8-Max получает 6-е место с оценкой 9.0, сразу за Grok 4.6. Используйте ее для ограниченной задачи, проверяйте ее факты и код, и позвольте независимым результатам — а не ажиотажу недели запуска — решать, станет ли она вашей моделью по умолчанию.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Огромные флагманские возможности за свою цену API: QwenCloud указывает цену в $2 за миллион токенов ввода и $6 за миллион токенов вывода, при этом кэшированный ввод стоит $0.25. Это примерно половина цены вывода Kimi K3 из предыдущего рейтинга и значительно ниже самых дорогих тарифов Claude, что делает серьезные эксперименты гораздо менее болезненными для бюджета.
  • Она может анализировать не только текст: Qwen3.8-Max нативно принимает текст, изображения и видео и имеет контекстное окно на 1 миллион токенов. Таким образом, длинный отчет, скриншот пользовательского интерфейса, диаграмма и короткая запись экрана могут стать частью одного исследования вместо того, чтобы разбиваться на отдельные передачи данных с потерей информации.
  • Семейство Qwen дает обычным пользователям нечто большее, чем просто чат-бот: Qwen Studio объединяет чат с Глубоким Исследованием (Deep Research), созданием веб-артефактов, генерацией изображений и видео, и доступна в веб-версии, а также на основных десктопных и мобильных платформах. Эти инструменты генеративных медиа являются продуктами семейства; не стоит путать это с утверждением, что только модель Max способна генерировать все эти форматы вывода.
  • Демонстрации автономной работы необычайно конкретны: Alibaba утверждает, что Qwen3.8-Max работал без присмотра в течение 10–16 дней начиная с пустой папки, создав саморазвивающуюся тестовую среду, которая сделала 265 коммитов, 127 пул-реквестов и 151 проблему (issue). Также сообщается о мультимодальном соревновании по определению намерений (intent challenge) с 45 подачами, в котором точность выросла с 0.60 до 0.853. Это демонстрации от вендора, но они показывают тип устойчивого профессионального рабочего процесса, на который нацелена Alibaba.
  • Ее первый публичный результат во фронтенде действительно конкурентоспособен: Frontend Code Arena ставит модель на 4 место с 1668 Elo в раннем срезе, с особенно сильными результатами в потребительских продуктах. Это не окончательный вердикт программированию, но это полезное доказательство того, что Qwen может создавать интерфейсы, которые нравятся людям.
  • Уровень Max наконец-то доступен для скачивания: Qwen3.8-2.4T-A95B доступен на Hugging Face и ModelScope с 2.4T общих / 95B активных параметров, нативным контекстом на 262 144 токенов и возможностью расширения примерно до 1.01M. В качестве совместимых сред исполнения (runtimes) названы vLLM, SGLang и TokenSpeed.

Честные ограничения

  • Воспринимайте главную таблицу бенчмарков как доказательства вендора, а не как установленный факт: Цифры Alibaba полезны, но многие сравнения используют тестовые среды и конфигурации, которые могут изменить результат. Независимые наборы тестов еще не догнали их полностью, поэтому заявления о PaperBench и Terminal Bench должны направлять ваше собственное тестирование, а не заменять его.
  • Решение проблем в реальных репозиториях — это пока не очевидная победа: Alibaba заявляет о 67.7 на SWE-bench Pro, что отстает от самых сильных результатов Claude, а ранние независимые отчеты по исправлению багов оказались намного слабее, чем в стартовой таблице. Для патча в продакшене прогоните одну и ту же проблему через Qwen и вашего текущего лидера, прежде чем менять модель по умолчанию.
  • Экосистема широка, но не внедрена повсеместно: У Qwen Studio есть привлекательное семейство инструментов, но оно не живет автоматически внутри Gmail, файлов Office, браузеров, календарей или корпоративных доступов большинства читателей. Охват и доступность сервисов Alibaba также могут быть более удобными в Азии, чем в других местах.
  • Окно контекста в 1 миллион — это емкость, а не идеальная память: Оно может вместить огромное количество материала, но нерелевантные страницы, размытые цели и факты, зарытые в середине, все равно могут сбить модель с толку. Разбейте крупные проекты на контрольные точки и держите исходные документы доступными для проверки.
  • Ранний доступ может быть немного шероховатым: Тестировщики сообщали о проблемах с квотами, биллингом и пропускной способностью (throughput), в то время как настройка модели на высокий уровень рассуждений может тратить значительное количество токенов вывода. Начните с ограниченной задачи и отслеживайте стоимость готового, проверенного результата — а не только заявленную цену за токен.
  • Открытость не означает отсутствие усилий или ограничений: Чекпойнт на 2.4T имеет масштабы дата-центра, даже если на токен активно 95B. Кастомная лицензия требует указания названия модели при превышении 100 миллионов ежемесячных пользователей или 20 миллионов долларов ежемесячного дохода, и отдельной лицензии для крупного модельного сервиса или ИИ-помощника в работе при годовом доходе свыше 50 миллионов долларов.
03

Результаты тестов

Frontend Code Arena — 1668 Elo (4-е место, рано)

Ранний сигнал человеческих предпочтений для готовой фронтенд-работы. Это обнадеживает, но рейтинг и Elo изменятся по мере поступления новых сравнений.

PaperBench — 93.0 (Заявлено Alibaba)

Результат, заявленный вендором, для сложной работы в исследовательском стиле. Он поддерживает амбиции модели, но не является независимой гарантией.

IFBench — 82.8 (Заявлено Alibaba)

Сильный показатель следования инструкциям, заявленный вендором; актуален, когда у задачи много ограничений и шагов.

Terminal Bench 2.1 — 86.6 (Заявлено Alibaba)

Высокий результат терминального агента, ниже упомянутой оценки GPT-5.6 Sol и выше нескольких конкурентов в таблице Alibaba; здесь играют роль различия в тестовой среде.

SWE-bench Pro — 67.7 (Заявлено Alibaba)

Достойная производительность в программной инженерии, но не лучший в категории результат по исправлению кода в репозиториях.

04

Вердикт

Qwen3.8-Max занимает 6-е место с откорректированной по формуле оценкой 9.0 в категории «Повседневная экосистема». Grok 4.6 обходит его, так как его 9.5 сочетает в себе более сильные независимые доказательства с более широким распространением готовых к использованию агентов. Qwen остается привлекательным для людей, перемещающихся между документами, визуальным вводом, исследованиями, изображениями, видео и программированием при более низких эксплуатационных расходах. Опробуйте его на ограниченной задаче и сохраняйте цитирование, тесты и проверку человеком в рабочем процессе.

05

Часто задаваемые вопросы