Место #3 Локальный / приватный ИИ — ваш мозг, ваша машина, ваши правила
Alibaba (Qwen Team)

Qwen3.8-Flash-Next

Предварительный показ архитектуры Qwen4, которая хранит примерно 180B параметров, но активирует лишь 6B на токен. Она приносит мультимодальные возможности почти передового уровня на машины с большим объёмом RAM — если необычная лицензия подходит вашему продукту.

Обновлено 29 августа 2026 года Open WeightsQwen License125B MoE
Лучше всего для

Предварительный показ архитектуры Qwen4, которая хранит примерно 180B параметров, но активирует лишь 6B на токен. Она приносит мультимодальные возможности почти передового уровня на машины с большим объёмом RAM — если необычная лицензия подходит вашему продукту.

Почему он побеждает

Artificial Analysis оценивает облачный вариант в 56 по Intelligence Index и примерно в 77 токенов в секунду. Нативный контекст составляет 262K, агрессивные однобитные GGUF начинаются примерно с 72,5–75 ГБ, а огромную n-gram-таблицу можно держать вне дефицитной памяти ускорителя.

Обратите внимание

Открытый чекпойнт носит экспериментальный характер и не совпадает с облачным SKU Qwen3.8-Flash. Qwen Community License требует отдельной лицензии для коммерческих сервисов MaaS и рабочих ИИ-ассистентов, сильно сжатые версии (кванты) могут терять качество, а 75 ГБ всё равно намного больше памяти обычной потребительской видеокарты.

01

Что это на самом деле

Современные языковые модели обычно становятся способнее за счёт большего склада параметров и перемещения большего числа коробок ради каждого ответа. Qwen3.8-Flash-Next предлагает более странную схему: большой склад, маленькую активную бригаду и гигантский указатель фраз, который может жить в более дешёвой памяти.

Основная языковая модель содержит 125 миллиардов параметров и активирует около шести миллиардов на токен. N-gram-таблица embeddings на 51 миллиард параметров хранит закономерности, построенные из коротких последовательностей токенов, а модуль multi-token prediction примерно на четыре миллиарда параметров помогает эффективно предсказывать больше одного будущего токена. После округления файлы описывают около 180 миллиардов параметров. «6B активных» — это труд на один шаг, а не размер склада.

Внимание тоже гибридное. Большинство слоёв использует Gated DeltaNet — систему линейного внимания для эффективной передачи информации. Периодически Qwen Sparse Attention выбирает небольшие блоки релевантного предыдущего контекста вместо одинакового изучения каждого токена. Представьте чтение огромного юридического архива по указателю, который ведёт к нескольким вероятным полкам. Указатель сокращает ходьбу, но книги никуда не исчезают.

Независимый результат впечатляет. Artificial Analysis оценивает облачный вариант в 56 по Intelligence Index и измеряет генерацию примерно в 77 токенов в секунду. Qwen сообщает о сильных результатах в программировании, офисной работе и использовании инструментов, включая 62,5 в SWE-bench Pro и 73,9 во внутреннем CoWorkBench. Эти оценки описывают тщательно настроенные системы. Они не гарантируют, что сильно квантованная локальная сборка поведёт себя так же.

Локальный размер зависит от выбранной ступени. Официальный BF16 занимает примерно 360 ГБ в десятичных единицах, официальный FP8 — около 186 ГБ. Самые агрессивные GGUF Unsloth начинаются примерно с 72,5–75 ГБ — отчасти потому, что n-gram-таблица сохраняет более высокую точность, чем обещает простой лозунг «по одному биту на всё». Такая сборка может поместиться на Mac с большим объёмом памяти, сервере или необычной рабочей станции. В обычную видеокарту на 24 ГБ она не помещается, а для KV-кэша всё ещё нужно место.

Нативный контекст составляет 262 144 токена. Static YaRN может расширить его почти до миллиона, но Qwen предупреждает: постоянно включённое масштабирование способно снизить качество коротких промптов. Облачный продукт Qwen3.8-Flash по умолчанию включает контекст на миллион токенов и добавляет официальные инструменты. Этот SKU — близкий родственник, но не синоним. У него собственные цены API, кэши, доступность, ограничения и обновления.

Главная оговорка — лицензия. Qwen Community License 1.0 в целом разрешает использование и изменение, однако коммерческим бизнесам MaaS и «AI Work Assistant» нужна отдельная лицензия. Определение прямо охватывает независимых ассистентов для программирования и офисной продуктивности. Продукты с более чем 100 миллионами активных пользователей в месяц или месячной выручкой свыше $20 миллионов также должны заметно показывать название модели. Внутреннее использование может быть освобождено от этого требования, если третьи лица не получают модель, её возможности или результаты. Это не Apache 2.0.

Первые отчёты сообщества соответствуют и обещанию архитектуры, и её молодости. Операторы восхищаются возможностями на активный параметр и показывают полезную скорость на специализированных системах. Одновременно они сообщают об избыточных размышлениях, большом расходе контекста, ошибках нехватки памяти, загрязнении кэша и вычислительных ядрах (kernels), которым нужна самая новая среда выполнения. Artificial Analysis насчитала около 200 миллионов выходных токенов по всему индексу — почти вдвое больше медианы сравнения.

Поэтому Qwen3.8-Flash-Next не становится новым простым локальным выбором по умолчанию. Им остаётся Qwen3.8-27B, чьи четырёхбитные файлы помещаются примерно в класс 18 ГБ и распространяются по Apache 2.0. Flash-Next — ступень выше: увлекательный эксперимент для систем с большим объёмом RAM, способный приблизиться к передовому поведению без передового объёма активных вычислений. Используйте её, когда подходят ваше оборудование, терпение и лицензия, — а не только потому, что шесть миллиардов звучит скромно.

02

Сильные стороны и честные ограничения

Ключевые преимущества

  • Шесть активных миллиардов меняют уравнение вычислений: MoE на 125B направляет токен лишь к 10 экспертам и одному общему эксперту, а n-gram-таблица на 51B увеличивает память при сравнительно небольших вычислениях. Архитектура стремится дать высокие возможности, не активируя гигантскую модель на каждом шаге.
  • Независимо измеренные способности необычно высоки: Artificial Analysis присваивает Flash-Next 56 по Intelligence Index — лишь на один балл меньше GLM-5.3-Flash — и измеряет более быструю генерацию примерно в 77 токенов в секунду.
  • Мультимодальность и длинный контекст входят в основу: Чекпойнт принимает текст, изображения и видео, предлагает 262 144 нативных токена и может быть настроен почти на миллион с помощью static YaRN.
  • Экосистема развёртывания появилась быстро: Официальные или документированные пути охватывают Transformers, vLLM, SGLang, TokenSpeed, llama.cpp, MLX, пакеты Ollama и GGUF от Unsloth.

Честные ограничения

  • Лицензия может перекрыть самый очевидный коммерческий сценарий: Коммерческому MaaS либо независимому coding/office-бизнесу класса «AI Work Assistant» нужна отдельная лицензия Qwen. Для крупных продуктов также действуют требования к отображению названия модели.
  • Flash-Next — не облачная Flash: Qwen3.8-Flash представляет собой управляемый production-SKU с контекстом 1M по умолчанию и встроенными инструментами. Его цену, ограничения, надёжность и вывод нельзя незаметно приписывать каждому локальному чекпойнту.
  • Даже самый компактный квант требует много RAM: Около 72,5–75 ГБ покрывают агрессивную сборку в духе одного бита до учёта среды выполнения и памяти контекста. Официальный BF16 занимает примерно 360 ГБ в десятичных единицах, FP8 — около 186 ГБ.
  • Многословное рассуждение и молодые среды выполнения требуют надзора: Artificial Analysis наблюдала примерно 200M выходных токенов в своём индексе, а первые операторы сообщают об OOM, проблемах кэша, несовместимости вычислительных ядер (kernels) и качестве, чувствительном к конфигурации.
03

Результаты тестов

Artificial Analysis Intelligence Index — 56

Независимое тестирование облачного варианта ставит Flash-Next рядом с передовым краем открытых весов. Оно не устанавливает ту же оценку для локального кванта на 75 ГБ.

Скорость вывода — около 77 ток/с

В тестировании Artificial Analysis генерация быстрее GLM-5.3-Flash, хотя первый ответ приходит позже, потому что рассуждение и время до первого токена — разные величины.

GDPval-AA v2 — около 1743 Elo в проверенном снимке

Сильный сигнал по профессиональным задачам с доверительным интервалом и подвижной текущей шкалой. Указывайте дату и не выдавайте небольшую разницу за решительную победу.

SWE-bench Pro — 62,5 (запуск Qwen)

Сильное исправление репозиториев в уточнённом наборе задач Qwen и тестовой обвязке Claude Code. Из-за исправлений задач и тестовой среды результат нужно сопровождать источником, а не считать универсальной локальной оценкой.

OSWorld 2.0 — 19,4 binary / 52,3 partial (запуск Qwen)

Напоминание, что сильные результаты в программировании и офисных задачах не превращаются автоматически в полноценное управление компьютером: строгий бинарный результат остаётся скромным.

04

Вердикт

Qwen3.8-Flash-Next входит в категорию «Локальный / приватный ИИ» на 3-е место с оценкой 9,0. Qwen3.8-27B остаётся лучшим выбором по умолчанию для персональной машины на 1-м месте (#1), а GLM-5.3-Flash занимает 2-е место (#2) благодаря немного более сильным независимым результатам, нативному контексту 1M и чистым правам MIT. Flash-Next — интригующая средняя ступень: быстрее, требует намного меньше активных вычислений и с агрессивным квантованием может запускаться примерно от 75 ГБ. Выбирайте её для внутренних экспериментов и локальной работы на машинах с большим объёмом RAM, предварительно прочитав лицензию. Не стройте на ней коммерческого облачного ассистента для написания кода, пока Qwen не подтвердит ваш лицензионный путь, и не используйте результаты облачной Qwen3.8-Flash как доказательство качества непроверенного локального кванта.

05

Часто задаваемые вопросы