Современные языковые модели обычно становятся способнее за счёт большего склада параметров и перемещения большего числа коробок ради каждого ответа. Qwen3.8-Flash-Next предлагает более странную схему: большой склад, маленькую активную бригаду и гигантский указатель фраз, который может жить в более дешёвой памяти.
Основная языковая модель содержит 125 миллиардов параметров и активирует около шести миллиардов на токен. N-gram-таблица embeddings на 51 миллиард параметров хранит закономерности, построенные из коротких последовательностей токенов, а модуль multi-token prediction примерно на четыре миллиарда параметров помогает эффективно предсказывать больше одного будущего токена. После округления файлы описывают около 180 миллиардов параметров. «6B активных» — это труд на один шаг, а не размер склада.
Внимание тоже гибридное. Большинство слоёв использует Gated DeltaNet — систему линейного внимания для эффективной передачи информации. Периодически Qwen Sparse Attention выбирает небольшие блоки релевантного предыдущего контекста вместо одинакового изучения каждого токена. Представьте чтение огромного юридического архива по указателю, который ведёт к нескольким вероятным полкам. Указатель сокращает ходьбу, но книги никуда не исчезают.
Независимый результат впечатляет. Artificial Analysis оценивает облачный вариант в 56 по Intelligence Index и измеряет генерацию примерно в 77 токенов в секунду. Qwen сообщает о сильных результатах в программировании, офисной работе и использовании инструментов, включая 62,5 в SWE-bench Pro и 73,9 во внутреннем CoWorkBench. Эти оценки описывают тщательно настроенные системы. Они не гарантируют, что сильно квантованная локальная сборка поведёт себя так же.
Локальный размер зависит от выбранной ступени. Официальный BF16 занимает примерно 360 ГБ в десятичных единицах, официальный FP8 — около 186 ГБ. Самые агрессивные GGUF Unsloth начинаются примерно с 72,5–75 ГБ — отчасти потому, что n-gram-таблица сохраняет более высокую точность, чем обещает простой лозунг «по одному биту на всё». Такая сборка может поместиться на Mac с большим объёмом памяти, сервере или необычной рабочей станции. В обычную видеокарту на 24 ГБ она не помещается, а для KV-кэша всё ещё нужно место.
Нативный контекст составляет 262 144 токена. Static YaRN может расширить его почти до миллиона, но Qwen предупреждает: постоянно включённое масштабирование способно снизить качество коротких промптов. Облачный продукт Qwen3.8-Flash по умолчанию включает контекст на миллион токенов и добавляет официальные инструменты. Этот SKU — близкий родственник, но не синоним. У него собственные цены API, кэши, доступность, ограничения и обновления.
Главная оговорка — лицензия. Qwen Community License 1.0 в целом разрешает использование и изменение, однако коммерческим бизнесам MaaS и «AI Work Assistant» нужна отдельная лицензия. Определение прямо охватывает независимых ассистентов для программирования и офисной продуктивности. Продукты с более чем 100 миллионами активных пользователей в месяц или месячной выручкой свыше $20 миллионов также должны заметно показывать название модели. Внутреннее использование может быть освобождено от этого требования, если третьи лица не получают модель, её возможности или результаты. Это не Apache 2.0.
Первые отчёты сообщества соответствуют и обещанию архитектуры, и её молодости. Операторы восхищаются возможностями на активный параметр и показывают полезную скорость на специализированных системах. Одновременно они сообщают об избыточных размышлениях, большом расходе контекста, ошибках нехватки памяти, загрязнении кэша и вычислительных ядрах (kernels), которым нужна самая новая среда выполнения. Artificial Analysis насчитала около 200 миллионов выходных токенов по всему индексу — почти вдвое больше медианы сравнения.
Поэтому Qwen3.8-Flash-Next не становится новым простым локальным выбором по умолчанию. Им остаётся Qwen3.8-27B, чьи четырёхбитные файлы помещаются примерно в класс 18 ГБ и распространяются по Apache 2.0. Flash-Next — ступень выше: увлекательный эксперимент для систем с большим объёмом RAM, способный приблизиться к передовому поведению без передового объёма активных вычислений. Используйте её, когда подходят ваше оборудование, терпение и лицензия, — а не только потому, что шесть миллиардов звучит скромно.