Пока все тестируют Qwen 3.8 27B, появилась новая модель от Alibaba с Qwen 4 архитектурой. Это не байт и не шутка: выпущенная пару дней назад новая мультимодальная MoE модель под названием Qwen3.8-Flash-Next является ранним архитектурным превью, используемым в будущей Qwen 4 [1].
Модель играет ту же роль, что и Qwen3-Next для Qwen3.5: гибридная конструкция Gated DeltaNet с Gated Attention, представленная тогда, с тех пор используется в сериях Qwen3.5, Qwen3.6, Qwen3.7 и Qwen3.8. Новая архитектура переосмысливает этот подход, давайте разбираться, что изменилось.
Что нового в архитектуре Qwen 4 (Qwen3.8-Flash-Next)
На базовом уровне это мультимодальная архитектура типа Mixture-of-Experts (MoE). Однако в отличие от привычных MoE, здесь применено несколько решений для эффективной локальной работы с большими контекстными окнами (262K нативно и 1M с YaRN):
-
Разделение общего и активного объема параметров
-
Общий объем модели: 125 млрд параметров основного MoE-графа + 51 млрд параметров N-gram таблиц + 4 млрд параметров головы MTP (Multi-Token Prediction).
-
Активные параметры на токен: всего 6B (512 маршрутизируемых экспертов, из которых активны 10 + 1 общий эксперт). То есть по вычислениям на токен модель сопоставима с компактными моделями на 6B, а по уровню знаний превосходит тяжелые 70B+ модели.
-
-
51B N-gram Embeddings (PLE) и офлоадинг в RAM/SSD
Одной из главных архитектурных новинок стало добавление отдельного слоя N-gram эмбеддингов размером 51B параметров. Рядом с основной моделью живет отдельная таблица на 20 млн записей (биграммы и триграммы). В предыдущей архитектуре число параметров и объем вычислений находились на одной оси (зависели друг от друга). N-gram память позволяет разделить эту зависимость.
N-gram слой не требует квадрирования или сложных матричных умножений, т.к. ключи в этой таблице являются детерминированными хешами от последней пары токенов. Позиции обращений рассчитываются заранее, поэтому всю эту таблицу (51B) незачем держать в видеопамяти.
Подойдет обычная оперативная память или SSD/NVMe, и нужные данные считываются с помощью асинхронного префетчинга через
mmapиз обычного SSD или системной памяти без потери точности, пока видеокарта будет считать остальное в самих экспертах. В итоге эта таблица работает как быстрая память большого объема для частых фраз и локальных паттернов языка. -
Гибридный механизм: GDN + QSA (Qwen Sparse Attention)
Слои Gated DeltaNet идентичны в обеих моделях (конфигурация голов и размерность сохранены). В Qwen 3.8 27B каждый такой слой задействует четыре KV-головы (Gated Attention): это обеспечивает высокую точность, однако вычислительные затраты и объем памяти растут линейно с увеличением контекста, что делает данный слой самым ресурсоемким в стеке.
В Qwen3.8-Flash-Next механизм Gated Attention заменен на Qwen Sparse Attention. Главное отличие нового подхода заключается в детализации отбора. Вместо оценки каждого отдельного токена в истории индексирующий модуль (MQA: 4 query-головы и 1 общая K-голова с размерностью 128) анализирует микроблоки токенов. После этого модель обращается к контексту (активирует внимание) в рамках фиксированного бюджета размером 512 блоков или 2048 токенов.
Таким образом, Gated DeltaNet эффективно запоминает, а QSA точно ищет: 36 слоев (из 48) сжимают историю в состояние фиксированного размера, 12 слоев делают точечный выборочный поиск по настоящей истории. Модель сама решает, сколько информации считывать из каждой ветки и сколько записывать обратно.
В модели 48 слоев:
-
36 слоев (3 из 4): используют Gated DeltaNet (GDN), линейный рекуррентный механизм, который сжимает историю в рекуррентное состояние фиксированного размера, предотвращая рост KV-кэша.
-
12 слоев (1 из 4): используют Qwen Sparse Attention (QSA). В отличие от классического Attention, QSA агрегирует последовательность в микроблоки и выбирает только наиболее релевантные области. Это дает до 8.6x прироста скорости Prefill на контекстах в 1 млн токенов.
-
-
Gated Residual (GR) и MTP
Gated Residual разделяет единый residual-поток на 4 ветки. Поэлементный динамический gate управляет чтением слоя, а единый скалярный gate управляет записью. Интересно то, что одна из этих веток берет на себя роль магистрали для сквозного переноса информации из начальных слоев в глубокие.
Это сохраняет стабильность обучения и емкость слоев неизменными. Вычислительный оверхед на инференсе минимален, в том числе благодаря хранению веток в формате FP8.
По MTP все просто: добавили один слой, обученный на нескольких шагах вперед. Получился готовый драфтер для спекулятивного декодирования, бесплатный буст скорости генерации, без потери точности. Что это такое, можно прочитать в другой моей статье [2]
Сравнение Qwen3.8-Flash-Next vs Qwen 3.8 27B
Для наглядности сравним новую архитектуру с недавно вышедшей моделью Qwen 3.8 27B [3].
|
Параметр / Характеристика |
Qwen 3.8 27B (Dense) |
Qwen3.8-Flash-Next (Qwen 4 MoE) |
|---|---|---|
|
Тип модели |
Плотная (Dense) |
MoE (Mixture of Experts) + N-gram |
|
Общие параметры |
27 млрд |
~180 млрд (125B MoE + 51B N-gram + 4B MTP) |
|
Активные параметры / токен |
27 млрд |
6 млрд |
|
Механизм внимания (Attention) |
GDN + Gated Attention (Full Attention) |
GDN + QSA (Sparse Micro-block Attention) |
|
N-gram память |
Отсутствует |
51B N-gram Embeddings (поддержка |
|
Residual-связи |
Одиночный поток |
4-поточный Gated Residual (GR) |
|
Нативный контекст |
262K |
262K (расширяемый до 1M) |
Сравнение в бенчмарках
Несмотря на то что Qwen3.8-Flash-Next использует всего 6B активных параметров на токен (в 4.5 раза меньше, чем Qwen 3.8 27B), архитектура Qwen 4 демонстрирует существенное превосходство в агентских задачах, кодинге и логике:
|
Бенчмарк |
Flash-Next (6B акт.) |
Qwen3.8-27B (dense) |
Улучшение |
|---|---|---|---|
|
DeepSWE 1.1 (агентский кодинг) |
58.7 |
42.2 |
+16,5 |
|
SWE-bench Pro |
62.5 |
61.7 |
+0,8 (партия) |
|
SWE-bench Multilingual |
81.0 |
73.8 |
+7,2 |
|
NL2Repo-Bench |
48.1 |
42.3 |
+5,8 |
|
CoWorkBench (in-house) |
73.9 |
70.7 |
+3,2 |
|
JobBench |
55.7 |
33.4 |
+22,3 |
|
Agents’ Last Exam (Score / Pass@1) |
51.2 / 24.3 |
42.9 / 20.4 |
+8,3 / +3,9 |
|
Toolathlon Verified (Pass@1) |
73.5 |
67.1 |
+6,4 |
|
IFBench |
81.3 |
79.5 |
+1,8 |
|
GPQA Diamond |
91.7 |
89.2 |
+2,5 |
|
HLE (GPT-4o judge) |
35.9 |
30.8 |
+5,1 |
|
LiveCodeBench v6 |
91.9 |
90.3 |
+1,6 |
Примечательно следующее: если Qwen 3.8 27B по тестам вплотную подбирается к Claude Opus 4.6, то превью новой архитектуры Qwen 4 обходит ее в большинстве тестов и вплотную подбирается к Claude Opus 4.8. Вполне возможно, что Qwen 4 на релизе начнет щупать Claude Fable 5 за мягкое.
Запуск 4-битной версии на 128 ГБ RAM со скоростью 20-30 tok/s
Благодаря тому, что N-gram слой можно выгружать в системную память ОЗУ или через mmap на SSD, требования к VRAM GPU кардинально снизились. Как отмечается в документации Unsloth [4], 4-битные квантованные версии (GGUF UD-Q4_K_XL и UD-IQ4_XS) позволяют использование на системах со 128 ГБ оперативной памяти (например, Mac Studio / MacBook Pro на Apple Silicon с Unified Memory или ПК/сервер со 128GB RAM).
При этом показатели работы при запуске через Unsloth / llama.cpp следующие:
-
Необходимый объем памяти: ~85-110 ГБ ОЗУ/Unified Memory для полной загрузки 4-битной квантовки.
-
Скорость генерации: около 20-30 токенов в секунду при инференсе, что является впечатляющим результатом для модели со 180B весов. У меня на 128GB RAM выдает 25-27 токенов в секунду, но видеокарта для получения такой скорости все равно нужна.
-
Интерактивный режим гибридного мышления (Hybrid Thinking): в Unsloth Desktop из коробки поддерживается переключение режимов
reasoning_effort(xhigh,medium,low,none), а также сохранность цепочки рассуждений (Preserve Thinking) между репликами диалога.
Итоги
Модель Qwen3.8-Flash-Next наглядно задает тренд на развертывание локального ИИ на обычных рабочих станциях со 128 ГБ оперативной памяти. Такой подход исключает затраты на дорогостоящие GPU-кластеры и сохраняет высокую скорость инференса до 30 токенов в секунду, а 6 миллиардов активных параметров гарантируют отличный баланс качества и быстродействия для работы локальных агентов.
Важно отметить, что Alibaba на сегодняшний день остается единственной компанией, предоставляющей в открытый доступ веса полного спектра моделей: от компактных решений меньше 1B до флагманов 100B+ параметров.
Линейка Qwen закрывает все актуальные задачи, объединяя классические рассуждающие LLM, мультимодальные и голосовые системы. Это позволяет бизнесу строить автономные on-premise ансамбли на базе инфраструктуры одного вендора с идеально совместимыми компонентами.
Такой подход открывает доступ к уникальным возможностям, включая каскадную маршрутизацию для удешевления инференса, бесшовное построение мультимодальных конвейеров и эффективную дистилляцию корпоративных знаний.
References
ссылка на оригинал статьи https://habr.com/ru/articles/1075526/