Возвращение короля: разбираемся, что такое Qwen3.8 27B

от автора

14 августа 2026 года, 15:00 UTC.

CEO Anthropic Дарио Амодей срочно созвал заседание. Экс-глава Apple Тим Кук пожалел, что встроил в айфоны облачную Gemini, так и не дождавшись локальной модели нужного уровня. Где-то в датацентрах Alibaba щёлкнул рубильник, на Hugging Face слетел обратный отсчёт, и в мир вышла Qwen3.8-27B — новая dense-модель на 27 миллиардов параметров, которую даже прозвали «локальным Opus’ом», поскольку она позиционируется как одно из самых мощных открытых решений для локальной генерации. Ждали её всем миром: обратный отсчёт на huggingface, первые пиксельные пеликаны на великах — всё как положено.

Обратный отсчёт до релиза модели на Hugging Face

Обратный отсчёт до релиза модели на Hugging Face

Если вкратце, это открытая (Apache 2.0) мультимодальная модель, которая понимает текст, картинки и видео, влезает в одну ооочень мощную домашнюю видеокарту, а временами по бенчмаркам обгоняет закрытые облачные модели уровня Claude Opus 4.6. Если не вкратце — читайте дальше, потому что там есть и триумф, и зависания на 49 минут раздумий!


Кто это вообще такой

Стоит сразу заметить, чтобы не путаться: что это не 8-миллиардная модель (как было в случае Qwen3-8B), и не гигантский Qwen3.8-Max на 2,4 триллиона параметров, который вышел днём раньше под отдельной лицензией. У 27B-модели ровно 27,78 млрд параметров, она плотная, то есть dense (это значит, не MoE — при инференсе работают все веса разом, а не «выбранные эксперты»), и весит около 55,6 ГБ в BF16 (веса кодированы в виде дробных чисел точностью 16 битов на число).

Архитектурно перед нами гибрид: 64 слоя, из которых только 16 — это классический full attention, а остальные 48 — линейные Gated DeltaNet слои. Схема выглядит так: 16 раз повторяется блок «3 слоя DeltaNet → FFN, затем 1 слой полного внимания → FFN», где на 48 голов приходится линейное внимание с V и 16 QK-головами, а полноценное внимание использует 24 головы Q и 4 KV-головы с размерностью 256. Звучит как абракадабра, практический смысл простой: у модели гигантский контекст в 262144 токена из коробки (и растягивается YaRN’ом до миллиона), а KV-кэш при этом не взрывается, потому что честный attention нужен только на каждом четвёртом слое.

Кстати: архитектурно Qwen3.8-27B полностью идентична предыдущей локальной модели подобного уровня – Qwen3.6-27B, а значит весь прирост способностей пришёл исключительно из улучшений обучения.

Бенчмарки

Анонс поддержки Qwen3.8-27B в LM Studio

* Muse Glimmer – продукт компании Meta, запрещённой в РФ

Сразу скажем, что включение Opus4.6 Max в качестве точки сравнения в официальной табличке восприняли как дерзкий жест.

В день релиза сама Alibaba не стеснялась праздновать открыто — вплоть до отдельного благодарственного поста, когда модель вышла в топ трендов на Hugging Face:

И действительно, таблица заставляет присвистнуть. Вот основные текстовые бенчмарки:

Бенчмарк

Qwen3.8-27B

Qwen3.6-27B

Opus4.6 Max

Terminal-Bench 2.1

73.0

63.4

78.2

SWE-bench Pro

61.7

53.5

53.4

DeepSWE 1.1

42.2

13.3

QwenSWEBench

79.0

49.3

63.8

LiveCodeBench v6

90.3

83.9

88.8

GPQA Diamond

89.2

87.8

91.3

HLE (Humanity’s Last Exam)

30.8

24.0

40.0

А по мультимодальным и агентным задачам разрыв с предшественником вообще выглядит неприлично большим: OSWorld-Verified (компьютерное управление) вырос с 63.9 до 84.3, WebArena — с 48.8 до 64.8, SWE-MM — с 25.7 до 38.6. Модель затачивали не просто на болтовню в чате, а на работу агентом — с браузером, терминалом и интерфейсами.

Прирост над предыдущим поколением показывает вот такой график с разбивкой по категориям:

Аналитики Kingy.ai отметили несколько важных нюансов: во-первых, все цифры — это цифры от самой Qwen, и публичность задач не делает прогон вендора независимым. Во-вторых, сравнение по SWE-bench Pro не совсем честное: компания не гоняла модель Opus заново под тем же харнессом, а просто взяла её официально опубликованный результат, тогда как остальных участников таблицы прогнали через доработанный набор задач с исправленными багами (то есть в данной таблице квеновский SWE-bench Pro = число по собственноручно запущенным тестам, опусовский SWE-bench Pro = число взято из уже имевшихся из антропиковских бенчмарков). Ну и в-третьих: несколько бенчмарков (QwenSWEBench, CoWorkBench, RecreationBench) — это внутренние разработки Alibaba, для которых пока нет внешней проверяемости уровня зрелых публичных бенчмарков.

Собственно, именно эта горсть недоверия и стала темой нескольких жарковатых веток на форумах.

Пользователи отмечали также, что по умолчанию режим размышлений установлен на xhigh прямо в чат-шаблоне, из-за чего модель думает очень долго, что для обычного пользователя стало неожиданным по сравнению с версией 3.6 — и именно это накручивает метрики интеллекта, но не отражается в метриках вроде расхода токенов или времени вычислений. Тут, впрочем, надо признать: reasoning-эффорт действительно влияет на итоговый счёт, но и сами по себе улучшения Qwen3.6 остаются реальными и воспроизводимыми в разных источниках.

А вот ещё один независимый прогон — на Hugging Face прогнали модель против Nemotron 3.5 Lightning и Muse Glimmer* (* организация Meta является запрещённой в РФ) на 16 сложных задачах (математика, код, логика) на одной RTX 5090:

Итог получился неоднозначным, Qwen3.8-27B финишировал быстрее всех с большим отрывом и оказался единственной из трёх моделей, ни разу не упёршейся в потолок генерации в 32768 токенов — тогда как два других участника застревали суммарно трижды, и поднятие лимита до 60000 токенов не спасло ни один из этих прогонов. При этом сама модель ошиблась дважды — оба раза в математике, причём один раз даже сослалась на несуществующую последовательность в OEIS (Онлайн-энциклопедия целочисленных последовательностей) в подтверждение неверного ответа.

Overthinking: главная драма релиза

Если у Qwen3.8-27B и есть главная особенность — это патологическая склонность модели «пережёвывать» даже тривиальные запросы.

Простой промпт может спровоцировать пять тысяч токенов размышлений — при том, что все версии Qwen3.x были склонны к долгому обдумыванию с самокопанием, но эта модель, похоже, установила рекорд. И это ещё цветочки. Иногда модель (как это, впрочем, уже бывало с Qwen нередко) уходит в практически бесконечные размышления – после 49 минут ответа можно уже не ждать.

Даже на простое эссе о картошке, объемом 250 слов, модель может буквально вручную пересчитывать слова в черновике, ставят номер с каждым и проходясь по всем абзацам, лишь бы строго попасть в лимит.

Но кое-кто таки проанализировал тензоры GGUF-весов и вывел якобы структурный дефект в слоях temporal processing, подкрепив это наукообразной таблицей. Однако позже выяснилось, что заявленные «пятьдесят оттенков экспертизы» — это, по сути, наукообразная мистификация…

Проблема overthinking-а вполне реальна, просто причина куда прозаичнее любых «сломанных тензоров». Всё дело в том, что, как уже упоминалось, по умолчанию у модели включён режим мышления на уровне xhigh, предназначенный для сложных задач, а понизить его до medium или low можно только явным указанием — и далеко не все инструменты вроде LM Studio вообще выставляют для этого переключатель в интерфейсе. А вот у облачных моделях вроде Claude Sonnet 5 подобных проблем с бесконечным самокопанием практически не встречается.

Ещё пример: агенто о четырёх инструментах, которому задали простейший фактический вопрос про поддержку MTP, использовал около пятидесяти вызовов инструментов и потратила порядка 85 000 токенов контекста из 256 000 доступных, хотя для ответа было бы достаточно первых пяти вызовов.

Единственный предлагаемый рабочий рецепт — снижать reasoning_effort руками, хотя по факту даже на low модель порой продолжает зависать в цикле раздумий.

Галлюцинации

Они есть. Например, модель не может написать текстовую строку наоборот. В этом тревожном кейсе модель не сумела развернуть .DefaultCellStyle, галлюцинируя буквально с самого начала рассуждений. Qwen3.6-27B, кстати, тоже был хорош: на схожем тесте успех составил лишь около 33% случаев. При решении этой же «задачи» модель может вдруг ни с того ни с сего менять исходную строку на середине рассуждения — то на .DataGridViewCellStyle, то на .DataCellEditor, то есть попросту придумывает себе новый текст задания и с упоением решает уже его.

Скриншот сравнения результатов на разных квантах модели по задаче реверса строки

В целом пользователи крайне негативно удивлены поведением — у неё экстремальное количество галлюцинаций, некоторые всерьёз рассматривают откат на Qwen3.6-27B. Проблема проявляется даже на коротком контексте.

Также модель игнорирует пожелания пользователя и забывает инструкции, а при попытке исправить одну ошибку тут же порождает несколько новых, вдобавок забывая изначальный промпт.

Увы, локальная модель на 27 миллиардов параметров физически не дотягивает до уровня Claude или GPT с их триллионами параметров, обученных на несопоставимо больших объёмах данных. И это ощущается очень зримо, особенно на фактологии за пределами кода.

И всё-таки — пеликан на велосипеде

Нельзя обойтись без классического бенчмарка — нарисовать SVG-пеликана на велосипеде, руководствуясь исключительно редактированием PSD через блокнот текстовым кодингом графики.

Пеликан на велосипеде в формате SVG, сгенерированный Qwen3.8-27B

Пеликан на велосипеде в формате SVG, сгенерированный Qwen3.8-27B

Эта картинка сгенерирована с использованием IQ4_NL-квантованной модели от Unsloth, с одного захода без доработок. Получилось весьма достойно — заметно лучше, чем у большинства локальных моделей поколения полугодовой давности. Утверждают, что это один из лучших пеликанов, которого видели от локально запущенной модели: форма велосипеда правильная, клюв пеликана отличный, нормальный фон, по одной лапе с каждой (важно!) стороны велосипеда, что встречается очень редко. Ушло 21 минута и 22276 токенов размышлений на 3223 токена итогового результата.

Похоже, модель специально дообучалась на генерации SVG, причём не обязательно именно на промпте про пеликана, а скорее в рамках более общего этапа RL, где генерация SVG оценивалась более сильной vision-моделью-судьёй.

27B против облачных гигантов

Вот так выглядит Three.js-сцену затонувшей Атлантиды с храмом, колоннами, рыбами, водорослями, лучами света и 20-секундным пролётом камеры по единому промпту без правок – в Qwen3.8-27B и Claude Opus 4.6:

Результат Qwen, наверное, менее детальный, но сопоставимый.

Ещё немного воды – на этот раз от Grok 4.6. Рендеринг воды явно не сильная сторона Grok 4.6:

Оба в максимальном режиме размышлений. Как тебе такое, Илон Маск? Локальная модель оказалась убедительнее. Страшно представить, что будет с 35B-моделью.

Официального подтверждения от Alibaba на момент написания статьи так и не последовало – по-прежнему лишь 27B и 2.4T версии.

Термокамера, ватты и что нужно, чтобы это запустить

Официальные веса доступны в BF16 (~55,6 ГБ) и блочном FP8 (~30,9 ГБ), но большинство домашних пользователей воспользуется GGUF-квантами от Unsloth или аналогичных команд.

Вот таблица по реальным размерам файлов и тому, что для них нужно:

Квант

Размер

Практический дом

UD-IQ2_XXS

9,0 ГБ

12 ГБ карты, заметная потеря качества

UD-Q3_K_XL

13,4 ГБ

16 ГБ карты

IQ4_XS

15,7 ГБ

16 ГБ, последний, что влезает целиком

Q4_K_M

17,1 ГБ

24 ГБ карты — золотая середина

Q6_K

22,9 ГБ

24 ГБ впритык, либо 32 ГБ

Q8_0

29,0 ГБ

32 ГБ или разбивка на две карты

BF16

53,8 ГБ

серверные карты или CPU с терпением

Именно математика по KV-кешу решает, влезет ли нужный контекст. Поскольку honest attention работает только на 16 слоях из 64, каждый токен контекста стоит всего 64 КБ (а не 256 КБ, как у обычной dense-модели такого же размера). При 32K контекста это 2 ГБ, при 128K — уже 8 ГБ, а на полные 262K — 16,4 ГБ поверх весов. Именно гибридная архитектура и делает реалистичным окно в четверть миллиона токенов на одной домашней карте.

Уже в день релиза свою поддержку модели выкатила AMD — для владельцев Ryzen AI Max и видеокарт Radeon, зафиксировав до 24,5 токена в секунду на Ryzen AI Max+ 395 и до 51,8 токена в секунду на одиночной Radeon AI PRO R9700. (Для тех, кто хочет максимум производительности, мощный Qwen3.8 Max уже развёрнут в облачной версии.)

Быстрый гайд по запуску через llama.cpp:

llama-server -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \  --host 0.0.0.0 --port 8080 \  --fit off --gpu-layers all --gpu-layers-draft all \  --ctx-size 48000 \  --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \  --spec-type draft-mtp

Судя по отзывам, на RTX 5090 (32 ГБ VRAM), кванте UD-Q6_K_XL, контекст влезает только на 48000 токенов при скорости генерации 100 т/с, а на кванте UD-Q5_K_XL расширяется до 125000 токенов при скорости 120 т/с. На картах послабее — на RTX 4090 порядка 65 т/с при контексте в 260000 токенов.

Команда SGLang в день релиза отчиталась о результатах на потребительском железе:

  • 206,1 т/с на одиночной RTX 5090 – NVFP4-версия, с включённой технологией оптимизации DSpark;

  • а также 38,28 токена в секунду – с включённой DGX Spark.


С одной стороны — реально измеримый прогресс над предыдущим поколением почти по всем метрикам, впечатляющая работа с компьютером и браузером, способность влезать на одну видеокарту с контекстом в сотни тысяч токенов. С другой — реальные проблемы с пережёвыванием простых задач по умолчанию, жалобы на галлюцинации по сравнению с предшественником, здоровая доля вендорского приукрашивания в официальных бенчмарках.

Qwen3.8-27B можно назвать одной из самых значимых локальных моделей года. Просто не забудьте выставить reasoning_effort на нужный уровень, если не хотите ждать сорок девять минут ответа на вопрос про автомойку.

ссылка на оригинал статьи https://habr.com/ru/articles/1071272/