
14 августа 2026 года, 15:00 UTC.
CEO Anthropic Дарио Амодей срочно созвал заседание. Экс-глава Apple Тим Кук пожалел, что встроил в айфоны облачную Gemini, так и не дождавшись локальной модели нужного уровня. Где-то в датацентрах Alibaba щёлкнул рубильник, на Hugging Face слетел обратный отсчёт, и в мир вышла Qwen3.8-27B — новая dense-модель на 27 миллиардов параметров, которую даже прозвали «локальным Opus’ом», поскольку она позиционируется как одно из самых мощных открытых решений для локальной генерации. Ждали её всем миром: обратный отсчёт на huggingface, первые пиксельные пеликаны на великах — всё как положено.
Если вкратце, это открытая (Apache 2.0) мультимодальная модель, которая понимает текст, картинки и видео, влезает в одну ооочень мощную домашнюю видеокарту, а временами по бенчмаркам обгоняет закрытые облачные модели уровня Claude Opus 4.6. Если не вкратце — читайте дальше, потому что там есть и триумф, и зависания на 49 минут раздумий!
Кто это вообще такой
Стоит сразу заметить, чтобы не путаться: что это не 8-миллиардная модель (как было в случае Qwen3-8B), и не гигантский Qwen3.8-Max на 2,4 триллиона параметров, который вышел днём раньше под отдельной лицензией. У 27B-модели ровно 27,78 млрд параметров, она плотная, то есть dense (это значит, не MoE — при инференсе работают все веса разом, а не «выбранные эксперты»), и весит около 55,6 ГБ в BF16 (веса кодированы в виде дробных чисел точностью 16 битов на число).
Архитектурно перед нами гибрид: 64 слоя, из которых только 16 — это классический full attention, а остальные 48 — линейные Gated DeltaNet слои. Схема выглядит так: 16 раз повторяется блок «3 слоя DeltaNet → FFN, затем 1 слой полного внимания → FFN», где на 48 голов приходится линейное внимание с V и 16 QK-головами, а полноценное внимание использует 24 головы Q и 4 KV-головы с размерностью 256. Звучит как абракадабра, практический смысл простой: у модели гигантский контекст в 262144 токена из коробки (и растягивается YaRN’ом до миллиона), а KV-кэш при этом не взрывается, потому что честный attention нужен только на каждом четвёртом слое.
Кстати: архитектурно Qwen3.8-27B полностью идентична предыдущей локальной модели подобного уровня – Qwen3.6-27B, а значит весь прирост способностей пришёл исключительно из улучшений обучения.
Бенчмарки
Сразу скажем, что включение Opus4.6 Max в качестве точки сравнения в официальной табличке восприняли как дерзкий жест.
В день релиза сама Alibaba не стеснялась праздновать открыто — вплоть до отдельного благодарственного поста, когда модель вышла в топ трендов на Hugging Face:

И действительно, таблица заставляет присвистнуть. Вот основные текстовые бенчмарки:
|
Бенчмарк |
Qwen3.8-27B |
Qwen3.6-27B |
Opus4.6 Max |
|---|---|---|---|
|
Terminal-Bench 2.1 |
73.0 |
63.4 |
78.2 |
|
SWE-bench Pro |
61.7 |
53.5 |
53.4 |
|
DeepSWE 1.1 |
42.2 |
13.3 |
— |
|
QwenSWEBench |
79.0 |
49.3 |
63.8 |
|
LiveCodeBench v6 |
90.3 |
83.9 |
88.8 |
|
GPQA Diamond |
89.2 |
87.8 |
91.3 |
|
HLE (Humanity’s Last Exam) |
30.8 |
24.0 |
40.0 |
А по мультимодальным и агентным задачам разрыв с предшественником вообще выглядит неприлично большим: OSWorld-Verified (компьютерное управление) вырос с 63.9 до 84.3, WebArena — с 48.8 до 64.8, SWE-MM — с 25.7 до 38.6. Модель затачивали не просто на болтовню в чате, а на работу агентом — с браузером, терминалом и интерфейсами.
Прирост над предыдущим поколением показывает вот такой график с разбивкой по категориям:

Аналитики Kingy.ai отметили несколько важных нюансов: во-первых, все цифры — это цифры от самой Qwen, и публичность задач не делает прогон вендора независимым. Во-вторых, сравнение по SWE-bench Pro не совсем честное: компания не гоняла модель Opus заново под тем же харнессом, а просто взяла её официально опубликованный результат, тогда как остальных участников таблицы прогнали через доработанный набор задач с исправленными багами (то есть в данной таблице квеновский SWE-bench Pro = число по собственноручно запущенным тестам, опусовский SWE-bench Pro = число взято из уже имевшихся из антропиковских бенчмарков). Ну и в-третьих: несколько бенчмарков (QwenSWEBench, CoWorkBench, RecreationBench) — это внутренние разработки Alibaba, для которых пока нет внешней проверяемости уровня зрелых публичных бенчмарков.
Собственно, именно эта горсть недоверия и стала темой нескольких жарковатых веток на форумах.
Пользователи отмечали также, что по умолчанию режим размышлений установлен на xhigh прямо в чат-шаблоне, из-за чего модель думает очень долго, что для обычного пользователя стало неожиданным по сравнению с версией 3.6 — и именно это накручивает метрики интеллекта, но не отражается в метриках вроде расхода токенов или времени вычислений. Тут, впрочем, надо признать: reasoning-эффорт действительно влияет на итоговый счёт, но и сами по себе улучшения Qwen3.6 остаются реальными и воспроизводимыми в разных источниках.
А вот ещё один независимый прогон — на Hugging Face прогнали модель против Nemotron 3.5 Lightning и Muse Glimmer* (* организация Meta является запрещённой в РФ) на 16 сложных задачах (математика, код, логика) на одной RTX 5090:


Итог получился неоднозначным, Qwen3.8-27B финишировал быстрее всех с большим отрывом и оказался единственной из трёх моделей, ни разу не упёршейся в потолок генерации в 32768 токенов — тогда как два других участника застревали суммарно трижды, и поднятие лимита до 60000 токенов не спасло ни один из этих прогонов. При этом сама модель ошиблась дважды — оба раза в математике, причём один раз даже сослалась на несуществующую последовательность в OEIS (Онлайн-энциклопедия целочисленных последовательностей) в подтверждение неверного ответа.
Overthinking: главная драма релиза
Если у Qwen3.8-27B и есть главная особенность — это патологическая склонность модели «пережёвывать» даже тривиальные запросы.
Простой промпт может спровоцировать пять тысяч токенов размышлений — при том, что все версии Qwen3.x были склонны к долгому обдумыванию с самокопанием, но эта модель, похоже, установила рекорд. И это ещё цветочки. Иногда модель (как это, впрочем, уже бывало с Qwen нередко) уходит в практически бесконечные размышления – после 49 минут ответа можно уже не ждать.
Даже на простое эссе о картошке, объемом 250 слов, модель может буквально вручную пересчитывать слова в черновике, ставят номер с каждым и проходясь по всем абзацам, лишь бы строго попасть в лимит.
Но кое-кто таки проанализировал тензоры GGUF-весов и вывел якобы структурный дефект в слоях temporal processing, подкрепив это наукообразной таблицей. Однако позже выяснилось, что заявленные «пятьдесят оттенков экспертизы» — это, по сути, наукообразная мистификация…
Проблема overthinking-а вполне реальна, просто причина куда прозаичнее любых «сломанных тензоров». Всё дело в том, что, как уже упоминалось, по умолчанию у модели включён режим мышления на уровне xhigh, предназначенный для сложных задач, а понизить его до medium или low можно только явным указанием — и далеко не все инструменты вроде LM Studio вообще выставляют для этого переключатель в интерфейсе. А вот у облачных моделях вроде Claude Sonnet 5 подобных проблем с бесконечным самокопанием практически не встречается.
Ещё пример: агенто о четырёх инструментах, которому задали простейший фактический вопрос про поддержку MTP, использовал около пятидесяти вызовов инструментов и потратила порядка 85 000 токенов контекста из 256 000 доступных, хотя для ответа было бы достаточно первых пяти вызовов.
Единственный предлагаемый рабочий рецепт — снижать reasoning_effort руками, хотя по факту даже на low модель порой продолжает зависать в цикле раздумий.
Галлюцинации
Они есть. Например, модель не может написать текстовую строку наоборот. В этом тревожном кейсе модель не сумела развернуть .DefaultCellStyle, галлюцинируя буквально с самого начала рассуждений. Qwen3.6-27B, кстати, тоже был хорош: на схожем тесте успех составил лишь около 33% случаев. При решении этой же «задачи» модель может вдруг ни с того ни с сего менять исходную строку на середине рассуждения — то на .DataGridViewCellStyle, то на .DataCellEditor, то есть попросту придумывает себе новый текст задания и с упоением решает уже его.

В целом пользователи крайне негативно удивлены поведением — у неё экстремальное количество галлюцинаций, некоторые всерьёз рассматривают откат на Qwen3.6-27B. Проблема проявляется даже на коротком контексте.
Также модель игнорирует пожелания пользователя и забывает инструкции, а при попытке исправить одну ошибку тут же порождает несколько новых, вдобавок забывая изначальный промпт.
Увы, локальная модель на 27 миллиардов параметров физически не дотягивает до уровня Claude или GPT с их триллионами параметров, обученных на несопоставимо больших объёмах данных. И это ощущается очень зримо, особенно на фактологии за пределами кода.
И всё-таки — пеликан на велосипеде
Нельзя обойтись без классического бенчмарка — нарисовать SVG-пеликана на велосипеде, руководствуясь исключительно редактированием PSD через блокнот текстовым кодингом графики.
Эта картинка сгенерирована с использованием IQ4_NL-квантованной модели от Unsloth, с одного захода без доработок. Получилось весьма достойно — заметно лучше, чем у большинства локальных моделей поколения полугодовой давности. Утверждают, что это один из лучших пеликанов, которого видели от локально запущенной модели: форма велосипеда правильная, клюв пеликана отличный, нормальный фон, по одной лапе с каждой (важно!) стороны велосипеда, что встречается очень редко. Ушло 21 минута и 22276 токенов размышлений на 3223 токена итогового результата.
Похоже, модель специально дообучалась на генерации SVG, причём не обязательно именно на промпте про пеликана, а скорее в рамках более общего этапа RL, где генерация SVG оценивалась более сильной vision-моделью-судьёй.
27B против облачных гигантов
Вот так выглядит Three.js-сцену затонувшей Атлантиды с храмом, колоннами, рыбами, водорослями, лучами света и 20-секундным пролётом камеры по единому промпту без правок – в Qwen3.8-27B и Claude Opus 4.6:
Результат Qwen, наверное, менее детальный, но сопоставимый.
Ещё немного воды – на этот раз от Grok 4.6. Рендеринг воды явно не сильная сторона Grok 4.6:
Оба в максимальном режиме размышлений. Как тебе такое, Илон Маск? Локальная модель оказалась убедительнее. Страшно представить, что будет с 35B-моделью.

Официального подтверждения от Alibaba на момент написания статьи так и не последовало – по-прежнему лишь 27B и 2.4T версии.
Термокамера, ватты и что нужно, чтобы это запустить
Официальные веса доступны в BF16 (~55,6 ГБ) и блочном FP8 (~30,9 ГБ), но большинство домашних пользователей воспользуется GGUF-квантами от Unsloth или аналогичных команд.
Вот таблица по реальным размерам файлов и тому, что для них нужно:
|
Квант |
Размер |
Практический дом |
|---|---|---|
|
UD-IQ2_XXS |
9,0 ГБ |
12 ГБ карты, заметная потеря качества |
|
UD-Q3_K_XL |
13,4 ГБ |
16 ГБ карты |
|
IQ4_XS |
15,7 ГБ |
16 ГБ, последний, что влезает целиком |
|
Q4_K_M |
17,1 ГБ |
24 ГБ карты — золотая середина |
|
Q6_K |
22,9 ГБ |
24 ГБ впритык, либо 32 ГБ |
|
Q8_0 |
29,0 ГБ |
32 ГБ или разбивка на две карты |
|
BF16 |
53,8 ГБ |
серверные карты или CPU с терпением |
Именно математика по KV-кешу решает, влезет ли нужный контекст. Поскольку honest attention работает только на 16 слоях из 64, каждый токен контекста стоит всего 64 КБ (а не 256 КБ, как у обычной dense-модели такого же размера). При 32K контекста это 2 ГБ, при 128K — уже 8 ГБ, а на полные 262K — 16,4 ГБ поверх весов. Именно гибридная архитектура и делает реалистичным окно в четверть миллиона токенов на одной домашней карте.
Уже в день релиза свою поддержку модели выкатила AMD — для владельцев Ryzen AI Max и видеокарт Radeon, зафиксировав до 24,5 токена в секунду на Ryzen AI Max+ 395 и до 51,8 токена в секунду на одиночной Radeon AI PRO R9700. (Для тех, кто хочет максимум производительности, мощный Qwen3.8 Max уже развёрнут в облачной версии.)

Быстрый гайд по запуску через llama.cpp:
llama-server -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \ --host 0.0.0.0 --port 8080 \ --fit off --gpu-layers all --gpu-layers-draft all \ --ctx-size 48000 \ --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \ --spec-type draft-mtp
Судя по отзывам, на RTX 5090 (32 ГБ VRAM), кванте UD-Q6_K_XL, контекст влезает только на 48000 токенов при скорости генерации 100 т/с, а на кванте UD-Q5_K_XL расширяется до 125000 токенов при скорости 120 т/с. На картах послабее — на RTX 4090 порядка 65 т/с при контексте в 260000 токенов.
Команда SGLang в день релиза отчиталась о результатах на потребительском железе:
-
206,1 т/с на одиночной RTX 5090 – NVFP4-версия, с включённой технологией оптимизации DSpark;
-
а также 38,28 токена в секунду – с включённой DGX Spark.
С одной стороны — реально измеримый прогресс над предыдущим поколением почти по всем метрикам, впечатляющая работа с компьютером и браузером, способность влезать на одну видеокарту с контекстом в сотни тысяч токенов. С другой — реальные проблемы с пережёвыванием простых задач по умолчанию, жалобы на галлюцинации по сравнению с предшественником, здоровая доля вендорского приукрашивания в официальных бенчмарках.
Qwen3.8-27B можно назвать одной из самых значимых локальных моделей года. Просто не забудьте выставить reasoning_effort на нужный уровень, если не хотите ждать сорок девять минут ответа на вопрос про автомойку.
ссылка на оригинал статьи https://habr.com/ru/articles/1071272/