https://huggingface.co/Qwen/Qwen3.8-27B
Кратко:
-
Размер модели относительно небольшой, довольно быстро работает на карточках с 24 GB VRAM.
-
«Понимает» изображения и видео
-
по бенчмаркам — лучше чем Opus 4.6

Так как большинство используют llama.cpp для запуска, то кванты можно взять вот тут:
https://huggingface.co/unsloth/Qwen3.8-27B-GGUF
Поддерживается MTP (спекулятивное предсказание)
Я тестировал на RTX 5090 (32GB VRAM).
Квант UD-Q6_K_XL:
-
помещается контекст только 48k
-
скорость генерации: 100 т/с
Квант UD-Q5_K_XL:
-
помещается контекст только 128k
-
скорость генерации: 120 т/с
Команда для запуска:
llama-server \ -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \ --host 0.0.0.0 --port 8080 \ --fit off --gpu-layers all --gpu-layers-draft all \ --ctx-size 48000 --kv-unified \ --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \ --spec-type draft-mtp
Если вы запускаете на RTX 3090 / RTX 4090 (24GB VRAM), то вам надо будет брать квант поменьше.
ссылка на оригинал статьи https://habr.com/ru/articles/1070694/