Qwen 3.8 27B: лучше чем Opus 4.6

от автора

https://huggingface.co/Qwen/Qwen3.8-27B

Кратко:

  • Размер модели относительно небольшой, довольно быстро работает на карточках с 24 GB VRAM.

  • «Понимает» изображения и видео

  • по бенчмаркам — лучше чем Opus 4.6

Так как большинство используют llama.cpp для запуска, то кванты можно взять вот тут:

https://huggingface.co/unsloth/Qwen3.8-27B-GGUF

Поддерживается MTP (спекулятивное предсказание)

Я тестировал на RTX 5090 (32GB VRAM).

Квант UD-Q6_K_XL:

  • помещается контекст только 48k

  • скорость генерации: 100 т/с

Квант UD-Q5_K_XL:

  • помещается контекст только 128k

  • скорость генерации: 120 т/с

Команда для запуска:

llama-server \ -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K_XL \ --host 0.0.0.0  --port 8080 \ --fit off --gpu-layers all --gpu-layers-draft all \ --ctx-size 48000 --kv-unified \ --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \ --spec-type draft-mtp

Если вы запускаете на RTX 3090 / RTX 4090 (24GB VRAM), то вам надо будет брать квант поменьше.

ссылка на оригинал статьи https://habr.com/ru/articles/1070694/