Qwen 3.8 27B: запускаем на одной видеокарте за 10 минут — даже на RTX 3090
Новая модель Qwen 3.8 27B работает быстрее Opus, понимает видео и запускается на одной видеокарте. Пошаговая инструкция для разработчиков: кванты, конфиги, скорость генерации и подводные камни

Новая модель от команды Qwen умеет анализировать видео, работает быстрее Opus 4.6 и запускается на одной видеокарте с 24 ГБ VRAM. В этом гайде — пошаговая инструкция для разработчиков: какие кванты выбрать, как настроить контекст до 1 млн токенов и почему на RTX 3090 придётся пожертвовать скоростью.
Зачем это нужно: три причины попробовать Qwen 3.8 27B прямо сейчас
Модель весит 27 млрд параметров, но благодаря оптимизациям работает на одной видеокарте — даже на RTX 3090 с 24 ГБ VRAM. Вот что она умеет из коробки:
- Мультимодальность: понимает изображения и видео (по бенчмаркам обгоняет Opus 4.6).
- Длинный контекст: изначально поддерживает 262K токенов, с YARN можно растянуть до 1 млн.
- Скорость: на RTX 5090 выдаёт 120 токенов в секунду в кванте Q5_K_XL.
Если вы тестируете локальные LLM для чат-ботов, анализа документов или генерации кода — Qwen 3.8 27B может стать заменой платным API или медленным моделям вроде Llama 3.1 70B.
Шаг 1: выбираем квант под свою видеокарту
Модель доступна в формате GGUF на Hugging Face. Ключевой момент — выбор кванта зависит от объёма VRAM:
| Видеокарта | Рекомендуемый квант | Контекст (токенов) | Скорость (т/с) | |------------------|-----------------------------------|--------------------|----------------| | RTX 5090 (32 ГБ) | UD-Q6_K_XL или UD-Q5_K_XL | 48K / 125K | 100 / 120 | | RTX 4090 (24 ГБ) | UD-Q5_K_XL или IQ4_KS_KT* | 125K / 262K | 80-100 | | RTX 3090 (24 ГБ) | IQ4_KS_KT (специальный квант) | 64K | 60-80 |
*Квант IQ4_KS_KT оптимизирован для карт с 16-24 ГБ VRAM: ссылка на Hugging Face.
Важно: Если VRAM не хватает, llama.cpp автоматически выгружает слои в оперативную память, но скорость упадёт в 2-3 раза.
Шаг 2: запускаем модель через llama.cpp
Установите llama.cpp с поддержкой CUDA. Для RTX 5090 с квантом UD-Q5_K_XL команда запуска выглядит так:
``bash llama-server \ -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL \ --host 0.0.0.0 --port 8080 \ --fit off --gpu-layers all --gpu-layers-draft all \ --ctx-size 125000 \ --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \ --spec-type draft-mtp ``
Параметры для настройки:
--ctx-size: задаёт размер контекста (максимум 262K без YARN).--spec-type draft-mtp: включает спекулятивное предсказание для ускорения генерации.--gpu-layers all: загружает все слои на GPU (если VRAM хватает).
Шаг 3: запуск в Docker (для ленивых)
Если не хотите собирать llama.cpp вручную, используйте готовый образ с CUDA:
```yaml services: llama: image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423 container_name: llama devices:
ports:
environment:
volumes:
entrypoint: ["./llama-server"] command: > --host 0.0.0.0 --port 8080 --ctx-size 125000 --fit off --gpu-layers all --gpu-layers-draft all -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL --spec-type draft-mtp --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 ```
- "nvidia.com/gpu=all"
- "8080:8080"
- NVIDIA_VISIBLE_DEVICES=all
- NVIDIA_DRIVER_CAPABILITIES=compute,utility
- ~/.cache:/root/.cache
Запустите командой: ``bash docker compose up -d ``
Шаг 4: тестируем мультимодальность и длинный контекст
Qwen 3.8 27B поддерживает анализ изображений и видео "из коробки". Пример запроса через API:
```python import requests
response = requests.post( "http://localhost:8080/completion", json={ "prompt": "Опиши, что происходит на этом видео: [base64-encoded-video]", "n_predict": 200, "temperature": 0.7 } ) print(response.json()["content"]) ```
Для длинного контекста (до 1 млн токенов) используйте YARN: ``bash --rope-scaling yarn --rope-factor 4.0 `` Но учтите: на RTX 3090 с 24 ГБ VRAM контекст больше 64K работать не будет.
Где ломается: подводные камни
- VRAM vs скорость: На RTX 3090 с квантом
IQ4_KS_KTскорость падает до 60 т/с, а контекст ограничен 64K. - Спекулятивное предсказание: Параметр
--spec-type draft-mtpускоряет генерацию, но может снижать качество ответов на сложных задачах. - Мультимодальность: Видео обрабатываются медленнее изображений — на RTX 5090 анализ 10-секундного ролика занимает 15-20 секунд.
- API недоступен: Пока модель не появилась в официальном API Qwen (только на OpenRouter за $0.45/$3.20 за 1M токенов).
Что попробовать дальше
- Сравнить с Llama 3.1 70B: Qwen 3.8 27B быстрее, но Llama может выигрывать в точности на некоторых задачах.
- Оптимизировать кванты: Попробуйте
Q4_K_Mдля баланса скорости и качества на слабых картах. - Интегрировать в RAG: Модель хорошо работает с длинными документами — подходит для чат-ботов с базой знаний.
- Тестировать YARN: Если нужны контексты >262K, поэкспериментируйте с
--rope-scaling yarn.
Демо-сервер автора статьи (может быть недоступен из-за нагрузки): habr.acloud.app. Веса модели лежат на Hugging Face под лицензией Apache 2.0 — можно использовать в коммерческих продуктах.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.

