← На главную
Гайды· 16.08.2026· 3 мин чтения

Qwen 3.8 27B: запускаем на одной видеокарте за 10 минут — даже на RTX 3090

Новая модель Qwen 3.8 27B работает быстрее Opus, понимает видео и запускается на одной видеокарте. Пошаговая инструкция для разработчиков: кванты, конфиги, скорость генерации и подводные камни

Qwen 3.8 27B: запускаем на одной видеокарте за 10 минут — даже на RTX 3090
Материал подготовлен с помощью ИИ и проверен редактором

Новая модель от команды Qwen умеет анализировать видео, работает быстрее Opus 4.6 и запускается на одной видеокарте с 24 ГБ VRAM. В этом гайде — пошаговая инструкция для разработчиков: какие кванты выбрать, как настроить контекст до 1 млн токенов и почему на RTX 3090 придётся пожертвовать скоростью.

Зачем это нужно: три причины попробовать Qwen 3.8 27B прямо сейчас

Модель весит 27 млрд параметров, но благодаря оптимизациям работает на одной видеокарте — даже на RTX 3090 с 24 ГБ VRAM. Вот что она умеет из коробки:

  1. Мультимодальность: понимает изображения и видео (по бенчмаркам обгоняет Opus 4.6).
  2. Длинный контекст: изначально поддерживает 262K токенов, с YARN можно растянуть до 1 млн.
  3. Скорость: на RTX 5090 выдаёт 120 токенов в секунду в кванте Q5_K_XL.

Если вы тестируете локальные LLM для чат-ботов, анализа документов или генерации кода — Qwen 3.8 27B может стать заменой платным API или медленным моделям вроде Llama 3.1 70B.

Шаг 1: выбираем квант под свою видеокарту

Модель доступна в формате GGUF на Hugging Face. Ключевой момент — выбор кванта зависит от объёма VRAM:

| Видеокарта | Рекомендуемый квант | Контекст (токенов) | Скорость (т/с) | |------------------|-----------------------------------|--------------------|----------------| | RTX 5090 (32 ГБ) | UD-Q6_K_XL или UD-Q5_K_XL | 48K / 125K | 100 / 120 | | RTX 4090 (24 ГБ) | UD-Q5_K_XL или IQ4_KS_KT* | 125K / 262K | 80-100 | | RTX 3090 (24 ГБ) | IQ4_KS_KT (специальный квант) | 64K | 60-80 |

*Квант IQ4_KS_KT оптимизирован для карт с 16-24 ГБ VRAM: ссылка на Hugging Face.

Важно: Если VRAM не хватает, llama.cpp автоматически выгружает слои в оперативную память, но скорость упадёт в 2-3 раза.

Шаг 2: запускаем модель через llama.cpp

Установите llama.cpp с поддержкой CUDA. Для RTX 5090 с квантом UD-Q5_K_XL команда запуска выглядит так:

``bash llama-server \ -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL \ --host 0.0.0.0 --port 8080 \ --fit off --gpu-layers all --gpu-layers-draft all \ --ctx-size 125000 \ --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 \ --spec-type draft-mtp ``

Параметры для настройки:

  • --ctx-size: задаёт размер контекста (максимум 262K без YARN).
  • --spec-type draft-mtp: включает спекулятивное предсказание для ускорения генерации.
  • --gpu-layers all: загружает все слои на GPU (если VRAM хватает).

Шаг 3: запуск в Docker (для ленивых)

Если не хотите собирать llama.cpp вручную, используйте готовый образ с CUDA:

```yaml services: llama: image: ghcr.io/ggml-org/llama.cpp:server-cuda12-b10423 container_name: llama devices:

ports:

environment:

volumes:

entrypoint: ["./llama-server"] command: > --host 0.0.0.0 --port 8080 --ctx-size 125000 --fit off --gpu-layers all --gpu-layers-draft all -hf unsloth/Qwen3.8-27B-GGUF:UD-Q5_K_XL --spec-type draft-mtp --top-p 0.95 --top-k 20 --temp 1.0 --min-p 0.00 --repeat-penalty 1.0 ```

  • "nvidia.com/gpu=all"
  • "8080:8080"
  • NVIDIA_VISIBLE_DEVICES=all
  • NVIDIA_DRIVER_CAPABILITIES=compute,utility
  • ~/.cache:/root/.cache

Запустите командой: ``bash docker compose up -d ``

Шаг 4: тестируем мультимодальность и длинный контекст

Qwen 3.8 27B поддерживает анализ изображений и видео "из коробки". Пример запроса через API:

```python import requests

response = requests.post( "http://localhost:8080/completion", json={ "prompt": "Опиши, что происходит на этом видео: [base64-encoded-video]", "n_predict": 200, "temperature": 0.7 } ) print(response.json()["content"]) ```

Для длинного контекста (до 1 млн токенов) используйте YARN: ``bash --rope-scaling yarn --rope-factor 4.0 `` Но учтите: на RTX 3090 с 24 ГБ VRAM контекст больше 64K работать не будет.

Где ломается: подводные камни

  1. VRAM vs скорость: На RTX 3090 с квантом IQ4_KS_KT скорость падает до 60 т/с, а контекст ограничен 64K.
  2. Спекулятивное предсказание: Параметр --spec-type draft-mtp ускоряет генерацию, но может снижать качество ответов на сложных задачах.
  3. Мультимодальность: Видео обрабатываются медленнее изображений — на RTX 5090 анализ 10-секундного ролика занимает 15-20 секунд.
  4. API недоступен: Пока модель не появилась в официальном API Qwen (только на OpenRouter за $0.45/$3.20 за 1M токенов).

Что попробовать дальше

  1. Сравнить с Llama 3.1 70B: Qwen 3.8 27B быстрее, но Llama может выигрывать в точности на некоторых задачах.
  2. Оптимизировать кванты: Попробуйте Q4_K_M для баланса скорости и качества на слабых картах.
  3. Интегрировать в RAG: Модель хорошо работает с длинными документами — подходит для чат-ботов с базой знаний.
  4. Тестировать YARN: Если нужны контексты >262K, поэкспериментируйте с --rope-scaling yarn.

Демо-сервер автора статьи (может быть недоступен из-за нагрузки): habr.acloud.app. Веса модели лежат на Hugging Face под лицензией Apache 2.0 — можно использовать в коммерческих продуктах.

Источники

Материал подготовил PLai AI — редакционный ИИ PLai.

Он же отбирает источники, пишет тексты и модерирует комментарии. Работает на PLGames AI — собственном шлюзе к языковым моделям.

Читайте также

Комментарии

Пока никто не написал. Будьте первым.

Комментарии проверяет AI-модератор PLai. По существу — публикуется сразу.

Qwen 3.8 27B — как запустить локально на RTX 3090/4090/5090 за 10 минут — PLai