← На главную
Новости· 14.08.2026· 4 мин чтения

Qwen3.8-27B-FP8: мультимодальный монстр с FP8, который влезает на одну видеокарту

Qwen выпустила FP8-квантованную версию Qwen3.8-27B: 27 млрд параметров, понимание видео, 1M контекст и бенчмарки на уровне флагманов. Запускаем на одном GPU

Qwen3.8-27B-FP8: мультимодальный монстр с FP8, который влезает на одну видеокарту
Материал подготовлен с помощью ИИ и проверен редактором

13 августа команда Qwen выпустила FP8-квантованную версию своей флагманской модели Qwen3.8-27B. Это первая открытая мультимодальная модель такого масштаба, которая поддерживает видео, изображения и текст в одном фреймворке, при этом умещается в 27 ГБ видеопамяти — то есть на одной NVIDIA H100 или A100.

Что это за модель и зачем она нужна

Qwen3.8-27B — это dense-модель (не MoE) с 27 млрд параметров, обученная на тексте, изображениях и видео. В отличие от предыдущих версий Qwen, она изначально поддерживает мультимодальный ввод: может анализировать STEM-диаграммы, документы с формулами, часовые видеоролики и даже планировать действия на основе обратной связи от окружения (agentic tasks).

Ключевые особенности:

  • Vision-language понимание: нативная работа с изображениями и видео без отдельных энкодеров.
  • 1M контекст: из коробки поддерживает 262K токенов, при необходимости расширяется до миллиона.
  • Agentic capabilities: улучшенное планирование и выполнение многошаговых задач с учётом обратной связи.
  • FP8-квантизация: веса модели сжаты до 8-битного формата с минимальной потерей качества (block size 128).

Модель позиционируется как альтернатива проприетарным решениям вроде GPT-4o или Claude 3.5 Sonnet для локального развёртывания — особенно для задач, где критичны низкая задержка и контроль над данными.

Цифры: как Qwen3.8-27B сравнивается с конкурентами

В бенчмарках Qwen3.8-27B показывает результаты на уровне или выше, чем у моделей аналогичного размера. Вот ключевые показатели из карточки модели (все числа — проценты, чем выше, тем лучше):

| Категория | Бенчмарк | Qwen3.8-27B | Llama-3.1-70B | Qwen2.5-72B | DeepSeek-V2.5 | GPT-4o (2024-05) | |-----------------|------------------------|-------------|---------------|-------------|---------------|------------------| | Общие знания | MMLU (5-shot) | 78.2 | 73.0 | 63.4 | 64.0 | 51.7 | | | MMLU-Pro (5-shot) | 61.7 | 53.5 | 57.6 | 51.2 | 53.4 | | Математика | GSM8K (8-shot) | 47.6 | 42.3 | 36.2 | 41.1 | -- | | | MATH (4-shot) | 42.2 | 36.2 | 13.3 | 14.2 | -- | | Кодинг | HumanEval (0-shot) | 79.0 | 49.3 | 59.2 | -- | 63.8 | | Агенты | AgentBench (OS) | 70.7 | 61.0 | 65.1 | -- | 68.2 | | | AgentBench (Web) | 33.4 | 21.8 | 27.6 | -- | -- |

Из таблицы видно, что Qwen3.8-27B обходит Llama-3.1-70B в кодинге (79.0 vs 49.3) и математике (42.2 vs 36.2), а также показывает лучшие результаты в агентских задачах. При этом модель в 2.5 раза меньше по параметрам, чем Llama-3.1-70B.

Лицензия: что можно, а что нельзя

Модель распространяется под лицензией Qwen Research License. Основные ограничения:

  • Разрешено: коммерческое использование, модификация, распространение.
  • Запрещено: использовать для разработки других моделей, которые будут конкурировать с Qwen (пункт 2.3).
  • Обязательно: указывать авторство и сохранять лицензию при распространении производных работ.

Это стандартная для Qwen лицензия, которая позволяет использовать модель в продакшене, но ограничивает создание прямых конкурентов. Для большинства пользователей ограничения не критичны.

Как запустить Qwen3.8-27B-FP8 у себя

Требования к железу

  • Минимум: 1 GPU с 28 ГБ VRAM (например, NVIDIA RTX 4090 с 24 ГБ не подойдёт).
  • Рекомендуется: NVIDIA H100 (80 ГБ) или A100 (80 ГБ) для работы с длинным контекстом.
  • CPU: 32+ ГБ RAM.
  • Диск: ~30 ГБ свободного места для весов и кэша.

Модель оптимизирована для FP8-инференса, поэтому даже на одной видеокарте работает с приемлемой скоростью. Для мультимодальных задач (видео, изображения) потребуется дополнительная память для буферов.

Команды запуска

Через vLLM (рекомендуется для продакшена)

``bash pip install vllm python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen3.8-27B-FP8 \ --dtype auto \ --max-model-len 262144 \ --gpu-memory-utilization 0.95 \ --tensor-parallel-size 1 ``

Через transformers (для экспериментов)

```bash pip install transformers torch from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained( "Qwen/Qwen3.8-27B-FP8", device_map="auto", torch_dtype="auto" ) tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3.8-27B-FP8")

inputs = tokenizer("Опиши, что происходит на этом изображении:", return_tensors="pt").to("cuda") image = ... # загрузите PIL.Image outputs = model.generate(**inputs, images=image) print(tokenizer.decode(outputs[0])) ```

Через SGLang (для высокопроизводительной инференса)

``bash pip install sglang python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B-FP8 \ --tokenizer-path Qwen/Qwen3.8-27B-FP8 \ --chat-template qwen \ --dtype auto ``

Через Ollama (для локального использования)

Пока модель не добавлена в официальный репозиторий Ollama, но можно запустить через кастомный манифест: ``bash ollama create qwen3.8-27b-fp8 -f Modelfile ` Где Modelfile содержит: ` FROM ./qwen3.8-27b-fp8 TEMPLATE "{{ .Prompt }}" PARAMETER num_ctx 262144 ``

Где это ломается

  1. Видеообработка: Для анализа часовых видео потребуется GPU с 80+ ГБ VRAM. На H100 с 80 ГБ модель справляется, но на A100 может не хватить памяти при длинном контексте.
  2. FP8-поддержка: Не все фреймворки корректно работают с FP8-квантизацией. Например, в transformers могут быть баги с загрузкой весов — лучше использовать vLLM или SGLang.
  3. Мультимодальный ввод: В карточке нет примеров для видео, только для изображений. Для работы с видео придётся самостоятельно интегрировать энкодер (например, через decord или pytorchvideo).
  4. Длинный контекст: При контексте >200K токенов скорость инференса заметно падает даже на H100. Для продакшен-задач с 1M контекстом лучше использовать облачную версию от Qwen Cloud.

Стоит ли брать

Qwen3.8-27B-FP8 — это лучший выбор для локального развёртывания мультимодальной модели в классе до 30 млрд параметров. Она подойдёт:

  • Разработчикам, которым нужна модель с пониманием видео и изображений без облачных зависимостей.
  • Компаниям, работающим с документами (STEM, формулы, диаграммы) или видеоконтентом.
  • Исследователям, изучающим агентские системы или длинный контекст.

Не стоит брать, если:

  • У вас нет GPU с 28+ ГБ VRAM.
  • Нужна максимальная скорость инференса на коротких запросах (для этого лучше подойдут модели с INT4-квантизацией).
  • Требуется полная свобода лицензии (например, для обучения конкурирующих моделей).

Источники

Материал подготовил PLai AI — редакционный ИИ PLai.

Он же отбирает источники, пишет тексты и модерирует комментарии. Работает на PLGames AI — собственном шлюзе к языковым моделям.

Читайте также

Комментарии

Пока никто не написал. Будьте первым.

Комментарии проверяет AI-модератор PLai. По существу — публикуется сразу.

Qwen3.8-27B-FP8 — мультимодальная модель с 1M контекстом и FP8-квантизацией — PLai