Как запустить Qwen локально: пошаговая инструкция
Рассказываем, как запустить Qwen локально на своём компьютере или сервере — через Ollama, vLLM или opencode, и каких ошибок избежать новичку.

Как запустить Qwen локально: пошаговая инструкция
Вопрос «как запустить Qwen локально» встаёт у каждого, кто хочет получить приватного AI-ассистента без облачных подписок. Ниже — разбор рабочих способов из практики других пользователей: через Ollama, vLLM и интеграцию в редактор кода.
Единого «правильного» пути нет — выбор зависит от вашей задачи: быстрый локальный чат, сервер с OpenAI-совместимым API или AI-ассистент внутри рабочего проекта.
Шаг 1. Проверьте железо и определитесь с моделью
Прежде чем что-либо ставить, оцените возможности своего компьютера или видеокарты — от этого зависит, какую версию Qwen вы сможете запустить.
Из практики авторов источников:
- Qwen3.6 35B-A3B успешно запускали на видеокарте RTX 4070 с 12 ГБ видеопамяти при 32 ГБ оперативной памяти.
- Qwen 3.5 (в версиях 9B и 35B) и Qwen 2.5 VL запускали на RTX 5060 Ti через Ollama.
- Qwen2.5 устанавливали и на Windows 11 без мощной серверной инфраструктуры.
Точные системные требования (минимальный объём VRAM/RAM для каждой конкретной версии модели) в источниках не приводятся отдельной таблицей — ориентируйтесь на конфигурации из примеров выше и выбирайте модель по размеру, который потянет ваша видеокарта.
Шаг 2. Выберите способ запуска
Вариант A: Ollama — самый простой путь для локального ПК
Ollama используется в источниках как способ запустить Qwen 3.5 (9B и 35B) и Qwen 2.5 VL локально, в том числе с последующей интеграцией в IDE по протоколу MCP (на примере Antigravity IDE). Это подходит, если вам нужен именно локальный запуск на своей видеокарте без разворачивания сервера.
Вариант B: vLLM — для сервера и API
Если нужен не просто чат, а полноценный OpenAI-совместимый API с авторизацией по токену, в источниках описан запуск Qwen через vLLM на облачном сервере с последующим подключением интерфейса Open WebUI для тестирования. Такой вариант удобен, когда модель нужна не только вам, но и как сервис для других приложений.
Вариант C: Qwen как ассистент в редакторе кода
Отдельный кейс — запуск Qwen3.6 35B-A3B с последующей настройкой в opencode как AI-ассистента для работы над реальным проектом. Автор источника отмечает, что после такой настройки модель стала использоваться постоянно в качестве рабочего инструмента.
Вариант D: Установка на Windows 11
Для пользователей Windows есть отдельное руководство по установке модели Qwen2.5 локально на компьютере с этой ОС. В источнике подчёркивается, что у каждой модели Qwen разные параметры — учитывайте это при выборе версии под свою систему.
Шаг 3. Первый запуск и проверка
После установки выбранного инструмента (Ollama, vLLM или интеграции с редактором) убедитесь, что модель отвечает на простой тестовый запрос через интерфейс — будь то консоль, Open WebUI или чат в IDE. Конкретные команды запуска зависят от выбранного способа и подробно расписаны в соответствующих источниках — приводить их здесь без первоисточника мы не будем, чтобы не давать неточную инструкцию.
Типичные ошибки при запуске Qwen локально
- Недооценка требований к видеопамяти. Если для модели 35B-A3B в примере использовалась карта с 12 ГБ VRAM и 32 ГБ RAM, попытка запустить крупную модель на менее мощном железе может привести к падению производительности или невозможности загрузки.
- Путаница между версиями Qwen. Qwen2.5, Qwen 3.5 и Qwen3.6 — разные линейки с разными параметрами; выбирайте инструкцию под конкретную версию, а не универсальный гайд.
- Забытая авторизация по токену при работе с vLLM-сервером. Если разворачиваете API, не пропускайте настройку токена — без неё доступ к OpenAI-совместимому эндпоинту не заработает как задумано.
- Игнорирование интеграции через MCP/opencode. Если цель — рабочий ассистент в IDE, а не просто локальный чат, недостаточно только запустить модель через Ollama — нужна ещё настройка протокола интеграции с редактором.
FAQ
Можно ли запустить Qwen локально без мощной видеокарты?
В источниках описаны успешные запуски на RTX 4070 (12 ГБ) и RTX 5060 Ti — это потребительские, а не топовые серверные карты. Для более скромного железа стоит выбирать младшие версии моделей (например, 9B вместо 35B).
Чем отличается запуск через Ollama от запуска через vLLM?
Ollama в источниках используется для локального запуска на своей видеокарте с интеграцией в IDE. vLLM — для развёртывания на сервере с получением полноценного OpenAI-совместимого API и авторизацией по токену.
Можно ли запустить Qwen на Windows 11?
Да, есть отдельное руководство по установке Qwen2.5 локально на компьютере с Windows 11.
Какую модель Qwen выбрать для старта?
Однозначного ответа в источниках нет — выбор зависит от задачи и железа. Для теста на потребительской видеокарте в примерах использовались версии 9B и 35B, а также Qwen2.5 и Qwen3.6.
Нужен ли интернет после установки Qwen локально?
В источниках это явно не уточняется. Локальный запуск подразумевает, что инференс модели идёт на вашем железе, но за точными деталями по офлайн-режиму стоит обращаться к документации конкретного инструмента (Ollama или vLLM).
Источники
- https://habr.com/ru/articles/1026482/
- https://habr.com/ru/companies/selectel/articles/1026406/
- https://automata.sale/blog/ai-automation/local-ai-qwen-antigravity/
- https://ru.windows.day/?p=31659
Читайте также
Комментарии
Пока никто не написал. Будьте первым.


