LLM 0.32rc2: как запускать промпты на любом OpenAI-совместимом API без настройки модели
Саймон Виллисон добавил в свой CLI-инструмент команду для тестирования любых OpenAI-совместимых эндпоинтов без конфигов. Разбираем новую версию и смену дефолтной модели.

Саймон Виллисон выпустил вторую release candidate версию своего CLI-инструмента LLM — 0.32rc2. Главное изменение: теперь можно стучаться к любому эндпоинту, совместимому с OpenAI Chat Completions API, одной командой — без предварительной настройки моделей и без логирования. Плюс дефолтная модель сменилась с GPT-4o mini на более свежую и дорогую GPT-5.6 Luna.
Зачем нужна команда openai endpoint
Если вы разворачиваете локальные модели (LM Studio, vLLM, Ollama с OpenAI-совместимым API) или пробуете сторонние провайдеры, обычно приходится либо писать curl-запросы вручную, либо настраивать клиент. Саймон столкнулся с тем, что нормального CLI для быстрой проверки произвольных эндпоинтов нет, и встроил эту возможность прямо в LLM.
Теперь можно бросить промпт на любой совместимый сервер за одну команду — даже без установки LLM на машину, через uvx.
Как это работает: однострочник с uvx
Запустить промпт на локальной модели в LM Studio (или любом другом сервере с OpenAI-совместимым API):
``bash uvx --pre llm openai endpoint http://127.0.0.1:1234/v1 \ -T llm_version -T llm_time --td \ -m google/gemma-4-31b 'what is the current LLM version? And the time?' ``
Разберём флаги:
uvx --pre llm— запускает pre-release версию LLM через uv без установки в системуopenai endpoint <URL>— указывает адрес эндпоинта (здесь локальный LM Studio на порту 1234)-T llm_version -T llm_time— подключает инструменты (tools) для вызова функций--td— включает трассировку вызовов инструментов (tool debugging)-m google/gemma-4-31b— имя модели, которое понимает ваш сервер- Последний аргумент — сам промпт
Результат выполнится мгновенно, без записи в локальную базу логов LLM. Это удобно для экспериментов, когда не хочется захламлять историю.
Смена дефолтной модели: GPT-5.6 Luna вместо 4o mini
Для тех, кто не задал свою дефолтную модель явно, LLM теперь использует GPT-5.6 Luna вместо прежней GPT-4o mini. Luna свежее и сильнее, но дороже:
- GPT-5.6 Luna: $0.20 за миллион входных токенов, $1.20 за миллион выходных
- GPT-4o mini: $0.15 / $0.60
Если вам важнее цена, можно откатиться обратно:
``bash llm models default gpt-4o-mini ``
Или выбрать ещё более дешёвую GPT-5 nano ($0.05 / $0.40):
``bash llm models default gpt-5-nano ``
Изменение касается только тех, кто установит 0.32rc2 и не настроил дефолт вручную. Если вы уже зафиксировали модель командой llm models default, ничего не поменяется.
Где это пригодится
Тестирование локальных моделей. Развернули модель через LM Studio, Ollama или vLLM с OpenAI-совместимым интерфейсом — можно сразу проверить работу без написания скриптов.
Проверка сторонних провайдеров. Если провайдер заявляет совместимость с OpenAI API (многие inference-платформы так делают), можно быстро убедиться, что всё работает.
Отладка без логов. Вызовы через openai endpoint не попадают в базу LLM. Это полезно, если не хотите засорять историю тестовыми запросами или работаете с чувствительными данными.
Подводные камни
Формат имён моделей. У каждого провайдера свои правила: LM Studio может ожидать google/gemma-4-31b, Ollama — просто gemma, vLLM — полный путь с хабом. Придётся подсмотреть в документации сервера.
Поддержка tools. Не все эндпоинты умеют в function calling. Если флаг -T вызовет ошибку, значит, сервер не реализует эту часть спецификации.
Аутентификация. Команда не документирует явной передачи API-ключей. Если эндпоинт требует токен, возможно, придётся использовать стандартные переменные окружения (OPENAI_API_KEY) или прокси.
Что попробовать дальше
Если вам зашёл подход «один CLI для всех моделей», посмотрите на:
- vLLM с флагом
--api-keyи--host— разворачивает OpenAI-совместимый сервер для любой модели из Hugging Face - Ollama с
OLLAMA_ORIGINSи переменнойOLLAMA_HOST— поддерживает OpenAI API начиная с версии 0.1.14 - LiteLLM — прокси-слой, который приводит API разных провайдеров (Anthropic, Cohere, Azure) к единому OpenAI-формату
Команда llm openai endpoint превращает LLM в универсальный клиент для любого совместимого сервера. Если вы часто переключаетесь между локальными моделями и облачными провайдерами, это сильно ускоряет рабочий процесс.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.


