Moonshot выпустила Kimi K3 на 2,8 трлн параметров — как работать с крупнейшей открытой моделью
Moonshot AI выпустила крупнейшую открытую модель в истории. Разбираем архитектуру, цены, бенчмарки и как начать работать с K3 уже сегодня.

Китайская Moonshot AI запустила Kimi K3 — модель на 2,8 триллиона параметров с контекстным окном в миллион токенов. По заявлениям компании, по общему интеллекту она уступает только Claude Fable 5 и GPT-5.6 Sol. Модель уже доступна через API и чат, веса обещают выложить в ближайшие дни. Разбираемся, что внутри и как начать работать.
Почему K3 — это не просто раздутая K2
K3 стала первой открытой моделью масштаба 2,8 трлн параметров. Это не увеличенная версия прошлогодней K2, а переработанная архитектура с двумя ключевыми новшествами.
Kimi Delta Attention — гибридный механизм линейного внимания. В отличие от классического квадратичного внимания (где сложность растёт как O(n²) от длины последовательности), линейное работает за O(n). Критично для контекста в миллион токенов: классическое внимание на таких объёмах требует нереальных объёмов памяти.
Attention Residuals — остаточные связи для слоёв внимания. Помогают информации не теряться при прохождении через десятки слоёв трансформера. Особенно важно в длинных последовательностях, где ранние токены могут «размываться» к моменту обработки поздних.
Разреженная MoE-архитектура: из 896 экспертов на каждый токен активируются только 16. Это даёт огромную ёмкость модели при управляемых вычислительных затратах. По оценке Moonshot, масштабирование K3 примерно в 2,5 раза эффективнее K2 — та же мощность железа даёт больший прирост качества.
Зрение встроено нативно: модель принимает изображения и видео без внешних адаптеров.
Как K3 выглядит на бенчмарках
Moonshot приводит результаты трёх специализированных тестов. Важная оговорка: все цифры — замеры самой компании, техотчёт не опубликован, независимых проверок пока нет.
GDPval-AA v2 — задачи из 44 профессий в девяти отраслях (медицина, финансы, инженерия). K3 набрала 1687 баллов, обойдя Claude Opus 4.8 Max (1600), но уступив Fable 5 Max и GPT-5.6 Sol Max.
AA-Briefcase — закрытый бенчмарк Artificial Analysis по длинным агентным задачам. K3 заняла второе место в мире, обогнав GPT-5.6 Sol Max.
BrowseComp — поиск труднодоступной информации в вебе. K3 в одиночном агентном режиме показала 91,2 балла — рекорд среди всех моделей. Без сжатия контекста, просто за счёт миллионного окна.
На практике это значит: K3 справляется с задачами, где нужно удерживать огромный объём данных (анализ длинных документов, кодовых баз, исследовательские задачи) и автономно работать с внешними источниками.
Как начать работать с K3 прямо сейчас
Через чат
Бесплатный доступ через чат-приложение Moonshot. После нескольких ответов модель показывает предупреждение о перегруженных серверах и предлагает оплатить подписку. Условия подписки компания пока не раскрывает.
Через API
Документация доступна на платформе Moonshot. Цены:
- Входящие токены: $3 за миллион ($0,3 при попадании в кэш)
- Исходящие токены: $15 за миллион
Для сравнения: предыдущая K2.6 стоила $0,6/$2,5, июньская K2.7 Code — $0,95/$4. Moonshot подняла цены в разы, почти до уровня западных флагманов.
Пример запроса к API (структура типична для OpenAI-совместимых API, точный формат уточняйте в документации):
```python import requests
response = requests.post( "https://api.moonshot.cn/v1/chat/completions", headers={"Authorization": "Bearer YOUR_API_KEY"}, json={ "model": "kimi-k3", "messages": [{"role": "user", "content": "Ваш запрос"}], "max_tokens": 2000 } )
print(response.json()) ```
Локальный запуск
Веса модели обещают выложить в ближайшие дни. Но учитывайте масштаб: 2,8 трлн параметров — это не модель для Mac Studio. Для запуска понадобится полноценный кластер с несколькими десятками GPU. При разреженной активации (16 экспертов из 896) эффективный размер меньше, но всё равно речь идёт о сотнях гигабайт весов.
Где это может сломаться
Завышенные бенчмарки. Вендоры традиционно публикуют метрики, на которых выглядят лучше всего. Независимые проверки появятся только после релиза весов.
Высокая стоимость API. $15 за миллион исходящих токенов — почти как у GPT-5.6. Если задачи не требуют миллионного контекста, дешевле могут оказаться модели среднего класса.
Инфраструктурные требования для self-hosted. Даже с квантизацией и разреженной активацией запуск потребует значительных ресурсов. Это модель для команд с доступом к серьёзному железу или облачным кластерам.
Перегруженные серверы. В первые дни после релиза бесплатный доступ через чат ограничен. Если нужна стабильность — сразу рассматривайте API или подписку.
Что попробовать дальше
- Следите за релизом весов — как только Moonshot выложит их, появятся независимые тесты и сравнения с конкурентами (GLM-5.2 от Z.ai, DeepSeek V4).
- Тестируйте на длинных задачах — миллионное окно открывает возможности для анализа крупных кодовых баз, технической документации, юридических текстов.
- Сравните с западными аналогами — если уже работаете с Claude Opus 4.8 или GPT-5.6, прогоните параллельные тесты на ваших реальных задачах.
- Экспериментируйте с агентными сценариями — результаты на AA-Briefcase и BrowseComp намекают, что K3 может автономно справляться со сложными многошаговыми задачами.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.

