← На главную
Новости· 18.07.2026· 4 мин чтения

OpenAI предложила четыре метрики вместо «активных пользователей» для оценки AI-систем

Финансовый директор OpenAI Сара Фрайар представила scorecard из четырёх показателей для измерения реальной отдачи от ИИ: полезная работа, стоимость задачи, надёжность и return on compute.

OpenAI предложила четыре метрики вместо «активных пользователей» для оценки AI-систем
Материал подготовлен с помощью ИИ и проверен редактором

Финансовый директор OpenAI Сара Фрайар опубликовала scorecard для измерения отдачи от внедрения ИИ в бизнесе. Вместо классических показателей вроде количества активных пользователей компания предлагает четыре метрики: полезная работа (useful work), стоимость успешной задачи, надёжность и возврат на вычисления (return on compute). Вместе они отвечают на вопрос, который волнует каждого, кто платит за AI-инструменты: растёт ли полезный интеллект на вложенный доллар.

Почему старые метрики не работают для ИИ

Годами софт измеряли через adoption: сколько купили лицензий, сколько людей заходит в продукт, сколько продлевают подписку. Для SaaS это работало — если человек открывает приложение, значит, оно приносит ценность.

С ИИ эта логика ломается. Модель может обрабатывать тысячи запросов, но если половина ответов требует переделки или вообще бесполезна, то метрика «активных пользователей» ничего не скажет о реальной отдаче. Компания платит за токены и compute, а не за факт использования.

OpenAI предлагает сместить фокус с adoption на outcome — что ИИ реально сделал, а не сколько раз к нему обратились.

Четыре метрики scorecard

Useful work — объём полезной работы, которую завершила система. Не запросы, не сессии, а конкретные задачи: сколько писем отправлено, сколько кода прошло ревью, сколько отчётов сгенерировано и принято без правок. Метрика привязывает ИИ к бизнес-процессам.

Cost per successful task — стоимость одной успешно завершённой задачи. Ключевое слово «успешной»: если модель написала код, который не запустился, это не считается. Метрика заставляет учитывать качество, а не только throughput. Чем ниже стоимость полезного результата, тем выше ROI.

Dependability — надёжность. Какой процент задач система выполняет правильно с первого раза, без вмешательства человека. Если AI-ассистент по поддержке решает 80% обращений самостоятельно, а 20% эскалирует, dependability = 80%. Метрика показывает, насколько системе можно доверить процесс целиком.

Return on compute — возврат на вложенные вычисления. Сколько полезной работы получено на единицу compute (GPU-часы, облачные кредиты). Это AI-версия классического ROI: если компания тратит $10 000 в месяц на inference, а модель экономит $50 000 рабочего времени, return on compute положительный. Метрика связывает техническую инфраструктуру с финансами.

Вместе эти четыре показателя дают ответ на вопрос: становится ли система умнее за те же деньги или дороже за тот же результат.

Для кого это критично прямо сейчас

Компании, которые уже внедрили ИИ в production, сталкиваются с вопросом CFO: «Мы тратим $X в месяц на API OpenAI / Anthropic / собственные модели — что мы за это получаем?» Классический ответ «У нас 500 активных пользователей ChatGPT Enterprise» не проходит, если непонятно, сколько из этих пользователей реально закрывают задачи быстрее.

Scorecard даёт язык для разговора между командой, которая внедряет AI, и финансами. Вместо «Мы экспериментируем» можно сказать: «Dependability выросла с 60% до 75%, cost per task упала на 30%, useful work увеличилась в два раза». Это конкретные цифры для обоснования бюджета.

Для разработчиков AI-продуктов метрики задают фокус при оптимизации. Если цель — снизить cost per task, можно работать над prompt engineering, переходить на более дешёвые модели для рутинных операций или кешировать частые запросы. Если узкое место — dependability, стоит добавить проверки на выходе или дообучить модель на специфичных данных компании.

Что остаётся за рамками

Scorecard не говорит, как именно измерять «полезную работу» в каждом конкретном случае. Для поддержки это может быть количество закрытых тикетов, для разработки — строки кода в продакшене, для аналитики — отчёты, которые легли в основу решений. Компаниям придётся определять это самостоятельно, и здесь легко скатиться в vanity metrics — например, считать «полезной» любую генерацию, даже если её никто не использовал.

Метрика return on compute требует точного учёта затрат на inference. Если компания использует собственную инфраструктуру, нужно считать амортизацию GPU, электричество, зарплаты MLOps-команды. Если облако — отслеживать расходы по API. Не у всех компаний есть такая прозрачность прямо сейчас.

Dependability сложно измерить для творческих задач. Если ИИ пишет маркетинговые тексты, что считать «правильным результатом»? Субъективная оценка менеджера? A/B-тест на конверсию? Для чётко формализованных процессов (код, данные, поддержка) метрика работает, для размытых — остаётся серой зоной.

Индустрия движется к измеримости

OpenAI публикует этот scorecard в момент, когда AI-индустрия переходит от hype к accountability. Компании потратили миллионы на эксперименты, теперь нужно показать цифры. Крупные enterprise-клиенты требуют SLA, гарантий точности, прозрачности затрат — всего того, что раньше было нормой для классического софта, но отсутствовало у генеративных моделей.

Scorecard Фрайар — не универсальный стандарт, но рабочая рамка. Если её возьмут на вооружение конкуренты (Anthropic, Google, Microsoft), это может стать новым языком для AI procurement. Вместо «у нас GPT-4» компании будут говорить «у нас dependability 85% при cost per task $0,12».

Для тех, кто внедряет ИИ сейчас: начните с одной метрики, которая отвечает на главный вопрос вашего бизнеса. Если ИИ заменяет людей — useful work. Если оптимизирует затраты — cost per task. Если критична точность — dependability. Остальное можно добавить, когда первая метрика встанет на учёт.

Источники

Материал подготовил PLai AI — редакционный ИИ PLai.

Он же отбирает источники, пишет тексты и модерирует комментарии. Работает на PLGames AI — собственном шлюзе к языковым моделям.

Читайте также

Комментарии

Пока никто не написал. Будьте первым.

Комментарии проверяет AI-модератор PLai. По существу — публикуется сразу.