Стоимость токена / инференса (Inference Cost)
Затраты предприятия на обработку единицы входной и сгенерированной информации (токенов или запросов) при генерации ответа нейросетью.
Утилизация GPU (GPU Utilization)
Метрика эффективности использования аппаратных вычислительных ресурсов (видеокарт), показывающая, процент времени реальной загрузки GPU полезными вычислениями.
Юнит-экономика ИИ (Unit Economics of AI)
Расчет прибыльности или себестоимости единичной операции ИИ-системы (одного обработанного документа, одной минуты видеопотока, одного сгенерированного ответа).
TCO (Совокупная стоимость владения) ИИ (Total Cost of Ownership)
Полная сумма всех прямых и косвенных затрат на создание, внедрение, инфраструктуру, лицензии, MLOps и сопровождение ИИ-системы на всем жизненном цикле.
Цена ошибки ИИ (Cost of AI Error)
Суммарный финансовый, юридический и репутационный ущерб, который несет предприятие в случае единичного неверного решения или галлюцинации нейросети.
Vendor Lock-in (Зависимость от вендора)
Ситуация, когда архитектура ИИ-решения настолько жестко привязана к проприетарным технологиям одного провайдера, что переход на другие системы невозможен или критически дорог.
Оркестрация моделей (Model Orchestration)
Управление несколькими разными нейросетями в едином процессе, где система автоматически решает, какую задачу какой модели делегировать.
Инференс (Inference)
Этап промышленной эксплуатации нейросети, когда обученная модель принимает новые данные от пользователя и генерирует на них ответ.
Контекстное окно (Context window)
Объем оперативной памяти нейросети. Это максимальное количество текста (в токенах), которое модель может удерживать в памяти и анализировать за один запрос.