Утилизация GPU (GPU Utilization)

Метрика эффективности использования аппаратных вычислительных ресурсов (видеокарт), показывающая, процент времени реальной загрузки GPU полезными вычислениями.

Юнит-экономика ИИ (Unit Economics of AI)

Расчет прибыльности или себестоимости единичной операции ИИ-системы (одного обработанного документа, одной минуты видеопотока, одного сгенерированного ответа).

Цена ошибки ИИ (Cost of AI Error)

Суммарный финансовый, юридический и репутационный ущерб, который несет предприятие в случае единичного неверного решения или галлюцинации нейросети.

Vendor Lock-in (Зависимость от вендора)

Ситуация, когда архитектура ИИ-решения настолько жестко привязана к проприетарным технологиям одного провайдера, что переход на другие системы невозможен или критически дорог.

Оркестрация моделей (Model Orchestration)

Управление несколькими разными нейросетями в едином процессе, где система автоматически решает, какую задачу какой модели делегировать.

Инференс (Inference)

Этап промышленной эксплуатации нейросети, когда обученная модель принимает новые данные от пользователя и генерирует на них ответ.

Контекстное окно (Context window)

Объем оперативной памяти нейросети. Это максимальное количество текста (в токенах), которое модель может удерживать в памяти и анализировать за один запрос.