Data drift (Сдвиг данных)
Изменение статистических свойств и распределения входных данных в реальной эксплуатации по сравнению с теми данными, на которых обучилась нейросеть.
Garbage In — Garbage Out (GIGO / Мусор на входе — мусор на выходе)
Фундаментальный закон, гласящий, что качество работы любого алгоритма не может быть выше качества данных, которые в него загружены.
Обучающая выборка (Training set)
Массив исторических и вручную размеченных данных, на котором алгоритм математически настраивает свои внутренние связи для решения бизнес-задачи.
Аудит готовности данных (AI Readiness)
Глубокая оценка состояния, чистоты, полноты и трассируемости корпоративных баз данных перед стартом ИИ-проекта.
Промышленный интернет вещей (IIoT)
Сеть из физических промышленных объектов (станков, датчиков, счетчиков), оснащенных встроенными технологиями для взаимодействия друг с другом и передачи данных в аналитические системы.
Обезличивание данных
Процесс удаления или маскирования персональной и чувствительной информации из массивов данных перед их передачей в ИИ-модели для анализа.
Структурированные и неструктурированные данные
Структурированные данные жестко организованы (таблицы ERP, SQL, базы 1С). Неструктурированные не имеют четкого формата (текст писем, сканы, аудиозаписи, видео).
Синтетические данные
Искусственно сгенерированные данные, которые повторяют статистические свойства реальных, но не содержат реальной конфиденциальной информации.
Разметка данных
Ручной процесс присвоения меткам, тегам или классам сырым данным (фотографиям, текстам, логам), чтобы нейросеть могла на них учиться.
Очистка данных
Процесс выявления и исправления (или удаления) неточных, дублирующихся или устаревших записей в базах данных предприятия перед внедрением ИИ.