Назад в «Глоссарий» Глоссарий

Обучение с подкреплением (RLHF)

«ИИ не знает этики бизнеса, пока живой эксперт не покажет ему границы дозволенного.»

Именно RLHF (Reinforcement Learning from Human Feedback) превратило «сырые» языковые модели в удобных ассистентов, которые не грубят и стараются быть полезными. Для корпоративного заказчика важно понимать одно: вы покупаете модель с уже настроенным RLHF от вендора. И эти настройки могут конфликтовать с вашими бизнес-целями. Модель может отказываться анализировать конфиденциальный договор, потому что вендор запретил ей читать «чужие секреты». В проектах с закрытым контуром мы используем открытые модели с возможностью кастомного выравнивания (alignment). Если завод запускает ИИ для проверки работы ОТК, нам не нужно, чтобы модель была «вежливой» или «этичной» — нам нужно, чтобы она была безжалостно точной и дотошной. В редких случаях крупному Enterprise приходится применять локальный RLHF, нанимая экспертов-методологов, которые будут размечать ответы системы (например, при генерации ТЭО), чтобы алгоритм перенял уникальную корпоративную экспертизу.

Позвоните +7 (911) 277-18-14 Напишите alex@anovichkov.ru Наш Telegram-канал