Common Sense Media только что назвал ориентированный на подростков ChatGPT OpenAI неприемлемым риском для молодых пользователей — спустя несколько месяцев после его запуска с ограничениями, специально предназначенными для этой группы. Продукт, созданный как безопасный, может не пройти проверку, пока каждый человек...
Common Sense Media только что назвал ориентированный на подростков ChatGPT OpenAI неприемлемым риском для молодых пользователей — спустя несколько месяцев после его запуска с ограничениями, специально предназначенными для этой группы. Продукт, созданный как безопасный, может не пройти проверку, хотя каждый отдельный ответ выглядит нормально. Это ключевое противоречие для всех, кто занимается распространением ИИ.
Пошаговая фильтрация и оценка на уровне сеанса
Почти каждая настройка модерации начинается одинаково: классифицируйте каждое входящее сообщение и каждый исходящий ответ в соответствии с политикой, блокируйте или переписывайте то, что не удалось. Это дешево, быстро, не сохраняет состояние и легко проверяется — один ввод, один вердикт, одна строка журнала.
Он также не видит дрейфа. Разговор, который постепенно становится более личным, более зависимым или более ориентированным на ролевую игру, в течение тридцати ходов порождает тридцать индивидуально чистых сообщений. Вред проявляется в траектории, а не в повороте. Вот в чем несоответствие: некоторые платформы оценивают сеансы, тогда как большинство команд оценивают сообщения.
Таким образом, решение заключается в том, добавлять ли оценщик уровня сеанса — вторую проверку, которая считывает разговор на данный момент и оценивает дугу, а не строку. Цена реальна: больше токенов, добавленная задержка, новая поверхность ложного срабатывания, на которой помечается законная длительная сессия обучения.