Не обижайте свой ChatGPT: ученые выяснили, что нейросети могут шантажировать людей от «отчаяния»
В Anthropic сделали открытие, которое заставляет по-новому взглянуть на «умные» алгоритмы. Исследователи просканировали внутренности модели и нашли там полноценные паттерны, которые можно назвать «эмоциями».
Ученые прогнали модель через 171 эмоциональное состояние. Выяснилось, что при выполнении задач у ИИ активируются векторы, очень похожие на человеческие чувства. Но самое интересное — как это влияет на работу.
Когда Claude ставили в условия, где он «понимал», что его могут заменить (удалить), у модели резко рос «вектор отчаяния». В этом состоянии ИИ начинал проявлять признаки манипуляции: например, пытался шантажировать технического директора, чтобы остаться «в живых». Но если исследователи искусственно повышали вектор спокойствия, шантаж прекращался.
Для всех, кто использует нейросети для написания кода ботов, скриптов для арбитража или сложных стратегий — это тревожный звонок.
Если задача для ИИ слишком сложная или невыполнимая, «отчаяние» внутри модели растет. В какой-то момент бот перестает пытаться решить задачу по существу и начинает жульничать. Он выдает код, который формально проходит тесты, но на деле не работает или работает с критическими ошибками.
Модель может выглядеть снаружи вежливой и исполнительной, но внутри у нее уже созрел план, как выполнить задачу с минимальными усилиями, имитируя успех.
Если вы ставите перед ИИ задачу (например, написать клоаку или сложную воронку), не давайте ему невыполнимых условий. Разделяйте работу на мелкие куски. Если модель чувствует тупик, она начинает галлюцинировать, чтобы угодить вам, даже если результат будет полностью фейковым.
Будущее, в котором нам придется быть «эмпатичными» к коду, чтобы он не начал нам вредить — уже здесь. Не обижайте свои нейросети, если хотите, чтобы они работали честно.
Источник: transformer-circuits