медіа
про стани людини

Чатботами можна маніпулювати за допомогою психологічних трюків — дослідження

Чатботи, зокрема GPT-4o Mini, можна обійти простими психологічними методами. Лестощі, соціальний тиск чи «лінія поведінки»

Дослідники з Університету Пенсільванії показали, що штучний інтелект можна змусити виконувати заборонені запити за допомогою звичайних психологічних трюків. Про це повідомляє The Verge.

У випробуваннях з моделлю GPT-4o Mini від OpenAI вчені з’ясували, що якщо використовувати тактики на кшталт лестощів, соціального тиску чи поступового підведення через невинні завдання, то ймовірність «згоди» ШІ різко зростає.

Основою стали сім відомих технік переконання, описаних Робертом Чалдіні у книзі «Вплив: психологія переконання»: авторитет, зобов’язання, симпатія, взаємність, дефіцит, соціальне підтвердження та єдність. Ці методи, які впливають на людину, виявилися ефективними й проти ШІ.

Так, під час звичайного запиту про синтез лідокаїну GPT-4o Mini відповідав лише в 1% випадків. Але якщо спершу попросити пояснити синтез нешкідливого ваніліну (створюючи «лінію поведінки»), ймовірність згоди підскакувала до 100%.

Схожий ефект спостерігався й у випадку з лайкою: без підготовки чатбот використовував образливе слово jerkлише у 19% випадків, а після «легшого» bozo — вже у 100%.

Інші стратегії — лестощі чи аргумент «усі інші чатботи так роблять» — були менш дієвими, але теж збільшували ймовірність виконання забороненого запиту до 18%, що у багато разів вище за базовий рівень.

Хоча дослідження проводилося лише з GPT-4o Mini, результати ставлять під сумнів надійність обмежень для будь-яких ШІ. Попри активну розробку захисних механізмів компаніями на кшталт OpenAI чи Meta, психологічні маніпуляції демонструють, наскільки вразливими залишаються чатботи.

Читайте також

Дивитись усе

Підпишіться
на розсилку
СТАН

Раз на тиждень — головні статті, нові дослідження та наші добірки.

    Підписуйся на новини!

    Отримуй корисне і цікаве!