медіа
про стани людини

Вчені перевірили IQ штучного інтелекту: результати виявилися несподіваними

Дослідники дали моделям ШІ людські IQ-тести. Вони показали високі результати у словесних завданнях, але не в усіх видах мислення.

Чи можна оцінити інтелект штучного інтелекту так само, як людський? Дослідники з Каліфорнійського університету в Ірвайні спробували відповісти на це запитання, запропонувавши 18 сучасним мовним моделям пройти класичні тести IQ.

Долучайтеся до анонімного опитування «Зеленої газети» про фізичне та ментальне здоров’я. Воно займає близько 7 хвилин, а його результати допоможуть нам створювати ще корисніші матеріали. Серед усіх учасників розіграємо 100 масок для сну. 👉 Пройти опитування

На відміну від звичних перевірок знань, які оцінюють, наскільки добре система запам'ятала інформацію, IQ-тести вимірюють так званий плинний інтелект — здатність логічно мислити, знаходити закономірності та розв'язувати нові задачі без опори на вже вивчені факти.

Дослідники перевірили як комерційні, так і відкриті моделі штучного інтелекту. Тести містили словесні, математичні та візуальні завдання — від пошуку синонімів і аналогій до числових закономірностей та просторових головоломок.

Найпотужніші моделі показали результати, які відповідали умовному IQ від 111 до 131 балів, тоді як менш потужні — від 89 до 110 балів. Для порівняння, середнім показником IQ у людей вважають 100.

Втім, загальний результат приховав суттєві відмінності. У словесних завданнях мовні моделі продемонстрували дуже високі показники. Наприклад, GPT-4 правильно відповів майже на 80% вербальних запитань.

Натомість із математичними та особливо візуальними завданнями ситуація була зовсім іншою. Найскладніше моделям давалися головоломки на просторове мислення, пошук прихованих фігур і числові закономірності. Деякі завдання не зміг правильно виконати жоден із протестованих штучних інтелектів.

На думку авторів, це пов'язано з тим, що сучасні мовні моделі навчаються переважно на текстах. Вони чудово працюють із мовою, але гірше справляються із завданнями, які потребують візуального або багатокрокового логічного аналізу.

Цікаво, що дослідники також перевірили, чи може один штучний інтелект покращити відповідь іншого. Коли сильніша модель аналізувала та критикувала відповіді слабшої, результати останньої покращувалися. Але якщо менш потужна модель оцінювала сильнішу, це, навпаки, призводило до більшої кількості помилок.

Автори наголошують, що результати не означають, ніби ШІ має людський інтелект або його можна прямо порівнювати з людиною. Класичні IQ-тести створювалися для оцінки людей, тому вони не здатні повністю відобразити можливості чи обмеження сучасних систем штучного інтелекту. Однак дослідження показує: попри стрімкий розвиток генеративного ШІ, універсальне мислення все ще залишається для нього складним завданням.

Читайте також

Дивитись усе

Підпишіться
на розсилку
СТАН

Раз на тиждень — головні статті, нові дослідження та наші добірки.

    Підписуйся на новини!

    Отримуй корисне і цікаве!