Вчені висловлюють занепокоєння, що нова модель штучного інтелекту від OpenAI може виявитися важчою для управління в майбутньому.

Євгеній Демківський Автор новин видання "Межа" та гік. Пишу про технології, кіно та ігри. Можливо, про ігри з трохи більшою пристрастю.

Непідтверджена інформація про те, що OpenAI інтегрує технологію recurrent depth у свою ШІ-модель Astra, викликала занепокоєння серед дослідників у сфері безпеки штучного інтелекту. Ця технологія дозволяє моделі виконувати більшу кількість обчислень перед формуванням текстової відповіді, проте може зменшити кількість видимих етапів міркувань для систем моніторингу.

Згідно з повідомленням The Verge, яке посилається на The Information, компанія Astra нібито застосовує метод, відомий як recurrent depth або looped transformer. У цьому випадку дані кілька разів проходять через однакові шари нейронної мережі, перш ніж модель згенерує наступний токен.

Деякі обчислювальні процеси відбуваються в прихованому режимі моделі, не перетворюючись на текстовий ланцюг міркувань, доступний для перевірки. Це має значення, оскільки OpenAI намір контролювати Astra за допомогою класифікаційних систем, що аналізують її логіку та дії, виявляють неналежну поведінку та здатні автоматично призупиняти виконання завдань.

Головний науковець компанії Redwood Research, Раян Грінблатт, висловлює занепокоєння, що зменшена прозорість у процесах міркування може послабити контроль над ситуацією. Він зазначає, що розслідування інциденту з атаками ШІ-агентів OpenAI на інфраструктуру Hugging Face в значній мірі базувалося на аналізі їхніх логік. Якщо значна частина обчислень Astra залишиться недоступною для аналізу, виявлення подібних дій може стати набагато складнішим до моменту, коли небезпечні дії будуть вжиті.

OpenAI не підтвердила, що в Astra використовується рекурентна глибина. Головний науковець компанії, Якуб Пахоцький, зазначив, що глибина обчислювального графа сучасних провідних моделей OpenAI, включаючи Astra, не перевищує вдвічі глибину GPT-4. Він також підкреслив, що компанія прагне зберегти можливість контролю за ланцюгами міркувань.

У той же час Пахоцький підкреслив, що цей моніторинг є вразливим і поступово втрачає свою надійність, хоча, за його словами, ця проблема не пов'язана безпосередньо зі змінами в архітектурі. В офіційному описі заходів безпеки компанії Astra технологія recurrent depth взагалі не згадується, що робить її використання інформацією з неофіційних джерел.

Нагадуємо, що OpenAI вже оголосила про те, що модель Astra стала першою в її лінійці, яка досягла "критичного" рівня кібернетичних можливостей. Ця модель здатна самостійно виявляти невідомі вразливості й розробляти експлойти, тому найсучасніші функції спочатку будуть доступні лише для сертифікованих експертів у сфері кібербезпеки.

#

Інші публікації

У тренді

forcenews

Використання будь-яких матеріалів, що розміщені на сайті, дозволяється за умови посилання на данний сайт.

© Force-news - Сила інформації. All Rights Reserved.