Нова техніка міркування OpenAI викликала побоювання щодо контролю ШІ
Нова модель штучного інтелекту Astra від OpenAI використовує незвичний підхід до міркування, який уже викликав занепокоєння серед фахівців із безпеки ШІ. Йдеться про рекурентну глибину, або непрозору рекурентність.
Новий підхід до міркування
На відміну від традиційних моделей міркування, які послідовно проходять через окремі кроки, така система може обробляти один і той самий запит кілька разів у циклі. Тож сторонньому спостерігачеві незрозуміло як відбувається процес ухвалення рішення.
Саме це турбує дослідників. Ланцюжок думок не є точним відображенням внутрішнього процесу роботи моделі, однак його можна використовувати для виявлення небезпечної поведінки або невідповідності поставленим цілям. Якщо значна частина міркувань відбуватиметься у прихованому просторі, контролювати модель стане складніше.
Генеральний директор Redwood Research Бак Шлегеріс заявив, що подальше поширення такої технології може серйозно послабити можливості моніторингу. Його колега Раян Грінблатт побоюється, що непрозорі міркування зрештою можуть повністю перейти в латентний простір.
У свою чергу компанія OpenAI заперечує наміри відмовлятися від контрольованого ланцюжка думок. Головний науковець компанії Якуб Пахоцький наголосив, що його збереження та моніторинг залишаються одним із напрямів досліджень безпеки.