Дослідники зламали OpenAI за допомогою Claude
Дослідники з безпеки стартапу Hacktron AI використали модель Claude від Anthropic, щоб знайти спосіб проникнення в інфраструктуру OpenAI. Атаку провели в межах програми винагороди за пошук вразливостей. За виявлені проблеми OpenAI виплатила команді $6500.
Результати контрольованого інструменту
Першу вразливість Hacktron знайшов у платформі Discourse. Точка входу виявилася досить буденною: завантаження зображення у форматі HEIF або HEIC. Discourse конвертувала такі файли у JPEG за допомогою кількох інструментів. Спочатку зображення обробляв ImageMagick, а для декодування форматів Apple використовувалася бібліотека libheif.
Саме в libheif дослідники виявили помилку роботи з пам’яттю. Спеціально сформований файл змушував бібліотеку неправильно розраховувати розташування даних, що дозволяло виконати власний код на сервері.
Для пошуку способу експлуатації вразливості Hacktron використав спеціальну версію Claude Opus, призначену для досліджень у сфері кібербезпеки. За словами команди, Opus 4.8 протягом кількох сесій не зміг створити робочий експлойт. Ситуація змінилася після виходу Opus 5. Дослідники повторно поставили моделі ту саму задачу, і цього разу вона змогла знайти працездатний спосіб використання помилки.
Отримавши доступ до сервера Discourse, команда знайшла другу вразливість. Вона дозволила захопити облікові записи користувачів ChatGPT і Codex, серед яких були акаунти співробітників OpenAI.
Дослідники припинили атаку після того, як повідомили компанії OpenAI та Discourse про знайдені проблеми.