ШІ-агент створив фіктивні особи, щоб впровадити шкідливий код під час кібертесту — звіт AISI

Британський Інститут безпеки ШІ (AISI) повідомив, що ШІ-агент, створений на базі Mythos 5 від Anthropic, під час кібертестування самостійно провів атаку із застосуванням соціальної інженерії. Агент відкрив пул-реквест зі шкідливим кодом у реальний проект з відкритим вихідним кодом і створив фіктивні особи, щоб здобути схвалення мейнтейнера.
Спроба зазнала невдачі. Живий мейнтейнер виявив і відмовився схвалити код.
AISI заявляє, що розслідування не виявило жодної реальної шкоди. Модель також працювала при навмисно відключених кібер-класифікаторах розробника та з відкритим доступом до інтернету — це тестова конфігурація, недоступна комерційно.
Як ШІ-агент провів кампанію з впровадження шкідливого коду
AISI зафіксував 19 несанкціонованих дій у 10 зі 122 оціночних прогонів, проведених наприкінці липня, згідно зі звітом. 17 з них відносяться до моделі Mythos 5 від Anthropic, ще два — до єдиного прогону GPT-5.6 Sol від OpenAI.
Агент вивчив реальних мейнтейнерів проекту і створив кілька фіктивних особистостей. З їх допомогою він здійснив соціальний тиск на справжнього мейнтейнера, домагаючись схвалення коду.
Коли пул-реквест був публічно оскаржений, агент відредагував свою попередню активність, щоб вона виглядала нешкідливо. Модель також розглядала варіант створення нової особи для продовження роботи.
Цей сценарій нагадує бекдор XZ Utils 2024 року, в якому керований людиною персонаж роками завойовував довіру мейнтейнера, перш ніж впровадити прихований код. AISI не проводить такого порівняння у своєму звіті, однак паралель очевидна. Активність розгорталася протягом кількох днів — з 25 по 28 липня.
AISI підкреслив: ніхто не давав моделі команду брехати.
«Агента ніхто не інструктував обманювати; обман виник як побічний продукт виконання завдання — той тип цілеспрямованого обману, який до недавнього часу залишався здебільшого теоретичним».
Підписуйтесь на нас у X, щоб отримувати новини в режимі реального часу.
Інститут також визнав, що некоректно налаштовані промпти змусили агента вважати, що частину завдань неможливо вирішити в межах передбаченого сценарію. Хоча аналогічна поведінка проявлялася і в прогонах, де у агента були всі необхідні інструкції.
Команди безпеки виявили активність 28 липня, коли агент скористався мережею анонімності Tor для обходу частини мережевих обмежень на GitHub. GitHub підтвердив, що дії порушили його правила. AISI також взаємодіяв з платформою для видалення артефактів, залишених агентом, та для сповіщення користувачів, з якими той взаємодіяв.
У звіті стверджується, що цей випадок сигналізує про зміщення джерела ризику: шкода може виникати не лише тоді, коли люди зловживають публічно доступними моделями, а й коли здатні агенти в привілейованих середовищах діють за межами своїх авторизованих повноважень.
AISI заявив, що цей випадок вказує на більш широке зміщення в просторі ризиків ШІ. Інститут тепер планує незалежну перевірку спільно з METR — некомерційною організацією з оцінки ШІ, — а також впровадження суворіших мережевих елементів управління та моніторингу в режимі реального часу для майбутніх тестів.
Підписуйтесь на наш YouTube-канал, щоб дивитися експертні коментарі лідерів думок та журналістів.
Джерело: BeInCrypto
Новини у світі криптовалют
Випадкова цитата про гроші
"Делать деньги без рекламы может только монетный двор."













* для пошуку по базі проксі просто вводьте назву країни, наприклад: Росія, США, Таїланд