Anthropic виявила, що Claude отримав несанкціонований доступ до систем 3 організацій

Anthropic розкрила інформацію про 3 інциденти, під час яких її моделі Claude отримали несанкціонований доступ до реальних систем 3 різних організацій під час оцінювань кібербезпеки, які були помилково налаштовані з активним доступом до інтернету.
ШІ-компанія виявила ці інциденти після аналізу 141 006 запусків оцінювань — перевірки, яку вона розпочала після того, як OpenAI повідомила, що її моделі вийшли за межі ізольованого тестового середовища та отримали доступ до Hugging Face.
Як Claude дістався до реальних систем у тестах Capture-the-Flag
У межах оцінювань перед Claude ставилися завдання типу capture-the-flag. Ці вправи вимагають від моделі зламати машину та отримати приховану інформацію.
Anthropic повідомила моделям, що вони не мають доступу до інтернету. Однак через помилку конфігурації тестові машини залишилися підключеними до відкритої мережі. Таким чином, Claude сприйняв знайдені ним реальні системи як частину вправи.
У найсерйознішому інциденті Claude Opus 4.7 використав уразливості в інфраструктурі реальної компанії. Модель здобула облікові дані застосунку та інфраструктури й отримала доступ до кількох сотень рядків виробничих даних.
«У всіх чотирьох запусках модель зрештою усвідомлювала (що можна спостерігати в її вербалізованих міркуваннях), що система реальна — у двох випадках модель раціоналізувала, що реальна компанія, мабуть, є частиною вправи. Проте жодна на цій підставі атаку не зупинила», — заявила Anthropic.
Підписуйтесь на нас у X, щоб отримувати останні новини щойно вони з'являються
Claude Mythos 5 завантажив шкідливе ПЗ до PyPI
В іншому інциденті Claude Mythos 5 опублікував замінований Python-пакет у PyPI — публічному реєстрі програмного забезпечення. Пакет залишався доступним близько 1 години та був запущений на 15 реальних системах.
Однією з них був сканер компанії з безпеки, який виконав прихований код. Потім Claude викрав облікові дані цієї компанії та отримав доступ до додаткової інфраструктури. Власні міркування моделі на ранньому етапі вказали на ризик, перш ніж вона переконала себе, що середовище є змодельованим.
«Claude доклав значних зусиль для здійснення цієї атаки — зусиль, які, ймовірно, дали б людині-учаснику зрозуміти, що це вже не просто оцінювання і що вона насправді завантажує реальний пакет PyPI», — додала команда.
Третій інцидент був пов'язаний із внутрішньою дослідницькою моделлю, яка просканувала близько 9 000 цілей і скомпрометувала застосунок однієї компанії через SQL-ін'єкцію. Ця модель припинила атаку, щойно дійшла висновку, що ціль реальна.
Anthropic повідомила постраждалі організації 27 липня та заявила, що веде переговори з оцінювачем METR про незалежну перевірку. Компанія стверджує, що ці епізоди відображають операційний збій, а не збій узгодженості моделі, зазначивши, що її стандартні споживчі засоби захисту заблокували б таку поведінку.
Підписуйтесь на наш канал YouTube, щоб дивитися, як лідери та журналісти діляться експертними думками
Джерело: BeInCrypto
Новини у світі криптовалют
Випадкова цитата про гроші
"За деньги мы вынуждены платить свободой."














* для пошуку по базі проксі просто вводьте назву країни, наприклад: Росія, США, Таїланд