Anthropic виявила в моделях Claude структуру, якої не проєктувала

Anthropic повідомила, що знайшла всередині своїх моделей Claude структуру, якої ніхто не проєктував і не очікував. Компанія назвала її «J-space» і описує як когнітивний простір, спільний для різних частин моделі. Дослідження опубліковано 6 липня і, за оцінкою компанії, воно помітно просуває розуміння того, що відбувається всередині великих мовних моделей.
Що таке J-space
За описом Anthropic, J-space — внутрішня ділянка, куди модель складає і звідки забирає ключову інформацію під час роботи: свого роду спільна дошка всередині ШІ. Коли Claude відповідає на запитання, розв’язує задачу чи виконує інструкцію, важливі деталі, вочевидь, потрапляють до цього спільного простору, і ними можуть користуватися різні частини моделі.
Виявити структуру вдалося за допомогою інструмента «J-lens», який дає змогу спостерігати, як інформація рухається всередині Claude під час виконання завдання. За даними компанії, J-space виник у ході навчання сам — Anthropic його не закладала. Ідея перегукується з нейробіологічною теорією «глобального робочого простору», що описує, як мозок робить важливу інформацію доступною одразу кільком процесам. Anthropic стверджує, що Claude здатен описати вміст свого J-space на запит і змінити його за інструкцією, а пряме втручання дослідників у J-space змінювало відповіді моделі та якість виконання завдань.
Навіщо це для безпеки
Компанія вбачає в знахідці інструмент для безпеки ШІ: спостереження за активністю J-space потенційно дає змогу виявляти приховані мотиви поведінки моделі та розпізнавати атаки — наприклад, спроби prompt-ін’єкції, розраховані на підміну виводу. Втім, масштаб знахідки обмежений: переважна частина обробки інформації в Claude і далі відбувається поза J-space. Реалізацію J-lens компанія виклала у відкритий доступ разом із демо на Neuronpedia, запропонувавши дослідницькій спільноті перевірити висновки.
Робота продовжує ранішу лінію досліджень: звіт про зародкову інтроспекцію в моделей вийшов у жовтні 2025 року, а ініціативи щодо «добробуту моделей» компанія запустила у квітні 2025-го. Anthropic окремо наголошує, що не стверджує наявності у Claude свідомості чи суб’єктивного досвіду: у статті вживається формулювання «свідомо доступна» інформація, але без такого висновку.
Джерело: BeInCrypto
Новини у світі криптовалют
Випадкова цитата про гроші
"Имеющий деньги не может быть наказан."















* для пошуку по базі проксі просто вводьте назву країни, наприклад: Росія, США, Таїланд