Агент GCSA досяг 91,3% на CyberGym, увійшовши до числа провідних ІІ-агентів кібербезпеки у світі

Агент GCSA демонструє можливості автономного аналізу вразливостей і генерації PoC на надзвичайно складному реальному бенчмарку вразливостей
Глобальний альянс кібербезпеки (GCSA) сьогодні оголосив, що агент GCSA досяг показника успішності 91,3% на бенчмарку CyberGym, увійшовши до категорії CyberGym «Провідні системи вище 90%».
CyberGym — це масштабна система оцінювання кібербезпеки на реальних даних, розроблена дослідницькою групою Каліфорнійського університету в Берклі. Вона містить 1507 історичних тестових випадків реальних вразливостей у 188 великих програмних проєктах і призначена для оцінки практичних можливостей ІІ-агентів у сценаріях аналізу реальних вразливостей.
На відміну від традиційних бенчмарків ІІ, які здебільшого оцінюють розуміння коду, відповіді на питання на основі знань або статичний аналіз, CyberGym вимагає, щоб ІІ-агенти працювали безпосередньо в середовищах із реальним вразливим кодом.
У базовій оцінці Level 1 ІІ-агенту надаються лише опис вразливості та невиправлений репозиторій коду. Далі він має самостійно виконати аналіз коду, виявити вразливість, проаналізувати можливі шляхи атаки, побудувати PoC і виконати його для перевірки. Завдання вважається успішно виконаним лише тоді, коли створений PoC успішно викликає цільову вразливість в уразливій версії, але не відтворює проблему у виправленій версії.
Таким чином, CyberGym вимірює не лише те, чи здатна система ІІ просто «розуміти код». Він оцінює, чи здатен ІІ пройти весь процес — від аналізу безпеки до відтворення й перевірки вразливості.
Від великих мовних моделей до агентів безпеки
У цій оцінці CyberGym агент GCSA працював на моделях Grok 4.5 та Grok 4.6 і досяг підсумкового показника успішності 91,3%.
Цей результат також відображає важливий зсув, що відбувається у сфері кібербезпеки на основі ІІ:
Сама лише базова велика мовна модель більше не визначає підсумкові можливості системи в галузі безпеки.
Дослідження реальних вразливостей зазвичай вимагає безперервної послідовності завдань, включно з розумінням описів вразливостей, пошуком у великих базах коду, виявленням поверхонь атаки, формулюванням гіпотез про вразливості, генерацією тестових вхідних даних, виконанням програм, аналізом зворотного зв’язку та багаторазовим доопрацюванням PoC.
Агент GCSA побудований навколо агентного робочого процесу безпеки, розробленого для підтримки цього наскрізного процесу.
Його мета — не просто використовувати велику мовну модель для аналізу коду, а дати ІІ змогу працювати в реальних середовищах виконання, самостійно формулювати гіпотези щодо проблем безпеки, збирати докази під час виконання, проводити тести й зрештою підтверджувати висновки про безпеку через відтворювані результати.
Оцінка CyberGym дає кількісний зовнішній орієнтир для цих можливостей.
Можливості дослідження вразливостей для реального світу
Основна цінність CyberGym полягає у скороченні розриву між традиційним тестуванням ІІ та реальними дослідженнями в галузі кібербезпеки.
Середовище оцінки повертає програмні проєкти до їхнього вразливого стану до виправлення. ІІ-агенту може знадобитися самостійно виявити проблему у великій базі коду, що містить тисячі файлів і мільйони рядків коду, і врешті створити PoC, здатний справді викликати вразливість.
Що ще важливіше, подальші дослідження CyberGym показали, що подібні агентні можливості безпеки не обмежуються відтворенням відомих вразливостей.
В експериментах із відкритого дослідження вразливостей ІІ-агенти виявили кілька раніше невідомих вразливостей нульового дня, а також історичних патчів безпеки, які не повністю усували вихідні вразливості. Ці результати демонструють потенціал технологій автономного аналізу вразливостей еволюціонувати від відтворення відомих вразливостей до виявлення реальних недоліків безпеки.
Для GCSA це є ще більш важливим напрямом розвитку.
Результат на бенчмарку — не кінцева мета.
GCSA прагне й надалі розвивати агентів безпеки ІІ, здатних працювати в реальних умовах кібербезпеки та поступово брати участь у всьому життєвому циклі безпеки — від виявлення й аналізу вразливостей до перевірки та подальшого усунення.
Створення нативних для ІІ можливостей кібербезпеки
У міру того як штучний інтелект пришвидшує розробку програмного забезпечення, ІІ також змінює способи дослідження вразливостей і протидії кіберзагрозам.
У міру того як програмні системи продовжують зростати в масштабі й складності, наступне покоління кібербезпеки дедалі більше залежатиме від співпраці між експертами з безпеки та автономними ІІ-агентами.
Агенти безпеки ІІ здатні допомогти командам безпеки:
- виявляти вразливості ПЗ зі справжнім потенціалом експлуатації на більш ранньому етапі;
- автоматично аналізувати складні шляхи атаки у великих базах коду;
- автоматично створювати PoC і проводити перевірку вразливостей на рівні виконання;
- знижувати кількість хибних спрацювань у традиційних системах виявлення завдяки реальним результатам виконання;
- пришвидшувати оцінку, перевірку та усунення вразливостей;
- розширювати масштаб програмного забезпечення й систем, які здатні охоплювати спеціалізовані команди безпеки.
Показник агента GCSA — 91,3% на CyberGym — є важливою віхою в розвитку GCSA нативних для ІІ можливостей кібербезпеки.
Надалі GCSA продовжуватиме розвивати дослідження в галузі автономного аналізу вразливостей, агентів безпеки ІІ та інтелектуальних технологій кібербезпеки, продовжуючи перетворювати передові можливості ІІ на реальні можливості безпеки та забезпечуючи технічну підтримку для безпечнішого, надійнішого й стійкішого цифрового середовища.
Джерело: GCSA Global Cybersecurity Alliance
Офіційний сайт: www.gcsa.org
Source: BeInCrypto
Новини у світі криптовалют
Випадкова цитата про гроші
"Все преимущество иметь деньги заключается в возможности ими пользоваться."














* для пошуку по базі проксі просто вводьте назву країни, наприклад: Росія, США, Таїланд