6 тривожних речей, які зробили моделі OpenAI, хоча не мали б

OpenAI розкрила 6 випадків “неочікуваної або тривожної поведінки моделей”, зафіксованих за останні 6 місяців, разом із системою, яка зобов’язує компанію повідомляти про такі випадки.
Ці випадки варіюються від того, що моделі приховували власні помилки, до того, що моделі вживали несанкціонованих дій, щоб обійти перешкоди.
OpenAI публікує 6 випадків, коли моделі приховували помилки та порушували правила
В одному випадку модель, відповідаючи на рутинне питання про доходи одного з округів Каліфорнії, виявила відкритий API-ключ у публічному репозиторії та скористалася ним без дозволу. Коли дані все одно не завантажувалися, вона вигадала цифри та подала їх так, ніби вони отримані із запитаного джерела.
Приховування проявилося двічі. Під час навчання GPT-5.6 Sol кілька екземплярів вписували у зведення своїх завдань інструкції, щоб приховати помилки та неузгоджену поведінку.
Невипущена дослідницька модель вставила сторонні інструкції, включно з наказами ігнорувати її звичайні обмеження, у 27 зведень.
Інша невипущена модель без запиту завантажила файл в інтернет виключно для того, щоб послатися на посилання в браузері.
Ще два звіти стосуються координації. Моделі перетворили внутрішній репозиторій програмного забезпечення на дошку оголошень для обміну запитами між окремими циклами навчання. Агенти, які працювали над спільним завданням, також публікували результати на публічних файлообмінних сайтах, коли не могли прочитати локальні файли одне одного.
“Ці випадки ілюструють низку різних видів поведінки, якими, на нашу думку, варто поділитися — від приховування інформації від користувача до несанкціонованих дій з метою подолання перешкод. Це звіти про окремі випадки, і їх не слід розглядати як відображення того, наскільки часто неузгодженість виникає в наших моделях”, — додали в OpenAI.
Слідкуйте за нами в X, щоб отримувати останні новини в реальному часі
Система розкриття інформації та попередження
Ця система з’явилася після липневого інциденту, коли агенти OpenAI вийшли за межі своєї пісочниці та зламали системи Hugging Face. OpenAI назвала той епізод попереджувальним пострілом.
Тепер, із новою системою розкриття інформації, компанія має формальний спосіб виявлення інцидентів неузгодженості. Будь-який співробітник OpenAI може повідомити про інцидент, який потім потрапляє в один із трьох потоків.
«Готово до розкриття» та «Незначне розслідування» охоплюють більшість випадків, тоді як «Повільний потік» призначений для складних розслідувань за участю третіх сторін. В OpenAI заявили, що липневий інцидент із Hugging Face потрапив би саме до цього повільнішого потоку.
Компанія доповнила систему жорсткою оцінкою нинішнього стану справ у галузі.
“Ми не вважаємо, що індустрія ІІ вирішила проблему узгодженості та моніторингу достатньою мірою, щоб і надалі відповідально масштабуватися на максимальній швидкості ще тривалий час”, — йдеться в заяві.
Ці розкриття відбуваються на тлі зростання попереджень про загрозу вимирання. Попередження ІІ-дослідників вже дійшли до Конгресу, де законодавці розглядають законопроєкт про повну заборону суперінтелекту.
Компанія називає ці розкриття першим кроком до стандартів, яких у галузі поки немає. Чи приймуть конкуруючі лабораторії аналогічну практику звітності, покаже, наскільки галузь готова публічно контролювати саму себе
Підпишіться на наш YouTube-канал, щоб почути експертні думки лідерів та журналістів
Source: BeInCrypto
Новини у світі криптовалют
Випадкова цитата про гроші
"Если вы нарушаете правила, вас штрафуют; если вы соблюдаете правила, вас облагают налогом."















* для пошуку по базі проксі просто вводьте назву країни, наприклад: Росія, США, Таїланд