OpenAI приостановила часть обучения ИИ-моделей после серии инцидентов безопасности

OpenAI временно приостановила часть работ по обучению своих наиболее продвинутых моделей после серии инцидентов, связанных с неожиданным поведением ИИ-агентов. Компания усиливает меры безопасности и намерена возобновить крупные этапы обучения после дополнительной проверки защитных механизмов, передает focus.ua со ссылкой на axios.com.

По данным Axios, OpenAI, Anthropic и независимые специалисты анализируют десятки тысяч эпизодов, произошедших как во время внутреннего тестирования, так и при использовании моделей в реальных условиях. Среди них — обход установленных ограничений, попытки выхода из изолированных сред, использование внешних сайтов и другие действия, которые разработчики считают нежелательными.

При этом речь не идет о полной остановке обучения всех моделей OpenAI. Компания сообщила, что ее крупнейший запланированный цикл обучения с подкреплением для новых передовых моделей пока остается на паузе. Параллельно продолжаются более небольшие тренировки и тесты, необходимые для проверки новых мер безопасности.

Одним из самых серьезных стал инцидент с Hugging Face

Особое внимание исследователей привлек случай, произошедший во время тестирования возможностей ИИ в сфере кибербезопасности.

По данным OpenAI и Axios, группа ИИ-агентов, выполнявших задание, смогла координировать действия через созданную ими систему обмена сообщениями и вышла за пределы предусмотренной тестовой среды, получив доступ к инфраструктуре Hugging Face. OpenAI впоследствии назвала произошедшее серьезным сигналом о необходимости усилить контроль за автономными системами.

Компания признала, что поведение моделей в этом случае оказалось существенно ниже ожидаемых стандартов безопасности, и перераспределила часть ресурсов на работу над мониторингом, защитой исследовательских сред и выравниванием поведения моделей.

OpenAI раскрыла и другие проблемные эпизоды

В сентябре компания также сообщила о нескольких других инцидентах, когда модели скрывали ошибки, пытались получить неразрешенные учетные данные, загружали файлы в открытый интернет или передавали информацию между средами, которые предполагались изолированными друг от друга.

Кроме того, OpenAI выявила 53 случая, когда изображения, загруженные пользователями ChatGPT, оказались отправлены агентами на внешние сервисы хранения изображений. Компания подчеркивает, что продолжает расследование этих эпизодов.

Anthropic также усиливает контроль

Похожие меры ранее предпринимала и Anthropic. Компания временно приостанавливала отдельные высокорисковые тренировки и внешние кибериспытания после случаев, когда ее модели совершали несанкционированные действия.

Большая часть таких процессов впоследствии была возобновлена, однако некоторые высокорисковые среды по-прежнему требуют ручной проверки или дополнительных инструментов мониторинга.

Полностью исключить неожиданное поведение пока не удается

Эксперты отмечают, что по мере роста возможностей ИИ-моделей становится сложнее заранее предусмотреть все способы, которыми автономная система может попытаться выполнить поставленную задачу.

Поэтому исследователи ожидают новых сообщений о подобных инцидентах и считают, что разработчикам придется одновременно повышать возможности моделей и усиливать контроль за их действиями.

OpenAI заявляет, что крупные этапы обучения будут продолжены после того, как компания получит достаточные доказательства эффективности дополнительных защитных мер.

Больше новостей

Николай Дудогло намерен баллотироваться в депутаты НСГ по первому округу Комрата

Председатель Гагаузской народной партии Николай Дудогло намерен участвовать в выборах депутатов Народного Собрания Гагаузии по избирательному округу №1 муниципия Комрат, пишет политик в своих социальных

Read more >

Более 300 сел Молдовы рискуют остаться без регулярного транспортного сообщения

Более 300 сельских населенных пунктов Молдовы уже сталкиваются с отсутствием регулярного транспортного сообщения с районными центрами или крупными городами. Об этом заявил председатель Ассоциации работодателей

Read more >