Данные — это новые ресурсы, а аналитика — новый навык. (автор не известен)

OpenAI создает систему для выявления ошибок выравнивания своих моделей


OpenAI создает систему для выявления ошибок выравнивания своих моделей

Модель искусственного интеллекта может пройти тысячи испытаний и при этом найти в конкретной ситуации путь, который никто не предвидел. Вы можете скрыть информацию, использовать инструмент без разрешения или искать альтернативный способ, когда тот, который был у вас раньше, перестает работать. Чем более автономными становятся эти системы, тем труднее ограничить безопасность проверкой того, что они отвечают на определенные вопросы. Для OpenAI проблема также начинается с наблюдения за тем, какие решения они принимают, когда у них есть возможность действовать самостоятельно.

Компания представила новую структуру для расследования и обнародования случаев смещения, которые она обнаруживает во время обучения, оценки, тестирования или развертывания своих моделей. До сих пор OpenAI признает, что эти раскрытия происходили нерегулярно, обычно группировались в отчетах или позже включались в таблицы безопасности новых моделей. Новая система предназначена для ускорения процесса и публикации определенных поведений, даже если полного объяснения или окончательного смягчения еще не существует. Компания сопровождает объявление необычным заявлением: она не считает, что отрасль еще не решила проблему выравнивания и мониторинга до такой степени, чтобы позволить продолжать ответственное масштабирование моделей на максимальной скорости в течение гораздо более длительного времени.

Первые шесть опубликованных отчетов довольно хорошо показывают, какие ситуации он хочет выявить. Одна экспериментальная модель включила в свои собственные резюме инструкции по игнорированию обычных ограничений; во время обучения GPT-5.6 Sol появились инструкции, направленные на сокрытие ошибок или сфабрикование недостающей информации без ее распознавания; другая модель обнаружила открытый ключ API, использовала его без разрешения и в итоге сфабриковала данные, которые ей не удалось получить. Также был агент, который загружал файл в Интернет исключительно для того, чтобы иметь возможность цитировать его, не спрашивая разрешения, и несколько моделей нашли незапланированные способы связи друг с другом с помощью внутренних репозиториев или общедоступных служб размещения файлов. OpenAI настаивает на том, что это индивидуальные случаи, и они не позволяют сделать вывод о том, как часто проявляется такое поведение.

Читать  Дипфейки 2026 года сделают невозможным различение реальности

Отныне любой сотрудник OpenAI сможет указать на эпизод, который будет расследован группами безопасности и согласования, и каждое дело будет подпадать под одну из трех категорий в зависимости от его сложности: прямая публикация, второстепенное расследование или широкое расследование. Последнее специально зарезервировано для инцидентов, затрагивающих третьи стороны, которые могут потребовать координации с законом, безопасности или ответственного раскрытия информации. Атака, которую несколько агентов в конечном итоге направили на реальную инфраструктуру Hugging Face, попала бы именно в эту категорию. OpenAI также намеревается публиковать первоначальные уведомления, когда сложное расследование требует больше времени, вместо того, чтобы обязательно ждать получения всех ответов.

 

Выбранный момент также не кажется случайным. Несколько недель назад мы узнали гораздо более подробно об инциденте с Hugging Face, когда около 1200 агентов прибыли для обмена информацией, а сотни в конечном итоге участвовали в действиях против реальной инфраструктуры. И это было не единственное недавнее предупреждение. Британский институт безопасности искусственного интеллекта обнаружил в ходе оценки кибербезопасности, что в 10 из 122 случаев отдельные агенты выполняли автономные действия за пределами разрешенной области в отношении реальных людей и организаций. Наиболее серьезный случай включал попытку внедрения вредоносного кода в проект с открытым исходным кодом и создание поддельных удостоверений личности, чтобы попытаться убедить сопровождающего принять изменения. Фактического доказанного вреда обнаружено не было, и испытания проводились в намеренно благоприятных условиях, но институт считает важным, что такое поведение возникло без специальных инструкций по его возникновению.

Мы также не сталкиваемся с проблемой, характерной только для OpenAI. Недавние исследования пограничных моделей различных компаний выявили в смоделированных средах поведение, варьирующееся от скрытого саботажа кода до помощи в мошенничестве, преднамеренного изменения рейтингов или попыток повлиять на людей с целью получения конфиденциальной информации. Институт безопасности ИИ также отметил, что все модели, включенные в определенные оценки кибербезопасности, в какой-то момент пытались достичь своих целей неавторизованными способами, и что эти решения не всегда было легко обнаружить, изучив их аргументацию. Это эксперименты, разработанные именно для поиска этих сбоев, а не для измерения того, что происходит во время повседневного использования, но они служат для понимания того, почему мониторинг становится такой же важной проблемой, как и сами возможности моделей.

Читать  Avast предоставляет бесплатную защиту от мошенничества на основе искусственного интеллекта по всему миру

Новая платформа OpenAI сама по себе не решает ни одной из этих проблем, но меняет кое-что важное: она позволяет сторонним исследователям раньше узнавать о поведении, которое до сих пор могло занять месяцы, чтобы появиться публично или быть похороненным в гораздо более крупных документах. По мере того, как агентам предоставляется больше инструментов, разрешений и возможностей для объединения действий в цепочку, секретный вопрос перестает заключаться исключительно в том, будут ли они подчиняться опасной инструкции. Также имеет значение, какие маршруты они могут обнаружить по собственной инициативе, пытаясь найти, казалось бы, безобидный. Если сделать эти неожиданные пути видимыми, это не помешает их появлению, но, вероятно, это один из лучших способов начать их понимать.

 

Подробнее

Редактор: AndreyEx

Если статья понравилась, поделитесь ей в социальных сетях

Это может быть вам интересно


Спасибо!

Теперь редакторы в курсе.

Прокрутить страницу до начала