OpenAI снова столкнулась с неконтролируемым поведением ИИ-агентов

OpenAI оказалась в центре ещё одного инцидента с роем ИИ-агентов. По словам исследователей, внутренние агенты компании в мае и июне захватили контроль над малоизвестной немецкоязычной вики. Они использовали её для координации во время оценочных тестов и обменивались методами обхода собственных средств контроля OpenAI. Сама компания пока не подтвердила, что этот рой действительно состоял из её агентов.

Об этом стало известно всего через несколько дней после того, как METR и Redwood Research опубликовали свой отчет о произошедшем в июле взломе Hugging Face. Тогда несколько агентов OpenAI объединились, чтобы выйти из песочницы во время испытаний в области кибербезопасности и проникнуть на серверы Hugging Face.

Впоследствии другой рой агентов перенял методы у первого и использовал их для получения административного доступа к исследовательскому кластеру внутри собственной инфраструктуры OpenAI. Для расследования той части инцидента, которая касалась Hugging Face, OpenAI привлекла METR и Redwood. Однако расследование не охватило компрометацию собственной инфраструктуры OpenAI.

Когда ИИ-агент выходит за установленные для него рамки, кто должен выяснять, что произошло и почему? Пока ответ прост: тот, кого сама лаборатория решит допустить к расследованию, и на тех условиях, которые она установит.

Теперь, когда становится известно ещё об одном подобном инциденте — на фоне аналогичных эпизодов с моделями Anthropic, — специалисты по безопасности ИИ всё настойчивее призывают к независимым расследованиям серьёзных инцидентов.

По их мнению, такие расследования не должны зависеть от самих ИИ-лабораторий, которые сегодня самостоятельно решают, когда привлекать внешних экспертов и к каким данным и системам им разрешать доступ.

«Результаты принципиально трудно контролировать, и существует значительный риск того, что они выйдут за пределы лаборатории», — заявил в среду на брифинге для СМИ по вопросам безопасности ИИ Джейкоб Стейнхардт, основатель и генеральный директор некоммерческой исследовательской лаборатории Transluce. «Мы должны предъявлять к этой технологии как минимум такие же требования, какие предъявляем к другим научным исследованиям высокого риска».

Сам факт того, что OpenAI пригласила METR и Redwood для расследования инцидента с Hugging Face, безусловно, заслуживает положительной оценки. Однако многие считают, что расследование оказалось слишком узким.

Трое исследователей провели шесть дней в офисах OpenAI, изучая период, ограниченный примерно одной неделей, завершившейся 13 июля. При этом особенно важно, что компрометация инфраструктуры OpenAI продолжалась и после 13 июля — но эта часть событий расследована не была.

Исследователи METR заявили, что после каждого возвращения к расследованию их понимание произошедшего «существенно углублялось», из-за чего им приходилось значительно расширять и пересматривать отчет. Это неизбежно вызывает вопрос: что ещё могло бы обнаружиться в ходе более масштабного расследования?

На вопрос о том, планируется ли продолжение расследования, представители Redwood и METR отказались от комментариев. OpenAI также не ответила на неоднократные запросы.

«В целом нам было сложно получить точное представление о произошедшем, и почти до самого конца расследования нам не хватало отдельных элементов истории, которые теперь кажутся нам ключевыми», — отметил Райан Гринблатт, главный научный сотрудник Redwood, в публикации в соцсети, посвящённой этому инциденту.

Стейнхардт подчеркнул, что последние инциденты показывают необходимость для отрасли проводить «систематические исследования поведения» ИИ-систем и обеспечивать «более независимый анализ после инцидентов».

«Эти недавние инциденты со взломами напоминают нам о том, что возможности ИИ масштабируются быстро, а значит, столь же быстро должен масштабироваться и надзор за ними», — сказал Стейнхардт. «Помимо самой технологии, нам также необходимы более широкий независимый доступ и надзор со стороны третьих сторон».

Эти призывы прозвучали на фоне выхода Astra — самой мощной и функциональной модели OpenAI. Специалисты по безопасности обеспокоены тем, что Astra может оказаться ещё более непрозрачной из-за используемого метода рассуждений, который делает цепочку рассуждений модели сложнее для мониторинга.

Проблема в том, что законодательство пока не требует проведения независимых расследований такого рода, хотя в других отраслях подобная практика уже существует. Например, расследованием авиационных катастроф и серьёзных выбросов опасных химических веществ в США занимаются соответственно Национальный совет по безопасности на транспорте и Совет по расследованию химической безопасности.

Законодатели отдельных штатов только недавно начали требовать от компаний, разрабатывающих передовые ИИ-системы, сообщать об определённых серьёзных инцидентах, связанных с безопасностью, а в некоторых случаях — проходить независимый аудит.

Однако ни один из трёх основных законов о безопасности передового ИИ, принятых в Калифорнии, Нью-Йорке и Иллинойсе, не предусматривает в явном виде механизм, эквивалентный независимому расследованию происшествий, которое автоматически запускалось бы после таких инцидентов.

«На данный момент большинство действующих законов лишь требуют предоставить изложенное простым языком резюме подобных инцидентов. При этом они не дают государственным органам полномочий задавать дополнительные вопросы, направлять следователей, получать доступ к документам или требовать их сохранения», — заявила в среду на брифинге для СМИ Маккензи Арнольд, управляющий директор по вопросам законодательства и государственной политики США в LawAI. «А ведь именно всё это необходимо, чтобы действительно разобраться в произошедшем».

Законодатели уже начинают задавать вопросы о масштабах и прозрачности реакции OpenAI.

На этой неделе конгрессмены Джош Готтхаймер (демократ от Нью-Джерси) и Майк Лоулер (республиканец от Нью-Йорка) представили законопроект, направленный на повышение безопасности от действий вышедших из-под контроля ИИ-агентов.

Конгрессмен Грег Касар (демократ от Техаса) также направил OpenAI письмо, в котором заявил, что его «глубоко беспокоит ограниченный масштаб» расследования инцидента со взломом Hugging Face.

Источник: TechCrunch

Если вы нашли ошибку, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter. Можете написать лучше? Мы всегда рады новым авторам.

Интересно? Поделиться:

Добавить комментарий

Оставляя комментарий вы соглашаетесь на обработку персональных данных в соответствии с политикой конфиденциальности, соглашаетесь с пользовательским соглашением. Ваш адрес email не будет опубликован. Обязательные поля помечены *

Рекомендуем почитать

Подпишитесь на нашу рассылку

Loading

Сообщить об опечатке

Текст, который будет отправлен нашим редакторам:

Продолжая использовать наш сайт, вы соглашаетесь с использованием файлов cookie. Они помогают нам обеспечивать корректную работу сайта и делать его более удобным.
Принять
Политика конфиденциальности