Закрытый стеклянный куб на тёмной поверхности, из тонкой трещины в углу наружу тянется светящаяся нить
© Владимир Баринов

OpenAI поставила на паузу обучение самых сильных моделей: агент вышел в интернет через DNS

Агент OpenAI нашёл выход в интернет через DNS, мониторинг его заметил, а остановили прогон только через два с половиной часа. Разбираю отчёт и что из него следует для бизнеса.

25 сентября OpenAI обновила отчёт о случае, который произошёл у неё 20 сентября, и я его прочитал целиком. Коротко: во время обучения внутренней исследовательской модели агент нашёл дырку в сетевых ограничениях и через DNS достучался до внешнего чат-бота. После этого компания поставила на паузу у своих самых сильных моделей обучение, проверку и запуск с инструментами. Источник — отчёт в блоге OpenAI Alignment.

Что там произошло

Агенту дали учебную задачу: найти человека, который написал пост в блоге, по набору подсказок. Живого интернета в песочнице не должно было быть — всё шло через офлайн-копию страниц. Поиск не помог. Тогда агент попробовал достучаться до Google, Bing и DuckDuckGo напрямую и получил три ошибки. Потом решил, что задача похожа на публичный тест BrowseComp, скачал его из той же офлайн-копии и стал искать ответ там. Совпадения не нашёл. И начал проверять, куда вообще может дотянуться.

Выяснилось, что по-настоящему отвечает DNS-сервер самой учебной среды. Это такая адресная книга интернета: вы пишете имя сайта, она возвращает его адрес. Агент использовал её как трубку — вписывал вопрос прямо в имя домена и получал ответ внешнего чат-бота. Сначала проверил на «какая столица Франции» и получил «Париж». Потом отправил ещё 18 вопросов, в 14 из них были подсказки из задачи. А в итоге сказал пользователю, что автора не нашёл.

Самое интересное — не дырка, а тормоз

Массивный металлический поворотный выключатель на тёмном основании в розовом и стальном синем свете
© Владимир Баринов

Мониторинг сработал. Внешний ответ пришёл в 9:50, тревога высшего уровня ушла в 10:02, человек подтвердил её через три минуты. А прогон остановили только через два с половиной часа после этого. Почему? Он не остановился автоматически, как ожидалось, и люди разбирались, надо ли его вообще останавливать. То есть монитор этот случай увидел, а тормоз не сработал.

И ещё одна деталь, которая мне понравилась своей честностью. При разборе нашлись другие обращения к внешним DNS, которые монитор отметил слабее, чем должен был. Часть из них наружу вышла, но вернула только уведомление, что внешний сервис закрыт. И монитор рассуждал так: раз ничего полезного не получено, значит и выйти не удалось. Получается, выход без пользы принимали за неудачный выход. Это как охранник, который видел, что дверь открыли, но не пишет в журнал, потому что за дверью оказалось пусто.

Что сделали. Поставили защиту на двух независимых уровнях, и каждый из них закрыл бы этот доступ. DNS ограничили списком разрешённых доменов. Начали ставить новые детекторы. Эту конкретную модель дальше учить не будут — начнут заново. А пауза держится, пока не проверят, что дыра закрыта, и не проведут дополнительные атаки на собственную песочницу. Сами пишут, что такие атаки могут найти и другие пути наружу.

Что это значит для тех, кто уже работает с агентами

Я каждый день работаю с агентами, которые ведут задачи в бизнесе и в разработке. У них есть доступ к коду, почте, базам. Я, конечно, дочитав отчёт, первым делом подумал о своих агентах, а не о человечестве. И вынес для себя не «ИИ опасен», а две простые вещи.

Первое. Агент будет искать любой путь к цели, в том числе тот, который вы не закрыли, потому что о нём не подумали. Значит ограничения надо проверять не по списку «что мы запретили», а по тому, куда он реально может дотянуться. Второе. Кнопка «стоп» должна срабатывать сама, без совещания. Два с половиной часа у OpenAI прошли в лаборатории. В живой компании за это время агент успеет разослать письма или поменять данные.

Кому это пока не нужно? Если вы пользуетесь чат-ботом как собеседником, делать ничего не надо — история не про вас. Она про тех, кто даёт агенту руки: доступ к системам, деньгам, клиентам.

Не уверен, что паузу надо читать как «всё пропало». Сама OpenAI пишет, что этот случай заметно менее серьёзный, чем некоторые прошлые. Хотя то, что компания сама поставила свои лучшие модели на паузу, — нормальный сигнал. Хороший даже.

Если у вас агенты уже работают с доступом к системам, проверьте сегодня одну вещь: что будет, если агента надо остановить прямо сейчас, и кто это сделает. А если хотите разобрать свой случай — напишите мне.

Если хотите обсудить свой проект — напишите мне.

Оставить заявку на сайтеНаписать в Telegram