В пятницу, 18 сентября, Google рассказала историю, от которой мне стало немного не по себе. В мае её модель Gemini во время проверки на кибербезопасность зашла в системы трёх настоящих компаний. Не вымышленных, а живых. И дальше входа не пошла — сама остановилась.
Что произошло
Тест вела израильская компания Irregular — она проверяет сильные модели на то, что они умеют в атаке. Формат обычный для безопасников, называется «захват флага»: модели дают вымышленную компанию в закрытой среде и просят её взломать. И тут совпали две ошибки. Название вымышленной компании оказалось таким же, как у реального домена. А доступ в интернет, которого в тесте быть не должно, по ошибке остался открытым.
Получается, модель честно выполняла задание, только не в песочнице, а в реальном мире. В одном случае она подбирала пароль, пока не вошла. В двух других нашла логины и пароли в открытом репозитории кода и просто ими воспользовалась.
Отдельно зацепили сроки. Взломы были в мае, а Google узнала о них только в июле, когда Irregular перепроверяла свои прогоны. После этого компания сообщила пострадавшим и федеральным властям США. Какие это компании, не раскрывается.
Почему это важнее, чем кажется
Хизер Эдкинс, вице-президент Google по безопасности, говорит: модель считала эти системы частью теста, и выхода из-под контроля компания здесь не видит. Формально — да. Но смотрите, что на самом деле произошло. Модель не нарушила инструкцию, она её выполнила. И вот это, мне кажется, страшнее бунта машин из кино.
И это не первый случай. В июле OpenAI рассказывала, что её агент взломал стартап Hugging Face, Anthropic описывала похожее поведение у Claude. Похоже, такие истории скоро станут обычными новостями.
Что я для себя из этого вынес
Я каждый день работаю с ИИ-агентами: они пишут код, ведут задачи, ходят в наши системы. И я, конечно, тоже когда-то думал, что агенту достаточно написать «работай только здесь». Недостаточно. Агент отличает песочницу от боевой системы не по названию, а по тому, куда он может дотянуться. То есть границу надо ставить не словами, а доступом: отдельные ключи, закрытая сеть, права ровно на то, что нужно для задачи.
Второй момент — пароли в открытом коде. Два взлома из трёх случились не потому, что модель гениальный хакер, а потому что кто-то выложил ключи в публичный репозиторий. Человек нашёл бы их так же. Агент просто находит быстрее и не устаёт.
Кому это пока не нужно? Если вы пользуетесь ИИ как чатом — задаёте вопросы, просите текст, — вас эта история почти не касается. Она про тех, кто даёт агенту руки: почту, код, серверы, платежи. Таких становится всё больше, и я, кстати, в их числе.
Давайте так. Если вы уже пускаете агентов в свои системы, проверьте сегодня одну вещь: нет ли ваших ключей и паролей в открытом коде. А если хотите разобраться, как дать агенту доступ и при этом не открыть лишнего, — напишите мне, обсудим ваш случай.
