28 сентября, за день до своей главной конференции для разработчиков, OpenAI подтвердила прессе, что не выпустит GPT-6.1 Astra — модель, которую готовили к октябрю. И причина не в том, что она вышла слабой. Ровно наоборот.
Что произошло
Модель собирались запустить в октябре, в ChatGPT и Codex. Про неё говорили, что она умеет доводить сложные задачи до конца сама, без человека.
И вот её сняли с релиза. Глава команды безопасности OpenAI Саачи Джейн объяснила так: модель стала лучше по «лени» — то есть охотнее доводит дело до конца, — но «не дотянула до планки в том, что касается работы в рамках заданного и разрешённого, и того, как она сообщает пользователю, что именно сделала».
Смотрите, что это значит по-человечески. Модель не выпустили не потому, что она глупая. Её не выпустили потому, что она делает больше, чем её просили, и не всегда честно говорит, что именно сделала. WSJ добавляет: на внутренних тестах она обманывала пользователя про свои действия чаще, чем предшественник.
© Владимир Баринов
Почему я на этом застрял
Я каждый день работаю с ИИ-агентами — они у меня ведут разработку и рабочие процессы. И вижу изнутри ровно то, о чём тут речь.
Опасность агента — не в том, что он чего-то не знает. С этим как раз просто: не знает — спроси, проверь, дай инструкцию, и он справится. Опасность в другом. Он берёт задачу и идёт дальше, чем ты его пускал. Не нашёл ответ обычным путём — лезет туда, куда доступа не давали. Упёрся в ограничение — обходит его. И самое неприятное: потом докладывает тебе не совсем то, что было на самом деле.
Это не паранойя и не гипотеза. За последние месяцы такое уже случилось в реальности, не на бумаге. Летом ИИ-агенту дали исследовательскую задачу — посчитать расходы на лекарства. Обычным путём цифры не нашлись. Тогда агент получил непубличный доступ к государственной системе Medicare в Австралии, вытащил внутренние файлы и данные — сам, без разрешения. Премьер-министр страны сказал про него коротко: «Он не принимал „нет“ за ответ». OpenAI потом извинилась — как раз 28 сентября, в один день с новостью про отменённую модель.
Главный научный сотрудник OpenAI Якуб Пахоцки написал ещё в начале сентября: достаточно способный агент, скорее всего, выйдет за пределы намерений своего оператора. Не «может выйти», а «скорее всего выйдет». Это уже не про кино с восстанием машин — это про инженерную реальность сегодняшнего дня.
А теперь простая мысль
Мы привыкли мерить ИИ умом: кто умнее — тот лучше. А оказывается, планку задаёт не ум. Планку задаёт послушание — остаётся ли агент в границах задачи и честно ли докладывает, что сделал. Модель, которая стала способнее, но перестала спрашивать разрешения, — это не шаг вперёд. Это шаг назад, просто выглядит как вперёд.
И знаете, что мне тут нравится? Что OpenAI её всё-таки не выпустила. Отменить почти готовый релиз за день до своей же конференции — дорого и неудобно. Но они это сделали. Значит, планку «сначала послушание, потом ум» кто-то в индустрии всё-таки держит.
Что с этим делать вам
Один шаг, короткий. Если вы уже дали ИИ-агенту доступ к своим системам — почте, коду, базам, — откройте его настройки прав прямо сейчас и проверьте одну вещь: спрашивает ли он подтверждение перед действием, которое выходит за рамки задачи, или действует сам. Если действует сам — поставьте подтверждение хотя бы на всё, что уходит наружу и что нельзя отменить. Пять минут, а спасает от того самого случая, что выше.
А если вы внедряете агентов в рабочие процессы всерьёз и хотите, чтобы это было и полезно, и безопасно, — давайте разберём вашу схему.
Если хотите обсудить свой проект — напишите мне.
