28 сентября Anthropic подробно показала рабочий способ, которым их ИИ улучшает приложение сам — не переписывая код по вашим промптам, а раз за разом подбираясь к метрике, которую вы задали. И самое интересное здесь — не то, что делает машина, а то, какая работа остаётся за человеком.
Что именно сделали
Внутри Claude Code появились две связанные команды: одна собирает «оценку» — набор проверок, по которым видно, хорошо ли работает приложение, — а вторая раз за разом улучшает приложение относительно этой оценки. Первая отвечает на вопрос «как мы вообще меряем, что стало лучше», вторая — карабкается вверх по этой мерке, по одному шагу за раз.
Это не отдельный волшебный сервис и не «ИИ сам себя переписал»: это инструмент внутри среды разработки, с человеком в контуре на каждом ключевом шаге. Официальный разбор механики вышел 28 сентября.
© Владимир Баринов
Как это работает — и почему это не магия
Сначала ИИ вас интервьюирует и собирает примеры из реальной жизни продукта: расшифровки диалогов, тикеты поддержки, баг-репорты, плюс несколько кейсов, написанных руками. Дальше выбирает самый дешёвый честный способ проверки — где ответ строгий, сверяет программно; где ответ свободный, судит отдельная модель, не та, которую проверяют. Гоняет базовый замер и печатает цифру — с честной оговоркой, насколько она колеблется.
Потом начинается само улучшение. Вы говорите, что разрешено менять — формулировки, инструкции, модель, параметры — и какая цель: поднять качество или удержать качество и снизить стоимость. Дальше ИИ делит примеры на две части: одну он видит и учится на ней, вторую прячет от себя. Каждый раунд — одна правка и новый замер. И вот ключевое: правку оставляют, только если стало лучше на обеих частях. Если выросла лишь та часть, которую он видел, — это признак подгонки, и правку откатывают.
Цифры
На своём собственном боте поддержки Anthropic прогнала этот цикл и получила на отложенной, «спрятанной» проверке 90,5% верных решений против 78,6% у исходной версии — и при этом примерно в пять раз дешевле. Это их внутренние числа, не наши, и переносить их на любой продукт нельзя. Но порядок эффекта они показывают честно: заметный рост качества и падение стоимости одновременно.
Что здесь на самом деле меняется для вас
Раньше узкое место было в вопросе «как заставить ИИ сделать то, что нужно». Теперь оно сместилось. ИИ карабкается к любой цифре, которую вы ему дадите, — значит вся ответственность переехала в саму цифру. Задали метрику, которую можно обмануть или которая мерит не то, — получите идеально оптимизированное не то.
Это и есть работа, которую нельзя делегировать: честно назвать, что для бизнеса действительно успех, и убедиться, что это нельзя подделать. «Клиент дошёл до оплаты» — метрика. «Отправили много писем» — ловушка: её легко вздуть, не сделав никому лучше.
Скажу от себя. У меня ИИ каждый день ведёт разработку и рабочие процессы, и самым трудным всегда была не сама правка — правку он сделает. Трудным было честно сформулировать цель так, чтобы её нельзя было сымитировать. Этот подход — ровно про это: он перекладывает ценность с «умею писать код» на «умею назвать неподдельную цель».
Что с этим делать вам
Один шаг, короткий. Возьмите один процесс, где у вас уже есть и цель, и данные — воронка продаж, поддержка, обработка заявок. Запишите одну метрику успеха. И проверьте её на обман: можно ли эту цифру поднять, не сделав клиенту лучше? Если да — метрика не годится, как бы солидно она ни звучала. Хорошая метрика — та, которую нельзя вздуть, не создав реальную пользу.
