Стеклянный куб на тёмном полу: белый луч входит в него сверху и выходит двумя расходящимися лучами, синим и оранжевым; по краям куба контурный свет индиго и лаймовый

Поиск отделили от обучения ИИ. Наконец-то не надо выбирать

Раньше приходилось выбирать: или вас находят в поиске, или на вашем тексте не учат модели. С 15 сентября это перестало быть одной кнопкой — и вот что это значит на практике.

Вчера, 15 сентября, Cloudflare закрыл одну старую и довольно неприятную развилку: теперь можно запретить обучать модели на своём тексте и при этом остаться в поиске. Раньше приходилось выбирать одно из двух. Пост у них так и называется — «Have it both ways», то есть «получите и то, и другое», и изменения вступили в силу в тот же день, 15 сентября. Это их собственный блог, не пересказ.

Я про это пишу не потому, что люблю новости про инфраструктуру. У меня есть направления, которые живут на статьях и на органическом поиске: человек ищет, находит материал, приходит. И есть направления, где мы собираем и приводим в порядок данные. И то, и другое сидит ровно на том механизме, который вчера поменяли.

Почему это вообще был выбор

Смотрите, как это устроено. По сайту ходят роботы. Один робот собирает страницы, чтобы потом показать вас в поиске. Другой собирает те же страницы, чтобы обучить на них модель. Договориться с ними можно файлом robots.txt — это такая записка на входе: этому можно, этому нельзя.

Проблема была в том, что у крупных игроков это часто был один и тот же робот. Один ходок на две задачи. Откажете обучению — откажете и поиску, потому что отказывать-то вы будете одному и тому же. Cloudflare называет это трудным компромиссом и формулирует его прямо: разрешите использовать ваш контент для обучения ИИ — или рискуйте потерять видимость в поиске.

И вот тут интересная деталь. По их же данным, меньше 1% сайтов на Cloudflare блокируют поисковых роботов. А хоть какой-то механизм блокировки обучения включают 17% сайтов. Получается, люди не против, чтобы их находили. Люди против, чтобы на них учились бесплатно. Это разные вещи, а кнопка до вчерашнего дня была одна.

Что именно сделали

Появилась настройка «Disallow AI Training» — запретить обучение. Она публикует этот запрет в robots.txt и дальше действует так: смешанные роботы, которых Cloudflare считает подотчётными, остаются допущены к сайту для поиска, а все остальные обучающие роботы блокируются.

Слово «подотчётный» тут не вежливость, за ним четыре конкретных требования к оператору робота. Первое — дать владельцу сайта способ отказаться от обучения через robots.txt или похожий стандарт. Второе — дать способ отказаться от ИИ-сводок: пока напрямую у оператора, а в следующем году — и через Cloudflare. Третье — показывать на уровне отдельных страниц, какие из них были открыты для обучения, и заодно метрики, как контент показывался в поиске. Четвёртое — заверить, что отказ от обучения не ударит по обычному поиску.

Кто уже проходит. Про Apple, Google и Microsoft написано, что все трое соответствуют требованиям — часть уже работает, часть закрыта обещаниями со сроками: у Applebot отказ ставится правилом для «Applebot-Extended», у Googlebot — для «Google-Extended», у Bingbot управление и прозрачность живут в их вебмастерских инструментах. Но обратите внимание: поддержку запрета обучения через robots.txt Microsoft только строит, цель — начало 2027 года, и до тех пор эта настройка до Bing сама не доедет. А у Apple пока нет инструмента, показывающего по страницам, что было открыто для обучения. Отдельно подотчётными назвали роботов Amazon, Anthropic, Meta и OpenAI — у этих поисковый и обучающий роботы разделены, поэтому Cloudflare может заблокировать обучающего, и на поиск это не влияет.

Вторая половина новости — про настройки по умолчанию. Категорий три, их ввели ещё в июле: поиск, обучение и агент. Агент — это когда программа ходит по сайту прямо сейчас, за живого человека, а не собирает базу на будущее. С 15 сентября новому домену при подключении предлагают один из двух готовых наборов — в зависимости от того, зарабатывает ли сайт на рекламе. Сайту без рекламы по умолчанию разрешено всё. Сайту с рекламой: поиск разрешён, обучение запрещено, агенты блокируются на страницах с рекламой. Логика понятная: реклама зарабатывает, только если страницу увидел человек. Любую настройку можно поменять сразу или потом. Кто ничего не менял — остаётся со своими настройками, они переносятся сами.

И вот тут важная деталь, на которой легко ошибиться. Раньше настройки «блокировать» и «блокировать на страницах с рекламой» смешанных роботов не трогали — как раз чтобы не выбить сайт из поиска. Теперь трогают, включая Googlebot, Bingbot и Applebot. То есть если вы выберете «блокировать», вы уйдёте и из обучения, и из поиска. Для «только обучение» теперь есть отдельная настройка, её и надо выбирать. А вот запретить обучение только на рекламных страницах нельзя — в robots.txt такое не выражается. И для агентов отдельного «запретить» пока нет вообще.

Что это меняет для обычного человека

Прямо сейчас — ничего, никаких действий от вас не требуется. Но есть две цифры из того же поста, и обе про то, как мы теперь ищем.

Первая: больше половины людей читают сводку в поиске, и те, кто её прочитал, больше чем на 40% чаще заканчивают поиск на этом. То есть ответ вы получили, а до сайта не дошли. Я сам так делаю каждый день, чего уж.

Вторая цифра — обратная, и она мне нравится больше. Люди, пришедшие из ИИ-поиска, конвертируются в три, а то и больше чем в пять раз чаще, чем пришедшие из обычного. Приходит меньше, но приходят те, кто уже разобрался. Мне кажется, это и есть настоящий сдвиг: трафик перестаёт быть про количество.

Что это меняет для бизнеса

Если у вас сайт, который живёт на поиске, вы всё это время платили за него текстом. Вас обходили, вы получали переходы — старая сделка. Сейчас первую половину сделки выполняют по-прежнему, а вторую всё чаще нет, и претензию предъявить некому: формально никто ничего не обещал.

Что теперь можно сделать руками. Посмотреть, какие роботы к вам вообще ходят. Решить, что вы разрешаете: поиск — почти наверняка да, обучение — по-разному, агентов — отдельный разговор. Поставить настройку у своего провайдера, а не только записку в robots.txt: сама записка не знает, кто пришёл, и не может остановить того, кто её игнорирует.

Для меня практический вывод такой. На направлениях, где всё держится на статьях, я оставляю поиск открытым и трогать его не буду вообще. На данных — наоборот, мне важно понимать, что именно уходит и кому, и вот тут требование «показывать по страницам, что было открыто для обучения» полезнее любых заявлений о намерениях.

Моё мнение

Я бы включил «запретить обучение, оставить поиск» на контентных направлениях. Не из вредности, а потому что это сейчас единственный вариант, при котором можно не платить за чужую модель своим текстом и не платить за это видимостью в поиске.

Но я не жду, что от этого вернётся трафик. Первая мысль, на которую тут легко повестись, и я, конечно, повёлся: «запретим — и клики поедут обратно». Не поедут. Люди не перестанут читать сводки, потому что мой сайт закрылся от обучения. Это защита своего, а не способ вернуть посетителей.

Что мне здесь по-настоящему интересно — не кнопка, а отчётность. Cloudflare пишет, что определяет, кто ходит и зачем, блокирует тех, кто игнорирует правила, и публикует у себя, что каждый оператор делает на самом деле. Вот это и есть проверяемая часть. Обещание оператора стоит ровно столько, сколько стоит проверка этого обещания. Не уверен, что отчёты окажутся подробными. Но сам факт, что кто-то взялся считать, — это нормальный шаг.

И ещё одна мысль, которая меня не отпускает. Требование «показывать по страницам, что было открыто для обучения» тише всех остальных, а по факту оно самое сильное. Запрет без такого отчёта — это просто вежливая просьба. С отчётом это уже разговор.

Кому это пока не нужно

Если ваш сайт живёт не с поиска — внутренний портал, всё за логином, трафик из рекламы или из рассылки, — можно спокойно пройти мимо. Обучаться на закрытых страницах и так особо не на чем.

Если вы, наоборот, хотите попасть в ИИ-ответы и считаете их своим будущим каналом, то блокировать обучение вам во вред. Это честный выбор, и он противоположен моему. Тут нет правильного ответа на всех, есть ответ под вашу модель.

И если у вас три страницы и десяток посетителей в день — сначала статьи, потом роботы. Настройка не заменяет причину, по которой к вам должны приходить.

Что дальше

Давайте так. Я на своих направлениях оставляю поиск открытым, обучение закрываю там, где контент наш и он мне дорог, и месяц просто смотрю на цифры: сколько показов, сколько переходов, изменилось ли вообще что-нибудь. Если не изменилось — тоже результат, значит развилка была не там, где я думал.

Меня больше волнует другое: появится ли у этой истории продолжение. Правило заработало, но часть его держится на заявлениях и обещаниях со сроками. А как считаете, крупные компании эти обещания выдержат, когда моделям опять понадобятся свежие тексты?