Месяц в логах сервера: какие нейросети реально читают ваш сайт и что с этим делать

Логи AI-краулеров, отчёт «Видимость сайта в Алисе AI» в Яндекс Вебмастере, правда про llms.txt и особенности GigaChat. Разбираю на опыте своего сайта, как проверить, читают ли вас нейросети, и какие правки реально повышают шансы попасть в источники ответа.
Месяц в логах сервера: какие нейросети реально читают ваш сайт и что с этим делать

Началось всё с ерунды. В Метрике поползли вверх брендовые запросы, рекламу я не запускал, публикаций тоже было немного. Обычно так выглядит либо чей-то репост, либо сбой счётчика. Я полез в access-лог сервера просто из любопытства и завис там на весь вечер.

Оказалось, по сайту ходит целый зоопарк, о котором я раньше думал абстрактно. GPTBot, ClaudeBot, PerplexityBot, ChatGPT -User, CCBot, Bytespider. Не раз в квартал, а регулярно, с понятным расписанием и предпочтениями по разделам. Одни страницы они выгребали целиком, другие игнорировали месяцами.

Дальше я потратил месяц на то, чтобы разобраться, что из этого влияет на видимость в ответах нейросетей, а что просто шум. Заодно перечитал коммерческие страницы агентств, чтобы понять, что вообще входит в услугу geo продвижение в нейросетях и где заканчивается зона, куда вебмастер дотягивается руками. Граница есть, и она проходит примерно посередине. Ниже — что у меня получилось выяснить.

Кто из ботов зачем приходит

Первое открытие: боты одной компании решают разные задачи, и путать их бессмысленно.

GPTBot собирает данные для обучения моделей. Его визит никак не влияет на то, процитируют вас завтра в чате или нет. Он работает на далёкое будущее. OAI-SearchBot строит поисковый индекс, из которого ChatGPT берёт кандидатов, когда пользователь включает веб-поиск. А ChatGPT-User приходит уже по факту: кто-то задал вопрос, модель решила сходить по конкретной ссылке и прочитать страницу прямо сейчас. Вот его визиты — самый интересный сигнал из всех, потому что за каждым стоит живой запрос живого человека.

ClaudeBot и PerplexityBot устроены похоже. CCBot — это Common Crawl, открытый архив, из которого потом черпают все подряд, включая исследователей и стартапы. Bytespider принадлежит ByteDance и ведёт себя заметно наглее остальных по частоте обращений.

Команда, с которой я начал, максимально скучная:

grep -E "GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|PerplexityBot|CCBot" access.log | awk '{print $1, $7}' | sort | uniq -c | sort -rn | head -50

Если сайт живёт за Cloudflare или другим CDN, лезть в консоль не обязательно — статистика по ботам обычно уже нарисована в панели. Мне хватило пары вечеров, чтобы увидеть закономерность: боты ходят туда, где есть структура и конкретика, и почти не трогают страницы с общими рассуждениями без цифр.

Отчёт Яндекса, который многие пропустили

Пока я копался в логах, выяснилось, что по русскоязычной части картины давно есть готовый инструмент. В Яндекс Вебмастере в разделе «Эффективность» появился пункт «Видимость сайта в Алисе AI». Доступен всем, у кого подтверждены права на сайт, никаких заявок и списков ожидания.

Что там показывают:

Share of Voice, то есть доля запросов, в ответах на которые ваш сайт попал в источники, от общего числа запросов с генеративным ответом. Динамику по месяцам. Примеры конкретных запросов, где Алиса на вас сослалась. И список сайтов вашей тематики, которые она цитирует чаще всего — фактически готовый перечень конкурентов за место в нейроответе. Данные обновляются раз в неделю.

Масштаб канала Яндекс оценивает в 46,5 млн пользователей ежемесячно у быстрых ответов Алисы. Это уже полноценная витрина, где ваш бренд либо есть, либо его нет. На эксперимент у края выдачи такое не тянет.

Отдельно порадовало, что отчёт показывает долю, а не абсолютные цифры. Так честнее: можно расти в упоминаниях и одновременно терять позицию относительно ниши, если конкуренты растут быстрее.

Никакой отдельной кнопки для Алисы не существует

Главное заблуждение, от которого я избавился за этот месяц: нет никакой отдельной оптимизации «под нейропоиск», параллельной обычному SEO.

Алиса AI собирает ответ из результатов поиска Яндекса. Сначала система подбирает кандидатов по вебу, потом отбирает из них подходящие фрагменты, потом YandexGPT сшивает из этих кусков связный текст и прикрепляет карточки источников, обычно от трёх до шести. Если страница плохо ранжируется в обычной выдаче или поисковик считает её слабой, в генеративный слой она не попадёт тем более.

Из этого следует неприятная для многих вещь. Нейросеть не берёт вашу страницу и не пересказывает её целиком. Она вырезает фрагмент: абзац, определение, таблицу, пункт списка. Значит, единицей оптимизации становится абзац. Документ целиком тут вторичен. Страница может быть отличной в целом и ни разу не процитированной, потому что в ней нет ни одного самодостаточного куска, который можно вынуть и показать отдельно от контекста.

После этого я переписал вводные абзацы в нескольких материалах по принципу перевёрнутой пирамиды: сначала прямой ответ на вопрос заголовка в одно-два предложения, потом развёртка и нюансы. Через три недели два из этих материалов появились в примерах запросов в Вебмастере.

История с llms.txt, которая меня отрезвила

Про этот файл в прошлом году писали как про обязательный минимум. Идея красивая: кладёте в корень markdown-карту сайта для языковых моделей, и они начинают вас понимать правильно.

Я его положил. И пошёл смотреть в логи, кто его скачивает.

Почти никто. Мой результат совпал с замерами, которые публиковали независимо друг от друга: по данным Limy.ai за май 2026 года, на llms.txt пришлось 408 обращений из примерно 515 миллионов бот-событий за девяносто дней. Джон Мюллер из Google ещё в июне 2025-го высказался прямо: ни одна ИИ-система на тот момент файл не использовала, и он поставил его в один ряд с мета-тегом keywords. Ни одна крупная платформа стандарт официально не поддержала до сих пор.

Вывод у меня получился спокойный. Файл дешёвый, пишется за полчаса, вреда от него нет. Пусть лежит на случай, если стандарт когда-нибудь взлетит. Но строить на нём стратегию видимости и продавать его как «оптимизацию под ИИ» — примерно то же самое, что в двухтысячных набивать keywords и ждать трафика.

Отдельная головная боль по имени GigaChat

С российскими моделями всё интереснее. GigaChat умеет искать во внешних источниках и опираться на них при ответе, но публично документированного краулера с понятным user-agent у него нет. Управлять его доступом через robots.txt так же прозрачно, как доступом Googlebot или OAI-SearchBot, не получится.

Для видимости это скорее плюс: никто ничего не закрывает, все страницы потенциально доступны. Проблема возникает у тех, кому наоборот нужно что-то спрятать — закрытую базу знаний, платный раздел, персональные данные в кабинете. Тут остаются нормальные технические способы: noindex на страницах, авторизация, ограничения на уровне сервера. Директива в robots.txt для этого случая просто не рабочий инструмент.

Проверить, знает ли о вас GigaChat, можно только вручную. Я задаю ему те же вопросы, что и остальным моделям, и смотрю, всплывает ли название сайта.

Десять вопросов раз в неделю

Самая полезная привычка из всех, которые я завёл, оказалась и самой примитивной.

Я составил список из десяти вопросов, которые реальный человек задал бы по моей нише. Не ключевые фразы из Вордстата, а живые формулировки: «что посоветуете», «чем отличается», «какой сервис выбрать для». Раз в неделю прогоняю их через Алису, ChatGPT с включённым поиском, GigaChat и Perplexity , записываю в таблицу, кого процитировали.

Уходит минут тридцать. Даёт больше, чем любой платный трекер, потому что видно саму формулировку: как модель пересказала мысль, что она выдернула, где переврала. Один раз я обнаружил, что нейросеть уверенно приписывала моему сайту утверждение из соседнего абзаца, вырванное без отрицания. Смысл переворачивался на противоположный. Переписал абзац так, чтобы он не читался в отрыве, — история больше не повторялась.

Что я поменял на страницах по итогам месяца

Список короткий и без магии.

Каждый заголовок второго уровня превратил в вопрос или в прямую формулировку темы, а первый абзац под ним превратил в законченный ответ. Добавил цифры с указанием источника и даты: модели заметно охотнее цитируют конкретику, чем рассуждения. Проставил даты обновления материалов, потому что свежесть в Яндексе весит много. Собрал блоки вопросов и ответов там, где они уместны по смыслу, и разметил их через Schema.org. Свёл воедино данные о проекте на внешних площадках — название, описание и контакты должны совпадать везде, иначе модель не связывает упоминания в одну сущность.

Отдельно вычистил длинные предложения на пять строк с тремя придаточными. Извлекать фрагмент из такого текста неудобно даже человеку.

Где заканчивается самодеятельность

Всё описанное выше делается руками за несколько вечеров и стоит ноль рублей. Дальше начинается то, что в одиночку тянуть тяжело.

Видимость в AI-ответах сильно зависит от внешнего цифрового следа: упоминаний на профильных площадках, отзывов, карточек компании в каталогах, единых данных о бренде по всему интернету. Модель складывает представление о вас из десятков источников, и собственный сайт среди них лишь один голос. Систематически работать с остальными, отслеживать динамику по десяткам запросов и корректировать стратегию по данным — это уже отдельная работа с бюджетом, и на рынке она стоит от девяноста тысяч рублей в месяц.

Мне для своего проекта хватает логов, вкладки в Вебмастере и таблицы с десятью вопросами. Если бы речь шла о клинике, интернет-магазине или B2B-компании, где выбор происходит в тот момент, когда нейросеть перечисляет три варианта, считал бы иначе.

Полгода назад весь этот разговор выглядел как футурология. Сейчас у меня в браузере открыта вкладка с процентом упоминаний моего домена в ответах Алисы, и я обновляю её чаще, чем сводку по позициям.

14:22
23
Нет комментариев. Ваш будет первым!