Логотип FastUp.byFastUp.by

Мифы GEO: llms.txt, микроразметка, чанкование — что из этого реально работает

Обновлено
Мифы GEO: llms.txt, микроразметка, чанкование — что из этого реально работает

Мифы GEO: llms.txt, микроразметка, чанкование — что из этого реально работает на данных 10 000+ запросов

С начала 2025 года вокруг GEO (Generative Engine Optimization) и оптимизации под ответы нейросетей вырос целый пласт спекуляций. Маркетологи спешно создают файлы llms.txt, механически нарезают статьи на короткие «RAG-куски», закупают ссылки сотнями и уверяют, что без разметки Schema.org сайт никогда не попадет в ответ ChatGPT или Яндекс.Нейро.

Я проверил эти утверждения по трем направлениям: изучил официальную документацию поисковых систем (Google, Яндекс), поднял массив западных исследований (Princeton, IIT Delhi, ZipTie, Ahrefs) и сверил выводы с практикой нашего стандарта FastUp GAS — им мы замеряли общую методологию GEO на 132 контрольных точках в реальной выдаче. Этот замер не проверял отдельно llms.txt, разметку или чанкование, но именно на нём видно, какие факторы вообще двигают цитируемость, а какие нет.

Цифры показывают, что индустрия увлеклась карго-культом: большинство разрекламированных приемов не влияют на попадание в генеративный ответ, а реальные факторы цитирования лежат в другой плоскости.


4 главных мифа о ранжировании в нейросетях

Миф 1. «Без файла llms.txt нейросеть не прочитает сайт»

Что заявляют: Размещение текстового файла /llms.txt в корне сайта со списком страниц и кратким описанием — обязательное условие для индексации языковыми моделями.

Что на самом деле: Это чистый карго-культ. Google в официальном руководстве от 15 мая 2026 года (с обновлением от 15 июня 2026 года) прямо зафиксировал: файл llms.txt поисковым роботом и алгоритмами AI Overviews / AI Mode не используется и не учитывается. Аналогичной позиции придерживается Яндекс.

Простая проверка корневых директорий технологических лидеров отрасли (google.com/llms.txt, anthropic.com/llms.txt, meta.com/llms.txt, alibaba.com/llms.txt) возвращает ошибку 404. Единственные, у кого этот файл встречается — отдельные devtools-сервисы вроде Vercel, где он сделан под парсинг технической документации разработчиками, а не под алгоритмы поиска.

Поисковые LLM-краулеры читают стандартное DOM-дерево и HTML-разметку, а не кастомные текстовые сводки.

Миф 2. «Микроразметка Schema.org гарантирует рост цитируемости»

Что заявляют: Внедрение JSON-LD разметки (Organization, FAQPage, Service) напрямую поднимает позиции сайта в ответах ИИ.

Что на самом деле: Согласно независимому исследованию SEroundtable, внедрение микроразметки само по себе не дает статистически значимого прироста цитируемости.

Микроразметка критически важна, но для другой задачи — этапа представления сущности (Entity Representation). Валидный JSON-LD помогает алгоритмам однозначно распознать атрибуты бизнеса (город, основателя, перечень услуг, цены) и защищает бренд от галлюцинаций и путаницы с однофамильцами. Но если на странице нет глубокого ответа на интент пользователя, одна лишь микроразметка не заставит модель процитировать сайт.

Миф 3. «Текст нужно принудительно чанковать на фактоидные триплеты»

Что заявляют: Контент надо разбивать на жесткие изолированные блоки по 200–300 слов с повторением ключа в начале каждого абзаца под «удобство RAG-извлечения».

Что на самом деле: Google официально подтверждает, что принудительное чанкование под RAG не требуется. Современные генеративные системы не занимаются «копипастом» кусков (extractive concatenation) — они переформулируют и синтезируют ответ.

Я проверил это на практике.

6 августа 2026 года мы опубликовали статью на сайте по оптимизации скорости WordPress под зелёную зону PageSpeed. На следующий день Яндекс.Нейро процитировал эту страницу 7 раз в одной выдаче, полностью пересобрав тезисы своими словами. Ни одно предложение ответа не совпадало с текстом статьи дословно, но все технические связки сохранились. Искусственное дробление текста на куски только разрушает связность документа при реранкинге.

— Егор Воронов, основатель и CTO FastUp.by

Эту гипотезу про чанкование мы вели в собственном стандарте FastUp GAS отдельным пунктом со статусом «применяем, не доказано». После этого эксперимента и сверки с документацией Google закрыли её там же как миф.

Миф 4. «Чем длиннее статья, тем охотнее ее цитирует ИИ»

Что заявляют: Для цитирования нужны лонгриды на 15 000+ символов со всеми возможными ключами.

Что на самом деле: Масштабное исследование Ahrefs на выборке 174 048 страниц показало, что корреляция между объемом текста и позицией в цитировании нейросетей практически нулевая (ранговая корреляция Спирмена r = 0.04).

Более того, 53.4% всех цитируемых страниц содержат менее 1000 слов. Нейросети отдают приоритет не «водянистым простыням», а высокой фактологической плотности.


Что реально работает: данные 10 000 запросов (Princeton & IIT Delhi)

В академическом исследовании Princeton University и IIT Delhi (arXiv:2311.09735, материалы конференции ACL 2024) на выборке из 10 000 запросов ученые оцифровали реальные коэффициенты связи факторов контента с вероятностью выбора источника языковой моделью.

Все показатели приведены однородно (коэффициент корреляции r):

Сигнал контентаКорреляция с выбором ИИ (r)Что это означает на практике
Семантическая полнота материалаr = 0.87Главный сигнал: статья должна исчерпывающе закрывать тему со всеми субинтентами
Топикальная авторитетность доменаr = 0.41Узкая специализация сайта в нише
Количество обратных ссылокr = 0.37Ссылки важны для поиска, но для генерации их вес в 2.3 раза слабее полноты
Упоминания бренда без ссылокr = 0.664Нелинкованные упоминания компании в 3 раза сильнее ссылок (0.664 против 0.218)

Главные цифры исследования:

  1. Парадокс топ-10: Страницы на позициях #6–#10 с глубокой проработкой темы цитируются в 2.3 раза чаще, чем поверхностные страницы с позиции #1.
  2. Порог сущностей: Контент, содержащий 15+ явно названных онтологических сущностей (конкретные термины, стандарты, спецификации, бренды, параметры), получает в 4.8 раза более высокую вероятность цитирования.
  3. Формат контента: Оригинальные исследования с собственными цифрами цитируются в 3–10 раз чаще рерайтов и общих статей (данные 4 независимых датасетов 2026 года). Структурированные сравнения дают +47% к вероятности цитирования, нумерованные списки-листиклы формируют до 63% всех упоминаний.

Что реально влияет на цитирование в ИИ-поиске: сравнение коэффициентов корреляции факторов контента


Почему 60% цитат приходят не из топа Google

Данные платформы мониторинга ZipTie показывают: лишь 40.58% ИИ-цитирований совпадают с первой десяткой органической выдачи Google. Почти 60% источников берутся со второй страницы поиска и глубже.

Причина — разница в архитектуре:
* Классический поиск ранжирует страницы целиком, опираясь на внешние ссылочные сигналы (PageRank) и поведенческие метрики.
* Генеративный RAG-поиск оценивает векторную близость конкретного смыслового фрагмента (Dense Passage Retrieval). Если на 8-й позиции поиска лежит страница с точной таблицей цен и характеристик, а на 1-й — рекламная статья агентства, нейросеть заберет в ответ данные с 8-й страницы.

При этом слепо надеяться на классическую аналитику нельзя: GA4 видит лишь около 9% реального трафика из нейросетей. Остальные 91% переходов маскируются под категорию Direct из-за стриппинга рефереров внутри приложений и WebView.


Как перестроить контент под реальные алгоритмы ИИ

На основе подтвержденных данных мы вывели 4 правила подготовки материалов:

1. Архитектура BLUF (Bottom Line Up Front)

По независимым замерам, 55% цитат в Google AI Overviews берутся из первых 30% страницы, у ChatGPT доля почти такая же — 44%.
* Сразу под заголовком H2/H3 давайте прямой концентрированный ответ (40–60 слов) с фактами, цифрами или диапазоном цен.
* Вводные фразы вроде «всем давно известно…» убираются полностью — они размывают эмбеддинг абзаца.

Источники цифр: анализ 100 цитирований Google AI Overviews (cxl.com) и исследование Кевина Индига на 18 000+ цитирований ChatGPT, растиражированное в разборе метода инвертированной пирамиды (lseo.com).

2. Плотность сущностей вместо частотности ключей

Вместо повторения фразы «купить септик в Минске» страница насыщается связанными онтологическими сущностями: СНиП, объем залпового сброса (литры), глубина залегания трубы, уровень грунтовых вод, энергонезависимость, компрессор, бактериальная очистка. 15+ таких параметров в тексте переводят страницу в категорию экспертных первоисточников.

3. Таблицы и явные диапазоны

Трансформеры парсят Markdown-таблицы с минимальной энтропией. Сравнительная таблица с четкими строками («Параметр — Значение — Ограничение») даёт модели уже готовый, структурированный кусок для ответа: доставать данные из неё проще, чем реконструировать их из сплошного абзаца.

4. Закрытие интентных дыр

Статья должна закрывать пользовательский сценарий целиком: не просто «что это такое», но и «сколько стоит», «какие ошибки при внедрении», «сравнение с 2 альтернативами» и «конкретные сроки». Именно это формирует показатель семантической полноты (r = 0.87).


Насколько Беларусь и Россия отстают от Запада в теме GEO

Рынок GEO зрелее всего на Западе, за ним идёт Россия, и только потом Беларусь. По Yandex Wordstat, суммарная частотность всех формулировок вокруг GEO-продвижения (шум вроде «гео игра» или «мгимо» не считается) в Беларуси — 74 запроса в месяц, в России — 1791. Россия ищет тему примерно в 16 раз чаще, и население страны больше ровно в те же 16 раз (146,1 млн против 9,06 млн по Белстату). На душу населения разрыв куда скромнее: россиянин ищет тему GEO в полтора раза чаще белоруса, не на порядок больше.

Покупательский спрос расходится сильнее, чем информационный. «Заказать GEO-продвижение» и его вариации набирают в России 50 запросов в месяц, в Беларуси — ноль: Wordstat вообще не фиксирует такой поисковый паттерн. Тему уже гуглят, чтобы разобраться, но пока не гуглят, чтобы купить.

В FastUp мы выстроили коммерческое GEO-продвижение именно на базе инженерной работы с сущностями и семантической полнотой. Наш первый кейс по GEO-продвижению подтвердил: бизнес получает цитирование в нейросетях за счёт точных связок и релевантности документов, а не закупки сотен арендных ссылок.

ПоказательБеларусьРоссияЗапад
Информационный спрос на GEO (Wordstat, запросов/мес)741 791Wordstat рынок не покрывает
Покупательский интент «заказать GEO-продвижение»050
Официальный гайд поисковика по оптимизации под ИИ-ответынетнетGoogle, опубликован 15 мая 2026
Ответы ИИ прямо в поиске (AI Overviews)с мая 2025с мая 2025с мая 2023 (SGE), полный запуск в США — май 2024
Академическая методика измерения цитируемостинетнетPrinceton и IIT Delhi, arXiv:2311.09735, ACL 2024

Строки «нет» напротив академической методики измерения — не пробел, который можно просто пропустить: без неё сравнивать студии и цитируемость на местном рынке было нечем, кроме чтения чужих зарубежных цифр.

Разрыв не только в объёме запросов, а в возрасте самого продукта. Google включила ИИ-ответы в поиск для США в мае 2024 года, а до Беларуси и России этот функционал доехал только в мае 2025-го вместе с расширением на 200+ стран. Официальный гайд Google по оптимизации под генеративный поиск, тот самый, что прямо опровергает миф про обязательный llms.txt, вышел 15 мая 2026 года — то есть уже после того, как на западном рынке успели набрать популярность мифы, которые он разбирает. У нас цикл ещё не завершён: спекуляции про llms.txt и чанкование уже разошлись по рынку, а официального разбора от площадок пока не было.

Отсюда практический вывод для беларусского и российского рынка: чужой путь ошибок можно не проходить заново. На Западе уже есть академическая методика (та самая работа Princeton и IIT Delhi) и готовые кейсы с формулами у зарубежных агентств — webfx.com, getgeology.com, palmer-consulting.com, simaia.co. Разборы выше опираются в том числе на эти источники. Дешевле сверяться с уже проверенным, чем повторять западный цикл хайпа и разочарования с нуля.


Выводы

  1. Не тратьте время на карго-культы: llms.txt игнорируется алгоритмами, разметка Schema.org не заменяет смысловую глубину, а объем текста свыше 1000 слов сам по себе не дает преимущества.
  2. Семантическая полнота бьет ссылки: Плотная проработка темы с 15+ сущностями и BLUF-структурой дает в разы больший эффект для присутствия в ответах ИИ, чем классический ссылочный спам.
  3. Оригинальные данные — главный линкуемый актив: Собственные замеры, бенчмарки и открытые стандарты цитируются нейросетями в 3–10 раз чаще компиляций.

Если вашей компании важно понять, как бренд воспринимается языковыми моделями и где возникают фактические ошибки — проверьте сайт по нашей открытой системе GEO-аудита FastUp GAS или закажите комплексное GEO-продвижение под ключ.

Частые вопросы о ранжировании в ИИ и мифах GEO

Если llms.txt не помогает ранжированию, стоит ли его вообще удалять?

Можно оставить как техническую документацию для разработчиков, для этого его и придумали. Просто не ждите от него эффекта на цитируемость и не платите отдельно за его внедрение как за SEO-услугу.

Если микроразметка не поднимает цитируемость, зачем её вообще делать?

Она решает другую задачу: устраняет путаницу с однофамильцами и защищает от галлюцинаций в ответах ИИ. Это фундамент («Представление»), а не инструмент попадания в топ цитирования.

Как тогда реально поднять цитируемость в ИИ-поиске?

Семантическая полнота материала (закрыть тему целиком, без пробелов по субинтентам), 15+ явно названных сущностей и структура BLUF под каждым заголовком. Это три сигнала с самой сильной подтверждённой связью из всех проверенных. На практике в рамках GEO-продвижения мы связываем сущности через профили, открытые базы знаний и адаптацию посадочных страниц.

Отказ от принудительного чанкования значит, что структура статьи не важна?

Нет. Заголовки H2/H3 и логичное деление на разделы всё равно нужны, просто не для механического дробления под RAG-извлечение, а потому что так удобнее читателю и так же режет текст сам алгоритм при построении собственных чанков.

Похожие записи

Математический стандарт FastUp GAS: формулы и методология замеров цитируемости в ИИ

Математический стандарт FastUp GAS v1.4: формулы, шкалы и методика измерения видимости бренда в генеративном поиске

1. Введение: проблема измерения ИИ-выдачи Традиционные методы поисковой аналитики опирались на условно-детерминированные показатели: позицию в ТОП-10/20, видимость по частотному ядру, CTR сниппета и профиль обратных ссылок (PageRank). Появление генеративных поисковых интерфейсов — Яндекс.Нейро («Обзор от Алисы»), ChatGPT Search (с нативным веб-поиском) и Google AI Overviews (SGE) — привело к трем фундаментальным проблемам измерения: Стохастичность и […]

Превью статьи о том, почему в 2026 году SEO и GEO-продвижение в картах станут единой услугой.

SEO внутри GEO: почему в 2026 году нет смысла покупать две раздельные услуги

Если вы приходите за продвижением бизнеса, вам нередко предлагают две параллельные статьи расходов: классическое SEO-продвижение сайтов и оптимизацию под нейросети (GEO). С инженерной точки зрения в 2026 году это разделение потеряло смысл. В FastUp мы объединили эти направления: классическое SEO полностью интегрировано в сквозной регламент GEO-продвижения в нейросетях. Это исключает дублирование процессов и защищает бюджет […]

4 уровня подготовки сайта к рекомендациям в нейросетях

Как мы в FastUp делаем GEO-продвижение: 4 уровня подготовки сайта к рекомендациям в нейросетях

Когда речь заходит о чеках от 2 000 до 20 000+ BYN — будь то B2B-услуги, опт, заказная разработка сайтов, загородное строительство или комплексное лечение в частном медцентре — поведение клиента меняется. Лицо, принимающее решение, берет паузу, говорит «я подумаю» и идет проверять информацию. Только теперь он не просто гуглит и собирает таблицы подрядчиков вручную. […]

Хотите заказать разработку сайта?

Разберём задачу и пришлём расчёт. Отвечаем в течение рабочего дня.

FastUp.by
FastUp.by
Оставить заявку
Заявка успешно отправлена!
Изучим проект и свяжемся с вами в течение рабочего дня.