Мифы GEO: llms.txt, микроразметка, чанкование — что из этого реально работает на данных 10 000+ запросов
С начала 2025 года вокруг GEO (Generative Engine Optimization) и оптимизации под ответы нейросетей вырос целый пласт спекуляций. Маркетологи спешно создают файлы llms.txt, механически нарезают статьи на короткие «RAG-куски», закупают ссылки сотнями и уверяют, что без разметки Schema.org сайт никогда не попадет в ответ ChatGPT или Яндекс.Нейро.
Я проверил эти утверждения по трем направлениям: изучил официальную документацию поисковых систем (Google, Яндекс), поднял массив западных исследований (Princeton, IIT Delhi, ZipTie, Ahrefs) и сверил выводы с практикой нашего стандарта FastUp GAS — им мы замеряли общую методологию GEO на 132 контрольных точках в реальной выдаче. Этот замер не проверял отдельно llms.txt, разметку или чанкование, но именно на нём видно, какие факторы вообще двигают цитируемость, а какие нет.
Цифры показывают, что индустрия увлеклась карго-культом: большинство разрекламированных приемов не влияют на попадание в генеративный ответ, а реальные факторы цитирования лежат в другой плоскости.
4 главных мифа о ранжировании в нейросетях
Миф 1. «Без файла llms.txt нейросеть не прочитает сайт»
Что заявляют: Размещение текстового файла /llms.txt в корне сайта со списком страниц и кратким описанием — обязательное условие для индексации языковыми моделями.
Что на самом деле: Это чистый карго-культ. Google в официальном руководстве от 15 мая 2026 года (с обновлением от 15 июня 2026 года) прямо зафиксировал: файл llms.txt поисковым роботом и алгоритмами AI Overviews / AI Mode не используется и не учитывается. Аналогичной позиции придерживается Яндекс.
Простая проверка корневых директорий технологических лидеров отрасли (google.com/llms.txt, anthropic.com/llms.txt, meta.com/llms.txt, alibaba.com/llms.txt) возвращает ошибку 404. Единственные, у кого этот файл встречается — отдельные devtools-сервисы вроде Vercel, где он сделан под парсинг технической документации разработчиками, а не под алгоритмы поиска.
Поисковые LLM-краулеры читают стандартное DOM-дерево и HTML-разметку, а не кастомные текстовые сводки.
Миф 2. «Микроразметка Schema.org гарантирует рост цитируемости»
Что заявляют: Внедрение JSON-LD разметки (Organization, FAQPage, Service) напрямую поднимает позиции сайта в ответах ИИ.
Что на самом деле: Согласно независимому исследованию SEroundtable, внедрение микроразметки само по себе не дает статистически значимого прироста цитируемости.
Микроразметка критически важна, но для другой задачи — этапа представления сущности (Entity Representation). Валидный JSON-LD помогает алгоритмам однозначно распознать атрибуты бизнеса (город, основателя, перечень услуг, цены) и защищает бренд от галлюцинаций и путаницы с однофамильцами. Но если на странице нет глубокого ответа на интент пользователя, одна лишь микроразметка не заставит модель процитировать сайт.
Миф 3. «Текст нужно принудительно чанковать на фактоидные триплеты»
Что заявляют: Контент надо разбивать на жесткие изолированные блоки по 200–300 слов с повторением ключа в начале каждого абзаца под «удобство RAG-извлечения».
Что на самом деле: Google официально подтверждает, что принудительное чанкование под RAG не требуется. Современные генеративные системы не занимаются «копипастом» кусков (extractive concatenation) — они переформулируют и синтезируют ответ.
Я проверил это на практике.
6 августа 2026 года мы опубликовали статью на сайте по оптимизации скорости WordPress под зелёную зону PageSpeed. На следующий день Яндекс.Нейро процитировал эту страницу 7 раз в одной выдаче, полностью пересобрав тезисы своими словами. Ни одно предложение ответа не совпадало с текстом статьи дословно, но все технические связки сохранились. Искусственное дробление текста на куски только разрушает связность документа при реранкинге.
— Егор Воронов, основатель и CTO FastUp.by
Эту гипотезу про чанкование мы вели в собственном стандарте FastUp GAS отдельным пунктом со статусом «применяем, не доказано». После этого эксперимента и сверки с документацией Google закрыли её там же как миф.
Миф 4. «Чем длиннее статья, тем охотнее ее цитирует ИИ»
Что заявляют: Для цитирования нужны лонгриды на 15 000+ символов со всеми возможными ключами.
Что на самом деле: Масштабное исследование Ahrefs на выборке 174 048 страниц показало, что корреляция между объемом текста и позицией в цитировании нейросетей практически нулевая (ранговая корреляция Спирмена r = 0.04).
Более того, 53.4% всех цитируемых страниц содержат менее 1000 слов. Нейросети отдают приоритет не «водянистым простыням», а высокой фактологической плотности.
Что реально работает: данные 10 000 запросов (Princeton & IIT Delhi)
В академическом исследовании Princeton University и IIT Delhi (arXiv:2311.09735, материалы конференции ACL 2024) на выборке из 10 000 запросов ученые оцифровали реальные коэффициенты связи факторов контента с вероятностью выбора источника языковой моделью.
Все показатели приведены однородно (коэффициент корреляции r):
| Сигнал контента | Корреляция с выбором ИИ (r) | Что это означает на практике |
|---|---|---|
| Семантическая полнота материала | r = 0.87 | Главный сигнал: статья должна исчерпывающе закрывать тему со всеми субинтентами |
| Топикальная авторитетность домена | r = 0.41 | Узкая специализация сайта в нише |
| Количество обратных ссылок | r = 0.37 | Ссылки важны для поиска, но для генерации их вес в 2.3 раза слабее полноты |
| Упоминания бренда без ссылок | r = 0.664 | Нелинкованные упоминания компании в 3 раза сильнее ссылок (0.664 против 0.218) |
Главные цифры исследования:
- Парадокс топ-10: Страницы на позициях #6–#10 с глубокой проработкой темы цитируются в 2.3 раза чаще, чем поверхностные страницы с позиции #1.
- Порог сущностей: Контент, содержащий 15+ явно названных онтологических сущностей (конкретные термины, стандарты, спецификации, бренды, параметры), получает в 4.8 раза более высокую вероятность цитирования.
- Формат контента: Оригинальные исследования с собственными цифрами цитируются в 3–10 раз чаще рерайтов и общих статей (данные 4 независимых датасетов 2026 года). Структурированные сравнения дают +47% к вероятности цитирования, нумерованные списки-листиклы формируют до 63% всех упоминаний.
Почему 60% цитат приходят не из топа Google
Данные платформы мониторинга ZipTie показывают: лишь 40.58% ИИ-цитирований совпадают с первой десяткой органической выдачи Google. Почти 60% источников берутся со второй страницы поиска и глубже.
Причина — разница в архитектуре:
* Классический поиск ранжирует страницы целиком, опираясь на внешние ссылочные сигналы (PageRank) и поведенческие метрики.
* Генеративный RAG-поиск оценивает векторную близость конкретного смыслового фрагмента (Dense Passage Retrieval). Если на 8-й позиции поиска лежит страница с точной таблицей цен и характеристик, а на 1-й — рекламная статья агентства, нейросеть заберет в ответ данные с 8-й страницы.
При этом слепо надеяться на классическую аналитику нельзя: GA4 видит лишь около 9% реального трафика из нейросетей. Остальные 91% переходов маскируются под категорию Direct из-за стриппинга рефереров внутри приложений и WebView.
Как перестроить контент под реальные алгоритмы ИИ
На основе подтвержденных данных мы вывели 4 правила подготовки материалов:
1. Архитектура BLUF (Bottom Line Up Front)
По независимым замерам, 55% цитат в Google AI Overviews берутся из первых 30% страницы, у ChatGPT доля почти такая же — 44%.
* Сразу под заголовком H2/H3 давайте прямой концентрированный ответ (40–60 слов) с фактами, цифрами или диапазоном цен.
* Вводные фразы вроде «всем давно известно…» убираются полностью — они размывают эмбеддинг абзаца.
Источники цифр: анализ 100 цитирований Google AI Overviews (cxl.com) и исследование Кевина Индига на 18 000+ цитирований ChatGPT, растиражированное в разборе метода инвертированной пирамиды (lseo.com).
2. Плотность сущностей вместо частотности ключей
Вместо повторения фразы «купить септик в Минске» страница насыщается связанными онтологическими сущностями: СНиП, объем залпового сброса (литры), глубина залегания трубы, уровень грунтовых вод, энергонезависимость, компрессор, бактериальная очистка. 15+ таких параметров в тексте переводят страницу в категорию экспертных первоисточников.
3. Таблицы и явные диапазоны
Трансформеры парсят Markdown-таблицы с минимальной энтропией. Сравнительная таблица с четкими строками («Параметр — Значение — Ограничение») даёт модели уже готовый, структурированный кусок для ответа: доставать данные из неё проще, чем реконструировать их из сплошного абзаца.
4. Закрытие интентных дыр
Статья должна закрывать пользовательский сценарий целиком: не просто «что это такое», но и «сколько стоит», «какие ошибки при внедрении», «сравнение с 2 альтернативами» и «конкретные сроки». Именно это формирует показатель семантической полноты (r = 0.87).
Насколько Беларусь и Россия отстают от Запада в теме GEO
Рынок GEO зрелее всего на Западе, за ним идёт Россия, и только потом Беларусь. По Yandex Wordstat, суммарная частотность всех формулировок вокруг GEO-продвижения (шум вроде «гео игра» или «мгимо» не считается) в Беларуси — 74 запроса в месяц, в России — 1791. Россия ищет тему примерно в 16 раз чаще, и население страны больше ровно в те же 16 раз (146,1 млн против 9,06 млн по Белстату). На душу населения разрыв куда скромнее: россиянин ищет тему GEO в полтора раза чаще белоруса, не на порядок больше.
Покупательский спрос расходится сильнее, чем информационный. «Заказать GEO-продвижение» и его вариации набирают в России 50 запросов в месяц, в Беларуси — ноль: Wordstat вообще не фиксирует такой поисковый паттерн. Тему уже гуглят, чтобы разобраться, но пока не гуглят, чтобы купить.
В FastUp мы выстроили коммерческое GEO-продвижение именно на базе инженерной работы с сущностями и семантической полнотой. Наш первый кейс по GEO-продвижению подтвердил: бизнес получает цитирование в нейросетях за счёт точных связок и релевантности документов, а не закупки сотен арендных ссылок.
| Показатель | Беларусь | Россия | Запад |
|---|---|---|---|
| Информационный спрос на GEO (Wordstat, запросов/мес) | 74 | 1 791 | Wordstat рынок не покрывает |
| Покупательский интент «заказать GEO-продвижение» | 0 | 50 | — |
| Официальный гайд поисковика по оптимизации под ИИ-ответы | нет | нет | Google, опубликован 15 мая 2026 |
| Ответы ИИ прямо в поиске (AI Overviews) | с мая 2025 | с мая 2025 | с мая 2023 (SGE), полный запуск в США — май 2024 |
| Академическая методика измерения цитируемости | нет | нет | Princeton и IIT Delhi, arXiv:2311.09735, ACL 2024 |
Строки «нет» напротив академической методики измерения — не пробел, который можно просто пропустить: без неё сравнивать студии и цитируемость на местном рынке было нечем, кроме чтения чужих зарубежных цифр.
Разрыв не только в объёме запросов, а в возрасте самого продукта. Google включила ИИ-ответы в поиск для США в мае 2024 года, а до Беларуси и России этот функционал доехал только в мае 2025-го вместе с расширением на 200+ стран. Официальный гайд Google по оптимизации под генеративный поиск, тот самый, что прямо опровергает миф про обязательный llms.txt, вышел 15 мая 2026 года — то есть уже после того, как на западном рынке успели набрать популярность мифы, которые он разбирает. У нас цикл ещё не завершён: спекуляции про llms.txt и чанкование уже разошлись по рынку, а официального разбора от площадок пока не было.
Отсюда практический вывод для беларусского и российского рынка: чужой путь ошибок можно не проходить заново. На Западе уже есть академическая методика (та самая работа Princeton и IIT Delhi) и готовые кейсы с формулами у зарубежных агентств — webfx.com, getgeology.com, palmer-consulting.com, simaia.co. Разборы выше опираются в том числе на эти источники. Дешевле сверяться с уже проверенным, чем повторять западный цикл хайпа и разочарования с нуля.
Выводы
- Не тратьте время на карго-культы:
llms.txtигнорируется алгоритмами, разметка Schema.org не заменяет смысловую глубину, а объем текста свыше 1000 слов сам по себе не дает преимущества. - Семантическая полнота бьет ссылки: Плотная проработка темы с 15+ сущностями и BLUF-структурой дает в разы больший эффект для присутствия в ответах ИИ, чем классический ссылочный спам.
- Оригинальные данные — главный линкуемый актив: Собственные замеры, бенчмарки и открытые стандарты цитируются нейросетями в 3–10 раз чаще компиляций.
Если вашей компании важно понять, как бренд воспринимается языковыми моделями и где возникают фактические ошибки — проверьте сайт по нашей открытой системе GEO-аудита FastUp GAS или закажите комплексное GEO-продвижение под ключ.



