TL;DR
- Нейросеть отбирает источники в два слоя: обучающий корпус (зашит в веса, без ссылок, обновляется редко) и retrieval в реальном времени (веб-поиск / RAG, подтягивает свежие документы и прикладывает к ним ссылки). Видимые цитаты почти всегда приходят из retrieval.
- У ChatGPT в топе Wikipedia (47.9%), у Perplexity — Reddit (46.7%) не из-за настроек, а из-за разных retrieval-бэкендов и правил доверия (Profound, 2026).
- Brand mentions без ссылок коррелируют с цитируемостью на уровне Spearman 0.664, backlinks — только 0.2 (Superlines, 2026). LLM отбирает по упоминанию сущности, а не по графу ссылок.
- Структура решает на этапе извлечения: answer-капсулы 40-75 слов (Princeton+Adobe, 2023), таблицы — 4.2× citation rate, FAQPage Schema — 3.2× попаданий и 67% citation rate (Profound, 2026).
- Свежесть критична для Perplexity: 82% цитат моложе 30 дней (Profound, 2026).
- Универсальной оптимизации «под LLM» нет: только 11% доменов цитируются и ChatGPT, и Perplexity (Brandlight, 2026). Об общей картине GEO — в полном руководстве.
Два слоя памяти: корпус против retrieval
Нейросеть отбирает источники из двух принципиально разных слоёв, и путать их — главная ошибка при планировании GEO. Первый слой — обучающий корпус: всё, на чём модель училась, спрессовано в её веса. Он не содержит ссылок и не обновляется в реальном времени. Второй слой — retrieval: веб-поиск или RAG, который под конкретный запрос подтягивает актуальные документы и прикладывает к ним ссылки. Цитаты, которые пользователь видит под ответом, почти всегда приходят из retrieval.
Разница имеет практические последствия. Обучающий корпус формирует фоновое «знание» модели о вашем бренде — насколько он вообще ассоциируется с категорией. Но повлиять на этот слой быстро нельзя: корпус замораживается на момент обучения и обновляется с выходом новой версии модели, то есть раз в много месяцев. Если ваш бренд появился полгода назад, в весах GPT его может не быть вовсе — а в ответе он всё равно окажется, если retrieval найдёт о нём свежие материалы.
Именно поэтому почти весь практический GEO — это работа с retrieval. Свежесть, структура контента, упоминания на третьесторонних доменах влияют на то, что модель находит и отбирает прямо сейчас, а не на то, что зашито в её памяти. Когда мы в команде Rupor разбираем, почему бренд не попадает в ответы, мы почти всегда находим причину на уровне retrieval: контент не извлекается, не датирован, не упомянут там, где модель ищет.
Сама механика RAG — как retrieval устроен технически, что такое эмбеддинги, чанкинг и реранкинг — заслуживает отдельного разбора. Мы вынесли его в материал RAG простыми словами; здесь же фокус на том, какие сигналы определяют отбор и почему они работают именно так.
| Слой | Что это | Есть ссылки | Частота обновления | Можно влиять | |---|---|---|---|---| | Обучающий корпус | Знания, зашитые в веса модели | Нет | Раз в месяцы (новая версия) | Медленно и косвенно | | Retrieval (web-search / RAG) | Документы, подтянутые под запрос | Да (это и есть цитаты) | В реальном времени | Быстро и напрямую |
Почему у каждой модели свои любимые источники
У ChatGPT в топе цитирования Wikipedia (47.9%), у Perplexity — Reddit (46.7%), у Google AI Overviews — YouTube и мультимодальный контент (23.3%), и это следствие разных retrieval-бэкендов, а не настроек, которые можно переключить (Profound, 2026). Каждая модель ходит за источниками в свой индекс и применяет свои правила доверия. Подстроиться под них можно, переписать — нет.
ChatGPT в режиме веб-поиска тяготеет к верифицированным, энциклопедическим доменам. Wikipedia для него — почти эталон: структурированная, перелинкованная, с историей правок и явной атрибуцией фактов. Отсюда 47.9% цитат. Практический вывод не «правьте Wikipedia напрямую» (это против правил площадки и не работает в лоб), а «обеспечьте, чтобы факты о бренде существовали на источниках, которым доверяет Wikipedia и которые она агрегирует» — профильные медиа, отраслевые публикации, упоминания с атрибуцией.
Perplexity построен вокруг свежести и обсуждаемости. Его retrieval активно подтягивает площадки, где живёт актуальная дискуссия, — отсюда 46.7% цитат из Reddit. Модель ценит не энциклопедичность, а то, что про тему говорят прямо сейчас. Для русскоязычного сегмента функциональный аналог Reddit — это треды на Habr, обсуждения на VC.ru, отзывы на профильных площадках.
Google AI Overviews (на Gemini) опирается на мультимодальность: 23.3% топ-цитат — YouTube и видеоконтент. Это открывает канал, недоступный в чистом тексте: продуктовые туториалы, разборы, обзоры с транскриптами становятся самостоятельными источниками. Для русскоязычных моделей — Алисы AI и GigaChat — картина смещена в сторону Yandex-экосистемы (Дзен, Кью, Я.Бизнес) и открытых русскоязычных корпусов соответственно; точных публичных долей по ним мало, поэтому здесь мы опираемся на собственную оценку, а не на западные датасеты.
| Модель | Топ-источник | Главный рычаг видимости | |---|---|---| | ChatGPT | Wikipedia (47.9%) | Факты о бренде на доменах, которым доверяет Wikipedia; атрибутированные упоминания в медиа | | Perplexity | Reddit (46.7%) | Свежие обсуждения и упоминания; высокая частота появления контента | | Google AI Overviews (Gemini) | YouTube / мультимодальный (23.3%) | Видео с транскриптами, VideoObject schema, структурные метаданные | | Алиса AI | Дзен, Кью, Я.Бизнес (по нашей оценке) | Присутствие в Yandex-экосистеме, профиль Я.Бизнес, свежий dateModified | | GigaChat | Русскоязычные открытые корпусы, Habr (по нашей оценке) | Технические разборы на Habr, открытые корпоративные материалы |
Источник долей — Profound (2026); по Алисе AI и GigaChat публичных замеров такого качества пока нет, и мы помечаем эти строки как оценочные. Подробнее о различиях между конкретными моделями РФ-рынка — в полном руководстве по GEO.
Почему упоминание сильнее ссылки
Brand mentions без ссылок коррелируют с цитируемостью в LLM на уровне Spearman 0.664, тогда как backlinks — всего 0.2 (Superlines, 2026); упоминание сущности в тексте влияет на отбор источника сильнее, чем гиперссылка на неё. Это переворачивает привычную SEO-логику, где ссылка — главная валюта. У нейросетей валюта другая.
Причина — в том, как retrieval оценивает релевантность. Google исторически строил ранжирование на графе ссылок: страница важна, если на неё ссылаются авторитетные домены. LLM же при отборе источников работает с текстом как с набором сущностей и связей между ними. Модель «видит», что бренд X упоминается в контексте категории Y рядом с конкурентами Z — и это формирует ассоциацию. Кликабельная ссылка для такой ассоциации не нужна: достаточно, чтобы имя бренда стояло в релевантном тексте на источнике, который попадает в retrieval.
Отсюда практический сдвиг бюджета. Один разбор рынка на VC.ru, где ваш продукт назван в ряду альтернатив без всякой ссылки, влияет на видимость в LLM в среднем сильнее, чем несколько технически «правильных» бэклинков с высоким DR. По данным Superlines (2026), порядка 85% AI-цитат бренда приходят с третьесторонних доменов, а не с его собственного сайта. Это значит: контент на своём блоге важен (он попадает в retrieval по брендовым и информационным запросам), но решающий слой — то, что про вас пишут другие.
Важная оговорка, чтобы не уйти в крайность: ссылки не вредят и остаются обязательными для классического SEO, которое никуда не делось. Речь о приоритете рычага под конкретную цель. Если цель — попасть в ответ нейросети, то PR-трек (Pressfeed, профильные медиа, отраслевые обзоры, упоминания в сравнениях) даёт больше, чем линкбилдинг той же стоимости. О том, как это вписывается в общую стратегию и какие метрики отслеживать, — в разделе про метрики полного руководства.
Почему структура контента поднимает цитируемость в разы
Модель не вытаскивает статью целиком — она извлекает самодостаточный фрагмент, поэтому форматы, которые легко вырезать как готовый ответ, цитируются в разы чаще. Три формата дают измеримый прирост: answer-капсулы 40-75 слов, таблицы и FAQPage Schema. Объединяет их одно — извлекаемость: фрагмент должен отвечать на вопрос без остального текста вокруг.
Answer-капсула — это первый абзац раздела на 40-75 слов, построенный по схеме «субъект — глагол — объект» и дающий полный ответ ещё до того, как пользователь дочитал. Оптимальная длина именно 40-75 слов установлена в работе Принстона и Adobe Research (2023), формализовавшей GEO как дисциплину. Логика проста: такой блок retrieval может вырезать целиком и подставить в ответ. Гигантский абзац без чёткого тезиса в начале модель не «понимает», какой фрагмент брать, и пропускает.
Таблицы цитируются в 4.2 раза чаще обычного текста (Profound, 2026). Причина та же — структура. Таблица «параметр → значение» это уже готовый ответ на сравнительный запрос: модели не нужно реконструировать соответствия из прозы, всё разложено по ячейкам. На сравнительных и «X vs Y» запросах таблица почти всегда выигрывает у абзаца того же содержания.
FAQPage Schema даёт в 3.2 раза больше попаданий в AI Overviews при citation rate 67% на тематических запросах (Profound, 2026). Здесь работают сразу два фактора: пара «вопрос — ответ» структурно совпадает с тем, как формулируются пользовательские промпты, а разметка Schema.org делает эту пару машиночитаемой явно, без угадывания. Именно поэтому в брифе на каждую нашу статью FAQ-блок обязателен — он генерирует Schema автоматически и работает как прямой retrieval-сигнал.
| Формат | Прирост цитируемости | Почему работает | Источник | |---|---|---|---| | Answer-капсула 40-75 слов | Базовый драйвер извлечения | Вырезается целиком как готовый ответ | Princeton+Adobe, 2023 | | Таблица | 4.2× citation rate | Сравнения разложены по ячейкам, не нужно реконструировать | Profound, 2026 | | FAQPage Schema | 3.2× попаданий, 67% citation rate | Пара «вопрос-ответ» совпадает с форматом промпта + машиночитаемость | Profound, 2026 |
Обратная сторона: длина без структуры не работает. Лонгрид на 8000 слов без капсул, таблиц и FAQ цитируется хуже, чем втрое более короткий, но структурированный материал. Модель извлекает абзацы, а не статьи, — об этой ошибке мы подробно пишем в разделе про типовые ошибки руководства.
Почему свежесть критична — особенно для Perplexity
Свежесть влияет на отбор источников у всех моделей, но у Perplexity она встроена в архитектуру: 82% его цитат приходятся на контент моложе 30 дней (Profound, 2026). Perplexity спроектирован как ответчик на актуальные запросы и на этапе retrieval активно понижает устаревшее. Для остальных моделей фактор мягче, но датируемость контента влияет везде.
Механизм работает на двух уровнях. Первый — retrieval отдаёт приоритет недавно проиндексированным и недавно обновлённым документам, особенно по запросам с временным контекстом («лучший X в 2026», «последние изменения в Y»). Второй — явные сигналы даты: поля datePublished и dateModified в Schema.org дают модели понять, насколько материал актуален. Страница без этих полей для retrieval «недатирована» и проигрывает датированным конкурентам при прочих равных.
Практический вывод: для видимости в Perplexity недостаточно один раз опубликовать хороший материал. Нужна Citation Velocity — постоянное появление свежего контента на третьесторонних доменах и регулярное обновление dateModified на ключевых страницах (реалистично — раз в 2-3 месяца на pillar-материалах). Это не означает менять дату формально без правок: модели всё чаще сверяют заявленную дату с фактическими изменениями текста, и пустое обновление даты не даёт эффекта, а в худшем случае понижает доверие.
Для чисто русскоязычных брендов Perplexity — нишевый канал, но как ранний индикатор трендов в нише он полезен в мониторинге. Алиса AI тоже чувствительна к свежести через dateModified, а вот ChatGPT с веб-поиском и Gemini относятся к датам мягче, опираясь на стабильные авторитетные источники. Разная чувствительность к свежести — ещё одна причина, по которой единая стратегия «под все модели» не складывается.
Почему нельзя оптимизироваться «под LLM вообще»
Только 11% доменов цитируются и ChatGPT, и Perplexity одновременно (Brandlight, 2026) — пересечение источников между моделями настолько мало, что единой оптимизации «под нейросети вообще» не существует. Каждая модель ходит в свой retrieval-бэкенд, доверяет своим источникам и по-своему чувствительна к свежести. Стратегия, которая поднимает видимость в ChatGPT, может не сдвинуть Perplexity, и наоборот.
Этот разрыв — следствие всего, о чём шла речь выше. Если ChatGPT тянет факты из энциклопедических доменов, а Perplexity — из свежих обсуждений, то один и тот же материал на вашем сайте по-разному ценен для них. Работа под ChatGPT — это присутствие на авторитетных, агрегируемых источниках; работа под Perplexity — частота и свежесть упоминаний в дискуссионных средах. Это разные треки с разным контентом и разными площадками.
Из этого не следует, что нужно вести пять несвязанных кампаний. Есть общий фундамент, который работает на все модели сразу: server-side rendering (LLM-боты плохо рендерят JS), Schema.org, answer-капсулы, таблицы, FAQ, актуальные даты. Этот слой обязателен и единообразен. А поверх него — отдельная работа с предпочитаемыми источниками каждой целевой модели, приоритизированная по доле её аудитории в вашей нише.
Практическое следствие для измерения: видимость нужно мерить по каждой модели отдельно, а не усреднять в один показатель «видимость в нейросетях». Усреднение скрывает ровно ту информацию, которая нужна для действий, — в какой модели вы проседаете и почему. Поэтому корректный мониторинг — это недельные срезы по 5-7 моделям с фиксированным семантическим ядром, где видна позиция в каждой из них в отдельности.
Что со всем этим делать
Сведём механику в практику. Отбор источников у нейросети определяют четыре вещи: где вас упоминают (третьесторонние домены важнее своего сайта), как упоминают (упоминание сущности сильнее ссылки), как структурирован ваш контент (капсулы, таблицы, FAQ извлекаются, проза — нет) и насколько он свеж (критично для Perplexity и Алисы AI). Универсального рычага нет — есть общий технический фундамент плюс работа под retrieval-бэкенд каждой целевой модели.
Полную картину — метрики Visibility Score и Share of Model Voice, 90-дневный план запуска, разбор по индустриям и моделям РФ — мы собрали в GEO-продвижении: полном руководстве 2026. Если хотите глубже понять саму механику retrieval, начните с разбора RAG простыми словами.
Хотите узнать, что нейросети говорят о вашем бренде прямо сейчас и из каких источников они это берут? Запустите бесплатный аудит — срез по нескольким моделям без регистрации, с точными цитатами ответов в качестве evidence.