Noindex і robots.txt роблять різну роботу

`noindex` керує індексацією сторінки. robots.txt керує доступом crawler до URL. Якщо повністю заборонити обхід, бот може не побачити meta robots, який мав прибрати сторінку з індексу. Тому діагностика починається з фактичної відповіді сервера, HTML і правил для конкретного user agent.

Де ховається блокер

Перевіряємо meta robots у серверному HTML, X-Robots-Tag у заголовках, canonical, robots.txt, sitemap, мовні версії, правила CDN і middleware. Окремо дивимося, чи production випадково успадкував налаштування staging або шаблону CMS.

Пошук і тренування не потрібно змішувати

OpenAI окремо описує OAI-SearchBot для появи публічного контенту в пошуку ChatGPT і GPTBot для потенційного тренування моделей. Anthropic також публікує окремі правила для своїх ботів. Бізнес може дозволити пошукове використання і водночас обмежити інші сценарії.

Що доводить технічна перевірка

Вона доводить, що сторінку можна або не можна отримати, прочитати та індексувати у відповідному контурі. Вона не доводить, що конкретна система обов'язково вибере сторінку, процитує її або рекомендуватиме бренд. Це окрема перевірка фактичних відповідей.

Що робити після виправлення

Оновіть sitemap, перевірте canonical і мовні alternates, запросіть повторний обхід у Search Console, дайте системам час на оновлення та зніміть новий baseline. Не порівнюйте результат до і після, якщо набір промптів, мова або умови пошуку змінилися.

Практичний висновок

Збережіть HTML, response headers, robots.txt і дату перевірки до будь-яких змін. Після виправлення повторіть ті самі запити й технічні тести. Так ви відрізните реальний ефект від випадкової зміни відповіді та не будете продавати контент там, де проблема була в одному заголовку.

Первинні джерела

Посилання ведуть на документацію платформ і дослідження, на яких базуються твердження матеріалу.

  1. Google: robots meta tag and X-Robots-Tag
  2. OpenAI: publishers and developers FAQ
  3. Anthropic: crawler controls for site owners