Noindex і robots.txt роблять різну роботу
`noindex` керує індексацією сторінки. robots.txt керує доступом crawler до URL. Якщо повністю заборонити обхід, бот може не побачити meta robots, який мав прибрати сторінку з індексу. Тому діагностика починається з фактичної відповіді сервера, HTML і правил для конкретного user agent.
Де ховається блокер
Перевіряємо meta robots у серверному HTML, X-Robots-Tag у заголовках, canonical, robots.txt, sitemap, мовні версії, правила CDN і middleware. Окремо дивимося, чи production випадково успадкував налаштування staging або шаблону CMS.
Пошук і тренування не потрібно змішувати
OpenAI окремо описує OAI-SearchBot для появи публічного контенту в пошуку ChatGPT і GPTBot для потенційного тренування моделей. Anthropic також публікує окремі правила для своїх ботів. Бізнес може дозволити пошукове використання і водночас обмежити інші сценарії.
Що доводить технічна перевірка
Вона доводить, що сторінку можна або не можна отримати, прочитати та індексувати у відповідному контурі. Вона не доводить, що конкретна система обов'язково вибере сторінку, процитує її або рекомендуватиме бренд. Це окрема перевірка фактичних відповідей.
Що робити після виправлення
Оновіть sitemap, перевірте canonical і мовні alternates, запросіть повторний обхід у Search Console, дайте системам час на оновлення та зніміть новий baseline. Не порівнюйте результат до і після, якщо набір промптів, мова або умови пошуку змінилися.
Збережіть HTML, response headers, robots.txt і дату перевірки до будь-яких змін. Після виправлення повторіть ті самі запити й технічні тести. Так ви відрізните реальний ефект від випадкової зміни відповіді та не будете продавати контент там, де проблема була в одному заголовку.
Первинні джерела
Посилання ведуть на документацію платформ і дослідження, на яких базуються твердження матеріалу.