8 мин. четене

Кои AI ботове да пуснете в robots.txt (GPTBot, ClaudeBot, Google-Extended) и какво рискувате

Отворен файл robots.txt на екран с подчертани редове за OAI-SearchBot, ClaudeBot и Google-Extended, до него два стълба с надписи „пуснати“ и „спрени“

Ако искате ChatGPT, Claude и Perplexity да могат да четат и цитират сайта ви, пуснете в robots.txt поне роботите, които търсят и отварят страници по заявка на потребител: OAI-SearchBot и ChatGPT-User (OpenAI), Claude-SearchBot и Claude-User (Anthropic) и PerplexityBot. Решението за GPTBot, ClaudeBot и Google-Extended е отделно - те не носят посетители, а определят дали текстовете ви влизат в обучението на моделите. Рискът в едната посока е да ви използват, без да ви цитират; в другата - да не съществувате за асистентите. По-долу е какво прави всеки от тях, къде най-често се греши и примерен файл.

Какво е robots.txt и какво НЕ е

robots.txt е обикновен текстов файл в главната папка на сайта - отваря се на адрес вашиятсайт.bg/robots.txt. В него пишете кой робот къде може да влиза. Всеки ред „User-agent“ назовава робот, а редовете „Allow“ и „Disallow“ под него казват какво му е позволено.

Важното е какво НЕ е: не е ключалка. Файлът е молба, която добре възпитаните роботи спазват. OpenAI, Anthropic, Google и Perplexity заявяват, че техните я спазват - затова за тях файлът работи. Робот на скрепер, който краде съдържание, не го чете изобщо. Тоест robots.txt е инструмент за отношенията ви с назованите компании, не защита срещу непознати.

И още едно: това, което робот вече е прочел, не изчезва, когато го спрете. Забраната действа от този момент нататък.

Роботите поименно - и защо не са един вид

Най-честата грешка е да се мисли за „AI ботовете“ като за едно нещо. Те са три различни неща с три различни последици.

Роботи, които търсят и отварят страници за потребител

  • OAI-SearchBot (OpenAI) - гради индекса, през който търсенето в ChatGPT намира страници. Спрете ли го, търсенето в ChatGPT може да не ви намира. OpenAI заявява, че този робот не събира текст за обучение.
  • ChatGPT-User (OpenAI) - тръгва, когато потребител поиска от ChatGPT да отвори конкретна страница или да провери нещо в момента. Не обхожда сайта сам; отваря това, което човекът е поискал.
  • Claude-SearchBot (Anthropic) - обхожда страници, за да може търсенето в Claude да ги намира; аналогът на OAI-SearchBot.
  • Claude-User (Anthropic) - същото като ChatGPT-User, но за Claude: отваря страница по заявка на потребителя.
  • PerplexityBot (Perplexity) - индексира за търсачката Perplexity, която отговаря с цитати към източниците.

Тези пет решават дали асистентът може да ви цитира ДНЕС. За фирма, която иска да бъде намирана, няма причина да ги спира.

Роботи за обучение на модели

  • GPTBot (OpenAI) - събира текст, който може да влезе в обучението на бъдещи модели. Спирането му не спира търсенето в ChatGPT - за него отговаря OAI-SearchBot.
  • ClaudeBot (Anthropic) - основният робот на Anthropic; събира съдържание за моделите на Claude. Anthropic заявява, че спазва robots.txt.

Спирането на тези два не ви прави невидими за търсенето на асистентите. Но има и обратна страна: модел, който никога не е чел за вас, не ви „помни“ - и когато потребител пита без включено търсене, отговаря от памет. За малка фирма това е малка загуба, но не е нула.

Google-Extended - не е робот

Тук се бърка най-много. Google-Extended не тегли страници. Той е контролен запис в robots.txt, с който казвате на Google дали съдържанието, което Googlebot вече е обходил, може да се ползва за моделите Gemini и за Vertex AI. Самите страници и в двата случая се теглят от Googlebot - тоест, ако спрете Google-Extended, Googlebot продължава да ви обхожда както преди.

Google казва изрично, че Google-Extended не влияе на присъствието и класирането на сайта в Google Търсене. Обърнете внимание и на другото, което следва от това: AI Overviews и AI Mode в Google са част от Търсенето и се управляват с обичайните настройки за търсене, не с Google-Extended. Спирането му не ви маха оттам.

Просто правило за запомняне: Googlebot - Google Търсене, не го спирайте никога. Bingbot - Bing и през него ChatGPT, също никога. OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot - цитиране в асистентите. GPTBot, ClaudeBot, Google-Extended - обучение на модели. Решението е по група, не наведнъж.

Какво рискувате, ако ги пуснете

Първо - текстовете ви могат да влязат в обучение на модел, без да ви плащат и без да ви пращат посетител. За медия, платен курс, авторски рецепти или база с данни, за която хората плащат, това е истинска загуба и основателна причина да спрете GPTBot, ClaudeBot и Google-Extended.

Второ - асистентът може да преразкаже страницата ви, без потребителят да я отвори. За сайт, който живее от реклама върху посещения, това е удар. За фирма за услуги е обратното: „отговорът“ на асистента е вашето име, телефон и работно време - тоест самата заявка. Няма какво да бъде откраднато от една страница с контакти.

Трето - натоварване. Робот, който обхожда прекалено често, може да забави малък сайт на евтин хостинг. Това се случва рядко с назованите роботи, и когато се случи, се решава при хостинга или с ограничение на честотата - не със спиране в robots.txt.

Какво рискувате, ако ги спрете

Спрян OAI-SearchBot значи, че търсенето в ChatGPT може да не ви намира. Спрян ChatGPT-User значи, че когато клиент каже „отвори сайта на тази фирма и виж работното време“, ChatGPT отговаря, че не може. И в двата случая препоръчва някой друг.

Най-неприятното е, че това няма симптом. Сайтът работи, страниците се зареждат, нищо не гърми. Просто в отговорите на асистентите ви няма - и никой не ви казва защо. Затова спиране, направено „за всеки случай“, стои с години, без някой да го забележи.

Тук е и капанът, който хваща най-много хора: бутонът „блокирай AI ботовете“. Има го в панели на хостинги, в добавки за сигурност и в услуги като Cloudflare. С едно кликване той спира ВСИЧКИ - и роботите за обучение, и тези за търсене, на един куп. Някои от тези услуги дори пишат свои правила НАД вашия файл, тоест кодът на сайта ви казва „пусни“, а живият адрес казва „спри“. Проверявайте живия robots.txt в браузъра, не файла, който разработчикът е написал.

Отделно от robots.txt съществуват и защитни стени, които връщат на роботите грешка, без да пишат нищо никъде. Ако robots.txt ви е чист, а асистентът пак казва „не мога да отворя страницата“, търсете там.

Примерен robots.txt за фирма, която иска да бъде намирана

Ето какво бихме сложили на сайт на фирма за услуги - ресторант, сервиз, кабинет, счетоводна къща. Първите редове пускат изрично роботите, които цитират:

  • User-agent: OAI-SearchBot
  • Allow: /
  • User-agent: ChatGPT-User
  • Allow: /
  • User-agent: Claude-SearchBot
  • Allow: /
  • User-agent: Claude-User
  • Allow: /
  • User-agent: PerplexityBot
  • Allow: /

За GPTBot, ClaudeBot и Google-Extended решете според съдържанието. Фирма за услуги няма какво да пази и има какво да спечели от това моделите да са чели за нея - при нея бихме ги пуснали по същия начин. Ако продавате самото съдържание, спрете само тях:

  • User-agent: GPTBot
  • Disallow: /
  • User-agent: ClaudeBot
  • Disallow: /
  • User-agent: Google-Extended
  • Disallow: /

Две уточнения, които спестяват грешки. Робот, който не е споменат поименно, следва правилата за „User-agent: *“ - тоест, ако там пише „Disallow: /“, всичко неназовано е спряно, включително и това, което сте пропуснали да изброите. И второ: файлът работи само на главния адрес, robots.txt в подпапка не прави нищо.

Как да проверите за една минута

  1. Отворете вашиятсайт.bg/robots.txt в браузъра. Потърсете имената по-горе. Няма ли ги изобщо - роботите следват правилата за „*“; погледнете какво пише там.
  2. Ако хостингът или CDN услугата ви има настройка за AI ботове - отворете я и вижте какво е включено. Ако не сте я включвали вие, може да е включена по подразбиране.
  3. Отворете ChatGPT с включено търсене и му кажете: „Прочети [адрес на страница от сайта ви] и ми кажи какво предлага фирмата“. Ако преразкаже вярно - пуснат е. Ако каже, че не може да отвори страницата - някой го спира: robots.txt, защитна стена или страница, която се сглобява в браузъра и за машината е празна.

Пускането на роботите не гарантира, че асистентът ще ви препоръча - никой не може да обещае това. То гарантира само, че когато потърси, ще може да ви прочете. Без него всичко останало - текстове, структурирани данни, четим сайт - остава невидимо. Ако някой ви продава „оптимизация за AI търсене“ (тя има и техническо име, GEO), първият въпрос към него е дали е отворил живия ви robots.txt.

ТемиChatGPTrobots.txtИндексиранеSEO

Източници

  • OpenAI - документация за роботите GPTBot, OAI-SearchBot и ChatGPT-User - Кой робот за какво се ползва и че всеки от тях спазва robots.txt.
  • Anthropic - документация за ClaudeBot, Claude-SearchBot и Claude-User - Имена на роботите на Claude, за какво служи всеки и управлението им през robots.txt.
  • Google Search Central - Googlebot и Google-Extended - Google-Extended не тегли страници; той е контролен запис за ползване на съдържанието в Gemini и Vertex AI и не влияе на класирането в Google Търсене.
  • Perplexity - документация за PerplexityBot - Име на робота за индексиране.
Свързана услуга

Излизане в отговорите на ChatGPT и AI

Все повече клиенти питат ChatGPT, Gemini или Claude, вместо да търсят в Google. Сайтът ви трябва да е четим и за тях.

Виж какво влиза