Desde 2024 los proveedores de IA publican el nombre de sus rastreadores y prometen respetar lo que pongas en robots.txt. Eso ha convertido un archivo que casi nadie tocaba en una decisión: ¿dejo que ChatGPT lea mi web? De las 195 webs de negocio que hemos mirado, el 90 % ni se lo ha planteado, y las que sí tienen casi todas la misma lista, la que circula por los blogs, sin que se note una decisión detrás. Esta guía es para decidirlo sabiendo qué hace cada bot y qué cambia en tu negocio.
Qué es robots.txt y hasta dónde llega
Es un archivo de texto en la raíz de tu web (tudominio.es/robots.txt) con instrucciones para los robots: quién puede entrar y a qué carpetas. Cada bloque empieza con "User-agent:" y el nombre del robot (o un asterisco para todos) y sigue con "Disallow:" y "Allow:". Es una petición, no una cerradura: Google lo dice de sus propios rastreadores en su documentación, "no es un mecanismo para mantener una página fuera de Google", y lo mismo vale para los de IA. Los serios lo respetan; los que no lo son, no leen el archivo.
Con esa limitación, sirve para lo que sirve: decirles a los proveedores que se han comprometido a obedecer qué pueden hacer con tu web.
Los rastreadores, uno a uno
No hay "el bot de ChatGPT". Cada proveedor tiene dos o tres, y hacen cosas distintas. Esta tabla sale de la documentación de cada uno, consultada el 5 de septiembre de 2026.
| Nombre en robots.txt | De quién | Para qué | ¿Respeta robots.txt? |
|---|---|---|---|
| GPTBot | OpenAI | Rastrear contenido que puede usarse para entrenar sus modelos | Sí |
| OAI-SearchBot | OpenAI | Encontrar y mostrar webs en las respuestas de ChatGPT con búsqueda | Sí |
| ChatGPT-User | OpenAI | Visitar una página cuando un usuario se lo pide a ChatGPT | "Puede no aplicarse", dice OpenAI |
| ClaudeBot | Anthropic | Entrenamiento y desarrollo de modelos | Sí |
| Claude-SearchBot | Anthropic | Indexar para mejorar los resultados de búsqueda de Claude | Sí |
| Claude-User | Anthropic | Visitar una web cuando un usuario de Claude lo pide | Sí |
| PerplexityBot | Perplexity | Mostrar y enlazar webs en los resultados de Perplexity; no entrena | Sí |
| Perplexity-User | Perplexity | Visitar una página a petición de un usuario | "Generalmente lo ignora", dice Perplexity |
| Google-Extended | Controlar si tu contenido entrena Gemini y fundamenta sus respuestas; no afecta a la Búsqueda | Sí | |
| CCBot | Common Crawl | Archivo público que muchos modelos han usado para entrenar | Sí |
| Bytespider, Applebot-Extended, Meta-ExternalAgent | ByteDance, Apple, Meta | Entrenamiento de sus modelos | Declaran que sí |
La distinción que importa está en la tercera columna: entrenamiento (tu texto se usa para fabricar modelos futuros), búsqueda (la IA te cita como fuente cuando alguien pregunta) y visita de usuario (una persona le ha pedido a la IA que abra tu web, y eso robots.txt no lo para). Bloquear la primera categoría es una decisión sobre tus textos. Bloquear la segunda es una decisión sobre tus clientes.
Las dos decisiones razonables
Decisión A: dejar pasar a todos. Es lo que hace el 90 % de las webs que hemos mirado, casi siempre por no haber decidido nada. Para un negocio local es defendible: lo que una IA "aprende" de la web de una peluquería no le quita clientas a la peluquería, y cualquier cita en una respuesta de ChatGPT es una visita gratis. No hay que escribir nada; basta con no tener un "Disallow: /" bajo el asterisco.
Decisión B: cerrar el entrenamiento, dejar abierta la búsqueda. Tiene sentido si escribes contenido propio que no quieres que alimente modelos (guías, fotografías con texto, tarifas elaboradas) y aun así quieres que te encuentren. Es lo que han hecho, con más o menos acierto, las 19 webs que nombran bots de IA. El fragmento:
# Búsqueda con IA: pueden leer y citar la web
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
# Entrenamiento de modelos: no
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: CCBot
User-agent: Bytespider
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
Disallow: /
Se pega al final del robots.txt que ya tengas, sin tocar el bloque del asterisco. Cada bot busca primero un bloque con su nombre y, si no lo hay, usa el del asterisco; por eso el primer grupo lleva "Allow: /" explícito, para que la búsqueda siga abierta aunque más adelante cierres algo a todos.
Lo que no es razonable: un "User-agent: *" con "Disallow: /". Cierra Google, Bing, las IA y todo lo demás. Lo tienen tres de las 195 webs; ninguna de las tres nombra un solo bot de IA, así que casi seguro es un resto de cuando la web estaba en construcción. Si es tu caso, ese es tu problema de visibilidad, no la IA.
Cómo se edita en WordPress y en el resto
WordPress no crea un archivo; sirve un robots.txt virtual con dos líneas que cierran el escritorio (/wp-admin/) y abren admin-ajax. Para añadir reglas hay dos caminos. Los plugins de SEO tienen un editor: en Yoast está en Herramientas, editor de archivos; en Rank Math en Ajustes generales, editar robots.txt; en All in One SEO en Herramientas, editor de robots.txt. O subes un archivo robots.txt a la raíz por FTP o desde el panel del alojamiento, y ese archivo manda sobre el virtual. En una web a medida o en otro gestor, el archivo está en la raíz y se edita como cualquier texto.
Después de guardar, abre tudominio.es/robots.txt en el navegador y comprueba que se ve lo que has escrito. Un error de sintaxis (una línea sin dos puntos, un bloque sin "User-agent") hace que el resto del archivo se lea de forma imprevisible.
Compruébalo tú en tres minutos
- Abre tudominio.es/robots.txt. Si da error 404, no tienes archivo y todo el mundo puede entrar; no pasa nada malo.
- Busca "Disallow: /" justo debajo de "User-agent: *". Si está, tu web está cerrada a todos. Quítalo, salvo que la web esté en construcción a propósito.
- Busca "GPTBot". Si aparece con "Disallow: /", alguien decidió cerrar el entrenamiento de OpenAI. Mira si también nombra "OAI-SearchBot"; si no, la búsqueda sigue abierta, que es lo que querías.
- Decide A o B y, si es B, pega el fragmento de arriba tal cual.
Lo que robots.txt no arregla
Que una IA pueda entrar no significa que encuentre algo útil. De esas mismas 195 webs, solo el 32 % tiene el horario escrito en la portada y el 17 % tiene datos estructurados de negocio; lo que una IA necesita leer, y por qué la mayoría no lo ofrece, está en tu web vista por ChatGPT. Y para un negocio local, la fuente que las IA citan primero sigue siendo la ficha de Google con sus reseñas, no la web: si no apareces en Maps, robots.txt es el menor de tus problemas y hay una guía para eso.
Preguntas sobre los bots de IA y robots.txt
No. GPTBot es el rastreador de entrenamiento. El que busca páginas para las respuestas de ChatGPT con búsqueda es OAI-SearchBot, y las visitas que hace ChatGPT cuando un usuario le pide abrir una web las hace ChatGPT-User, que según OpenAI puede no obedecer robots.txt. Bloquear GPTBot solo impide que tu texto se use para entrenar modelos futuros.
No. Google dice en su documentación que Google-Extended "no afecta a la inclusión de un sitio en la Búsqueda de Google ni se usa como señal de posicionamiento". Controla si tu contenido se usa para entrenar Gemini y para fundamentar sus respuestas. Googlebot sigue entrando igual.
No. Es una petición que los rastreadores serios respetan y los demás ignoran. Google lo dice de sus propios robots: robots.txt "no es un mecanismo para mantener una página fuera de Google". OpenAI, Anthropic, Perplexity y Google afirman que sus rastreadores lo respetan; las visitas que hace un usuario desde ChatGPT o Perplexity, no siempre.
WordPress genera uno virtual si no hay archivo físico, con dos líneas que solo cierran el escritorio. Para añadir reglas, los plugins de SEO (Yoast, Rank Math, All in One SEO) tienen un editor; o subes un archivo robots.txt a la raíz, que manda sobre el virtual.
Dejar pasar a todos, o como mucho cerrar el entrenamiento y dejar abierta la búsqueda. Un negocio local vive de que le encuentren; lo que una IA "aprende" de la web de un taller no le quita clientes al taller. Cerrarlo todo, que es lo que hacen tres de las 195 webs que hemos mirado, te saca también de Google.
Fuentes
- OpenAI, rastreadores de OpenAI (OAI-SearchBot, GPTBot, ChatGPT-User), consultado el 5 de septiembre de 2026
- Anthropic, ClaudeBot, Claude-User y Claude-SearchBot, y cómo bloquearlos
- Perplexity, PerplexityBot y Perplexity-User
- Google, Google-Extended en la lista de rastreadores comunes ("no afecta a la inclusión en la Búsqueda de Google")
- Google, introducción a robots.txt ("no es un mecanismo para mantener una página fuera de Google")
- Dimuweb, rastreo del robots.txt de 195 webs de pymes de la Comunidad de Madrid (ocho sectores, muestra de OpenStreetMap), 5 de septiembre de 2026