¿Deberías bloquear los rastreadores de IA? GPTBot, ClaudeBot y la decisión entrenamiento-vs-cita
Para la mayoría de los sitios que quieren ser encontrados, no — pero la respuesta real es que la “IA” no es una sola puerta. Detrás de la palabra hay rastreadores separados con trabajos separados: bots de entrenamiento que alimentan los pesos del modelo, y bots de cita que buscan páginas para que una IA pueda citarte y enlazarte en una respuesta. La instrucción que mantiene tu contenido fuera del entrenamiento también puede borrarte de la búsqueda con IA, así que esto es una decisión de bisturí, no de martillo. Lo sensato por defecto es permitir los agentes de cita y búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot) —esa es tu presencia en las respuestas de IA, un canal de alta intención que crece rápido— y luego decidir con calma y por separado si bloqueas los agentes de entrenamiento (GPTBot, ClaudeBot, Google-Extended), lo cual es una decisión legítima que no te cuesta nada en Google. Dos salvedades honestas: robots.txt es una petición, no un muro, así que un bloqueo real va en tu firewall; y nada de esto importa si tu sitio es JavaScript renderizado en el cliente, porque la mayoría de los rastreadores de IA no puede ejecutarlo y verá una página en blanco, los permitas o no.
La “IA” no es una sola puerta: bots de entrenamiento vs. bots de cita
El titular que dispara esta pregunta —“la IA está raspando el contenido de todos, ¿no debería cerrar la puerta?”— esconde que cada empresa de IA seria corre no un bot sino una familia de ellos, separados a propósito (Inspeccia, 2026). Los bots de entrenamiento rastrean en masa para construir los pesos del modelo, corren de forma continua sin disparo de un usuario, y no devuelven atribución; los bots de búsqueda buscan páginas en tiempo real cuando alguien hace una pregunta, y citan la fuente con un enlace de vuelta (Pixelmojo, 2026). Son trabajos distintos, y responden a reglas distintas en tu robots.txt.
Vale la pena conocer el elenco de 2026 por su nombre. OpenAI corre GPTBot (entrenamiento), OAI-SearchBot (el índice detrás de la búsqueda y la cita de ChatGPT) y ChatGPT-User (una petición puntual cuando alguien le pide a ChatGPT abrir un enlace); Anthropic lo refleja con ClaudeBot (entrenamiento), Claude-SearchBot (búsqueda) y Claude-User (puntual) (Rankry, 2026). Perplexity corre PerplexityBot (búsqueda) y Perplexity-User (fetch en vivo), y Google-Extended no es un rastreador en absoluto sino un token de robots.txt que controla si tu contenido entrena a Gemini (Rankry, 2026). Una advertencia: las cadenas viejas de Anthropic anthropic-ai y Claude-Web están obsoletas, así que una regla que aún las use no bloquea nada (Mersel, 2026).
¿Bloquear los rastreadores de IA perjudica mi posición en Google?
No, y este es el miedo que impide a la gente tomar una decisión limpia. Bloquear GPTBot no tiene efecto en Google, porque GPTBot y Googlebot son sistemas completamente separados (Mersel, 2026). El confuso es Google-Extended, y Google confirmó de forma explícita que bloquearlo excluye tu contenido solo del entrenamiento de Gemini y Vertex AI, nunca de tu inclusión ni tu ranking en la Búsqueda (Pixelmojo, 2026). El único bot que te saca de la Búsqueda de Google al bloquearlo es el propio Googlebot.
Esa separación es lo que hace que un bloqueo de entrenamiento se pueda considerar por sus propios méritos. Bloquear un rastreador de entrenamiento es una decisión genuina sobre tu propiedad intelectual —algunos editores se oponen por principio al uso no compensado en entrenamiento— y puedes tomarla sin pagar un impuesto de SEO (Rankry, 2026). El error es suponer que el bloqueo es invisible: aunque prohíbas hoy un bot de entrenamiento, tu contenido puede estar ya en los pesos del modelo por rastreos anteriores (Pixelmojo, 2026).
El punto medio: bloquear entrenamiento, permitir cita
Para un negocio que quiere ser encontrado, la configuración óptima en 2026 es bloquear los rastreadores de entrenamiento mientras permites los de búsqueda, de modo que tu contenido aparezca en respuestas de IA con atribución y tráfico de referencia pero no alimente modelos que no controlas (SEOScore, 2026). Vale la pena decirlo claro porque muchos sitios lo hacen a medias y lo pagan: el 79% de los principales sitios de noticias bloquea los bots de entrenamiento, pero el 71% también bloquea los de recuperación — cortando sus propias citas en el mismo archivo (Pixelmojo, 2026). La razón para dejar abiertos los bots de cita es que el canal es real: se ha medido que el tráfico referido por IA convierte cerca de 4,4 veces mejor que la búsqueda orgánica estándar (Mersel, 2026).
Ahora hay una forma más limpia de expresar la intención que las reglas de bloqueo solas. A finales de 2025 Cloudflare introdujo una Content Signals Policy para robots.txt que declara cómo puede usarse el contenido después de buscarse, con tres señales: search para indexar y mostrar enlaces, ai-input para respuestas de IA en tiempo real como recuperación y grounding, y ai-train para entrenar o afinar modelos (Rankry, 2026). Te deja decir “léeme, cítame, pero no me entrenes” como preferencia en vez de como un disallow tosco. Vale conocer un matiz de tiempo antes de editar nada: OpenAI actualizó su arquitectura de rastreadores a fines de 2025 para que sus bots de búsqueda y de entrenamiento compartan información, y bloquear GPTBot ahora solo afecta las corridas de entrenamiento futuras — el contenido ya ingerido se queda en el modelo. Así que bloquear el entrenamiento es una decisión con vista al futuro sobre tu próximo contenido, no una forma de recuperar lo que ya se aprendió (Rank and Convert, 2026).
robots.txt es una petición, no un muro
Antes de tratar robots.txt como protección, entiende qué es: una petición voluntaria, formalizada como RFC 9309, que se hace cumplir por buena fe y no por ley (DataImpulse, 2026). Los grandes rastreadores documentados —Googlebot, GPTBot, ClaudeBot, PerplexityBot— suelen respetarlo, y puedes confirmarlo en tus logs, pero importan tres salvedades. El cumplimiento es opcional, y algunos rastreadores como Bytespider y los fetchers sigilosos de Perplexity han sido documentados ignorándolo (Anagram, 2026). Los fetch en tiempo real que dispara un usuario son zona gris: cuando una persona le pide a un asistente leer una URL concreta, los proveedores suelen tratar eso como acceso dirigido por el usuario y no como rastreo, así que tus reglas de rastreo pueden no aplicar (DataImpulse, 2026). Y una cadena de user-agent se puede falsificar, así que una verificación de identidad real es una búsqueda de DNS inverso, no confiar en la cabecera (Anagram, 2026).
La consecuencia práctica: si de verdad necesitas detener a un bot en vez de pedirle que se vaya, aplícalo en el borde con una regla de firewall o WAF, porque una regla de CDN anula robots.txt de todos modos (Rankry, 2026). Esto corta en ambos sentidos — una investigación sobre la red de Cloudflare halló muchos sitios bloqueando por accidente a grandes rastreadores de IA en el CDN mientras su robots.txt decía “permitir”, así que las dos capas tienen que coincidir (DataImpulse, 2026).
La trampa que nadie menciona: una puerta abierta a un cuarto vacío
Aquí está la parte que vuelve discutible todo el debate de robots.txt para una buena porción de sitios. Una investigación de Vercel y MERJ halló que cerca del 69% de los rastreadores de IA no puede ejecutar JavaScript, así que si tu sitio renderiza su contenido del lado del cliente, esos bots reciben una página casi vacía sin importar qué diga tu robots.txt (Mersel, 2026). Puedes permitir a todos los bots de cita que existen y aun así ser invisible en las respuestas de IA, porque no había nada que leer en el HTML que buscaron.
Por eso el acceso y la legibilidad son dos problemas distintos, y tratamos el segundo como el de verdad. Abrir tu robots.txt es el paso cero; asegurar que tu contenido más importante existe en el HTML estático que un bot recibe es el paso que de verdad gana citas (Anagram, 2026). Es el mismo argumento que hacemos en nuestra guía sobre JavaScript y rendimiento web: el contenido más seguro es el que se renderiza sin que corra ningún script.
robots.txt vs. llms.txt: acceso frente a navegación
Estos dos archivos se confunden a menudo, y hacen cosas opuestas. robots.txt gobierna el acceso —qué rastreadores pueden buscar qué rutas; llms.txt gobierna la navegación— guía a los sistemas de IA hacia tu contenido más valioso una vez que se les permite entrar (DataImpulse, 2026). Uno es una reja, el otro es un letrero, y un sitio que apunta a la visibilidad en IA quiere ambos bien puestos. La adopción de llms.txt sigue rondando el 10% de los dominios, lo que lo vuelve una señal de bajo esfuerzo y bajo riesgo que pocos competidores se han molestado en poner (Mersel, 2026). Cubrimos qué hace, y con honestidad qué todavía no hace, en nuestra guía sobre qué es llms.txt.
Cómo verificar que de verdad funcionó
Editar el archivo es la parte fácil; confirmar que surtió efecto es donde los sitios se dan una falsa sensación de seguridad (Rankry, 2026). La prueba son tus logs de acceso del servidor: busca cada bot por su nombre y revisa los códigos de respuesta, donde los bots permitidos deberían devolver 200 y los prohibidos deberían dejar de aparecer del todo (Rankry, 2026). Una directiva que nunca verificaste es una directiva que solo esperas que funcione.
Revisa primero la capa de CDN, porque puede bloquear o desafiar bots antes de que una petición siquiera llegue a tu robots.txt (Rankry, 2026). Esto importa más desde que Cloudflare empezó a bloquear rastreadores de IA por defecto en dominios nuevos a partir de julio de 2025, lo que significa que un sitio recién creado puede ser invisible para la IA sin una sola línea en su propio robots.txt (Inspeccia, 2026). Si tus logs y tu intención no coinciden, el borde suele ser donde está la respuesta.
Qué hacemos, y qué te diríamos que hagas
Nuestra propia postura es la que maximiza la visibilidad: permite los bots que pueden citarte, ten lista una regla de borde para los que se portan mal, y —la parte que la mayoría de las guías omite— construye el sitio como HTML estático para que la puerta abierta lleve a algún lugar que un rastreador pueda de verdad leer. En un sitio renderizado en el cliente, el permiso es teatro; en uno estático, el permiso es una invitación que el bot puede aceptar. Ahora hay un tercer ajuste más allá de permitir y bloquear — cobrar — que nuestra guía sobre si deberías cobrarles a los rastreadores de IA sopesa, junto con por qué encaja mucho más a los publishers que a la mayoría de los negocios. Para un sitio que quiere ser una respuesta, la configuración del archivo y la arquitectura tienen que apuntar en la misma dirección, que es todo el argumento de nuestro pilar sobre si tu sitio es legible para la IA.
Si te aconsejáramos sobre el archivo en sí: permite OAI-SearchBot, Claude-SearchBot y PerplexityBot para seguir elegible para citas; decide el entrenamiento (GPTBot, ClaudeBot, Google-Extended) en tus propios términos de propiedad intelectual, sabiendo que no cuesta nada en Google; bloquea los scrapers masivos puros que no devuelven nada; y verifica todo en tus logs. Después gasta el resto de tu esfuerzo donde se acumula — en el contenido y la estructura que una IA lee una vez que cruza la puerta.
Frequently asked
- ¿Bloquear GPTBot perjudica mi posición en Google?
- No. GPTBot es el rastreador de OpenAI y no tiene nada que ver con Googlebot, que se encarga de la indexación de Google. Bloquear GPTBot no afecta tu posición en Google. Lo mismo ocurre con Google-Extended, que es un token de robots.txt, no un rastreador: bloquearlo solo excluye tu contenido del entrenamiento de Gemini y Vertex AI, y Google confirmó que nunca afecta la inclusión ni el ranking en la Búsqueda. El único bot que jamás debes bloquear si quieres visibilidad en Google es el propio Googlebot.
- ¿Puedo permitir las citas de IA pero bloquear el entrenamiento?
- Sí, y para la mayoría de los negocios de contenido es lo sensato por defecto. Cada gran proveedor de IA corre ahora rastreadores separados para entrenamiento y para búsqueda, así que puedes prohibir los agentes de entrenamiento (GPTBot, ClaudeBot, Google-Extended) mientras permites los de búsqueda y recuperación (OAI-SearchBot, Claude-SearchBot, PerplexityBot) que te mantienen elegible para ser citado en respuestas de IA. La decisión es por categoría, no todo o nada. La línea entre búsqueda y entrenamiento no siempre es perfectamente limpia, pero bloquear los rastreadores explícitamente de entrenamiento igual envía una señal clara sobre cómo puede usarse tu contenido.
- ¿Qué rastreadores de IA debo conocer en 2026?
- OpenAI corre GPTBot (entrenamiento), OAI-SearchBot (búsqueda y cita de ChatGPT) y ChatGPT-User (petición puntual). Anthropic corre ClaudeBot (entrenamiento), Claude-SearchBot (búsqueda) y Claude-User (petición puntual); evita las cadenas obsoletas anthropic-ai y Claude-Web, que ya no funcionan. Perplexity corre PerplexityBot (búsqueda) y Perplexity-User (fetch en vivo). Google-Extended es un token, no un rastreador, y controla solo el entrenamiento de Gemini. Los scrapers masivos como CCBot y Bytespider no devuelven tráfico y suelen bloquearse de plano.
- ¿robots.txt es legalmente vinculante?
- No. robots.txt, estandarizado como RFC 9309, es una petición voluntaria que los rastreadores que se portan bien respetan, no una ley ni un muro técnico. Los grandes rastreadores documentados suelen respetarlo, y puedes verificarlo en tus logs de servidor, pero el cumplimiento es opcional, un user-agent falsificado puede afirmar ser cualquier cosa, y los fetch en tiempo real que dispara una persona suelen ignorarlo con el argumento de que alguien pidió esa página concreta. Si necesitas detener de verdad a un bot en vez de pedirle que se vaya, aplícalo en tu firewall o CDN, que de todos modos anula robots.txt.
- Si abro mi sitio a los rastreadores de IA, ¿lo leerán con seguridad?
- Solo si hay algo legible detrás de la puerta abierta. Una investigación de Vercel y MERJ halló que cerca del 69% de los rastreadores de IA no pueden ejecutar JavaScript, así que un sitio que renderiza su contenido del lado del cliente les entrega una página casi vacía sin importar qué permita robots.txt. Permitir a un rastreador es necesario pero no suficiente: el contenido también tiene que existir en el HTML estático que el bot recibe, que es una de las razones centrales por las que construimos sitios como HTML estático en vez de aplicaciones renderizadas en el cliente.