¿Deberías cobrarles a los rastreadores de IA? Pay-per-crawl, y por qué la mayoría de los negocios no debería

· 10 min de lectura · Web Involved

¿Deberías cobrarles a los rastreadores de IA por acceder a tu contenido?

En 2026 apareció una tercera opción junto a la vieja elección de bloquear-o-permitir: ahora puedes cobrarles a los rastreadores de IA por el acceso. Mediante pay-per-crawl — iniciado por Cloudflare usando el código HTTP 402 “Pago Requerido” largamente inactivo — un sitio puede exigir pago antes de que un bot de IA lea una página, con el CDN actuando como cámara de compensación para facturarle al rastreador y pagarle al publisher. Existe porque la economía se volvió despareja: los rastreadores de IA golpean los sitios miles de veces por cada referral que devuelven, tomando contenido para impulsar respuestas mientras retornan casi nada de tráfico. Pero para la mayoría de los negocios, la respuesta honesta a “¿deberías cobrar?” es no. El pay-per-crawl beneficia principalmente a publishers cuyo contenido es el producto — noticias, referencia, investigación — porque sus palabras son lo que las empresas de IA quieren licenciar. Si tu sitio existe para promocionar tus servicios o vender tus productos, tu contenido es la vitrina, no el activo, y cobrar o bloquear a los rastreadores de citación te cortaría de un canal de descubrimiento que sí quieres, porque ser citado en ChatGPT o Perplexity te manda visitantes calificados. Lo que sí vale entender es la división de 2026 entre rastreadores de Search, Agent y Training — porque puedes mantenerte visible a los de citación que te ayudan mientras aún te opones a los de entrenamiento que toman sin dar. Para un negocio típico, esa vía media le gana tanto a cobrar como a bloquear todo. Este es el compañero ofensivo de nuestra guía sobre si bloquear los rastreadores de IA: mismo panel de control, pregunta opuesta.

La tercera opción: de bloquear-o-permitir a cobrar

Durante años, un dueño de sitio enfrentando a los rastreadores de IA tenía dos opciones poco atractivas: bloquear cada rastreador y desaparecer de las respuestas de IA, o permitir acceso sin restricción y dejar que las empresas de IA entrenen con tu trabajo gratis (StartupHub, 2026). A mediados de 2025 llegó una tercera vía. Cloudflare, que se sienta frente a una gran porción de la web, lanzó pay-per-crawl: los dueños de contenido pueden permitir, bloquear, o cobrar a un rastreador un precio fijo por el acceso (Cloudflare, 2025). El mecanismo desempolva el código de respuesta HTTP 402, “Pago Requerido”, que estuvo casi sin usar por treinta años — un rastreador de IA o presenta el pago y recibe la página, o recibe una respuesta 402 con un precio (Cloudflare, 2025).

La idea se difundió rápido. AWS y Akamai lanzaron sus propias versiones integradas en los firewalls que los sitios ya corren, y startups como TollBit y ScalePost construyeron marketplaces de contenido de IA (StartupHub, 2026). La razón por la que prendió es directa: convierte el tráfico de bots de IA de un costo de ancho de banda que absorbes en algo que puedes ponerle precio. La pregunta que esta guía responde no es cómo cobrar — tu CDN se encarga de eso — sino si deberías, y para la mayoría de los negocios la respuesta es más interesante que el mecanismo.

El cambio de 2026: Search vs Agent vs Training

Antes de decidir, necesitas la distinción que reorganizó toda esta conversación en 2026. “Rastreador de IA” no es una sola cosa; la taxonomía útil lo divide en tres (Technology.org, 2026):

  • Rastreadores de Search indexan tu contenido para que un motor de IA pueda responder preguntas y citarte después. Son los que te dan visibilidad, y generalmente los quieres.
  • Rastreadores de Agent actúan en tiempo real en nombre de una persona — los navegadores de IA cubiertos en nuestra guía sobre preparación para agentes, trayendo una página para completar una tarea que alguien pidió.
  • Rastreadores de Training absorben tu contenido de forma permanente en un modelo. Este es el uso al que los publishers más se oponen, porque el contenido se toma una vez y no da nada a cambio.

Esta división importa porque convierte un sí-o-no romo en una decisión sobre la que de verdad puedes razonar. Desde el 15 de septiembre de 2026, el default de Cloudflare para sitios nuevos y gratuitos bloquea los rastreadores de Training y Agent en páginas con ads mientras mantiene Search permitido, y trata a los rastreadores multipropósito como Googlebot por todos sus comportamientos, ganando la regla más restrictiva (Cloudflare, 2026). No tienes que aceptar esos defaults, pero el marco — decidir por propósito, no por bot — es la forma correcta de pensarlo.

La economía detrás de esto

Para entender por qué los publishers empujaron por esto, mira la matemática del tráfico, que es genuinamente despareja. Por varias mediciones de 2026, los rastreadores de IA traen una página enormemente más seguido de lo que devuelven a alguien: las cifras reportadas para el rastreador de Anthropic llegan a decenas de miles de páginas traídas por referral, las de OpenAI a miles bajos, mientras que hasta Google rastrea del orden de una docena o más de veces por cada clic que devuelve (Forbes, 2026). Los referrals de chatbots de IA dan mucho menos tráfico que la búsqueda tradicional, y los usuarios pasan a las fuentes citadas solo una pequeña fracción de las veces (Forbes, 2026).

Para un publisher grande, eso es un problema existencial: el viejo trato — deja que la búsqueda te rastree, recibe lectores de vuelta — se rompió, y el pay-per-crawl es un intento de reconstruirlo. Cloudflare incluso está evolucionando el modelo a “Pay Per Use”, cobrándoles a las empresas de IA cuando el contenido crea valor, como aparecer en una respuesta, en vez de solo cuando se trae (TechCrunch, 2026). Publishers mayores — sitios de noticias, referencia y conocimiento — se han alineado tras estas herramientas porque su contenido es exactamente lo que las empresas de IA necesitan. Ese último punto es la bisagra sobre la que gira tu propia decisión.

¿Deberías cobrar? La respuesta honesta para la mayoría de los negocios

Aquí es donde nos separamos de la cobertura entusiasmada. El pay-per-crawl está construido para, y beneficia a, organizaciones cuyo contenido es el producto — publishers licenciando artículos, sitios de referencia, bases de datos de investigación. Si ese eres tú, cobrar es una conversación de ingresos real, y la pregunta se vuelve por cuál proveedor cobrar. Pero la mayoría de los negocios no son eso. Si tu sitio existe para promocionar tus servicios o vender tus productos, tu contenido no es el activo que una empresa de IA quiere licenciar — es tu vitrina, y su trabajo es traerte clientes.

Para ese grupo mucho mayor, cobrar o bloquear a los rastreadores de citación es un error, porque te quita de las respuestas de IA donde la gente cada vez más descubre negocios. Ser citado en ChatGPT o Perplexity es descubrimiento que quieres, y los estudios han encontrado que los visitantes referidos por IA convierten a tasas notablemente más altas que los clics de búsqueda ordinarios. Hasta la cobertura dirigida a publishers de contenido concede que para la mayoría de los sitios el ingreso inmediato del pay-per-crawl es modesto, y que los jugadores más pequeños tienen poco poder de negociación con las grandes plataformas de IA (Affiverse, 2026). Frente a ceder tu lugar en el descubrimiento de IA, una tarifa modesta e incierta es un mal trato para un negocio cuyo sitio es un activo de marketing.

Cuándo cobrar tiene sentido — y RSL

Nada de esto significa que las herramientas sean inútiles; significa que apuntan a una situación específica. Cobrar tiene sentido cuando tu contenido tiene valor de licencia independiente — cuando una empresa de IA genuinamente pagaría por entrenar con o referenciar tu material específico porque es original, autoritativo, y difícil de conseguir en otro lado. La investigación original, los datos propietarios, las bibliotecas de referencia profundas, y el periodismo encajan en esa descripción. Si posees contenido así, los estándares emergentes valen la pena vigilar: RSL (Really Simple Licensing) es un estándar abierto que agrega términos de licencia y precio legibles por máquina a tu sitio, en la misma familia que robots.txt y llms.txt, y se impulsa como estándar abierto precisamente para que ninguna empresa controle los términos (StartupHub, 2026).

Aun así, mantén a la vista las salvedades honestas: la atribución está sin resolver — una respuesta de IA puede mezclar decenas de fuentes sin citar ninguna — y enrutar todo por un intermediario como un solo CDN cambia poder sobre las empresas de IA por dependencia de ese proveedor (Forbes, 2026). Las herramientas son tempranas, y el mercado aún se está formando. Saber que existen y a grandes rasgos cómo funcionan es suficiente para la mayoría de los dueños; construir tu estrategia alrededor de ellas es una decisión reservada para los sitios cuyo contenido es genuinamente el negocio.

Qué te diríamos

El encuadre que ofreceríamos es el que los titulares entusiasmados se saltan: la pregunta correcta no es “¿cómo les cobro a los rastreadores de IA?”, es “¿mi contenido es algo por lo que una empresa de IA pagaría, o es la puerta de entrada a mi negocio?”. Para el pequeño conjunto de publishers en el primer campo, el pay-per-crawl y RSL valen atención real, y te ayudaríamos a fijar la política de Search-Agent-Training que encaje. Para todos los demás — los negocios cuyo sitio vende servicios o productos — el movimiento es mantenerse descubrible para los rastreadores de citación que te ayudan a ser encontrado, decidir por separado si te opones al uso para entrenamiento de tu contenido, y no cobrar, porque la visibilidad vale mucho más que la tarifa.

Esa es la misma postura con mentalidad de propiedad, de decirte-cuándo-no-molestarte, que recorre nuestro trabajo: una herramienta correcta para un periódico puede ser incorrecta para un consultorio dental, y pretender lo contrario te vende complejidad que no necesitas. Si tu pregunta es la defensiva — cómo mantener fuera a los rastreadores de entrenamiento no deseados sin perder visibilidad de IA — ese es el compañero de esta guía, cubierto en si deberías bloquear los rastreadores de IA. Entre las dos, el hilo conductor es el mismo: tú decides, por propósito, qué le pasa al contenido del sitio que posees.

Frequently asked

¿Qué es pay-per-crawl?
Pay-per-crawl es un modelo donde se les cobra a los rastreadores de IA una tarifa por acceder a tu contenido, aplicado en tu CDN o firewall. Cloudflare lo popularizó en 2025 usando el código de estado HTTP 402, 'Pago Requerido' — un código que estuvo casi sin usar por treinta años. Cuando un rastreador de IA pide una página, o presenta el pago y obtiene el contenido, o recibe un 402 con un precio. Cloudflare, sentado frente a una gran porción de la web, actúa como cámara de compensación: identifica al bot, le factura al operador del rastreador, y le pasa las ganancias al publisher. Otros proveedores como AWS y Akamai han lanzado sus propias versiones desde entonces. Convierte el tráfico de bots de IA de un costo que absorbes en un renglón que puedes ponerle precio — si cobrar es el movimiento correcto para tu sitio, que para la mayoría de los negocios no lo es.
¿Mi negocio debería cobrarles a los rastreadores de IA por el acceso?
Para la mayoría de los negocios, no. El pay-per-crawl beneficia principalmente a publishers cuyo contenido es el producto — organizaciones de noticias, grandes sitios de referencia, bases de datos de investigación — porque sus artículos son lo que las empresas de IA quieren licenciar. Si tu sitio existe para promocionar tus servicios o vender tus productos, tu contenido no es el activo; es la vitrina. Cobrar o bloquear a los rastreadores que impulsan ChatGPT, Perplexity y las respuestas de IA de Google te cortaría de un canal de descubrimiento en el que sí quieres estar, porque ser citado ahí te manda visitantes calificados. El movimiento honesto para un negocio típico es mantenerse visible para los rastreadores de citación, decidir por separado si te opones al uso para entrenamiento, y saltarte el cobro por completo.
¿Cuál es la diferencia entre rastreadores de Search, Agent y Training?
Esta distinción de 2026 es la clave para gestionar el tráfico de IA con sensatez. Los rastreadores de Search indexan tu contenido para responder preguntas y citarte después — a estos generalmente los quieres. Los rastreadores de Agent actúan en tiempo real en nombre de una persona, como un navegador de IA completando una tarea en tu sitio. Los rastreadores de Training absorben tu contenido de forma permanente en un modelo, que es el uso al que los publishers más se oponen porque no da nada a cambio. Cloudflare ahora deja a los dueños de sitios gestionar estas tres categorías por separado, y desde septiembre de 2026 su default para sitios nuevos y gratuitos bloquea los rastreadores de Training y Agent en páginas con ads mientras permite Search. Los rastreadores multipropósito como Googlebot se juzgan por todos sus comportamientos, ganando la regla más restrictiva.
¿Qué es RSL (Really Simple Licensing)?
RSL, o Really Simple Licensing, es un estándar abierto emergente que agrega términos de licencia y precio legibles por máquina a tu sitio, en la misma familia que robots.txt y llms.txt. En vez de un permitir o bloquear general, te deja declarar los términos bajo los cuales los sistemas de IA pueden usar tu contenido, para que los rastreadores que cumplen conozcan las reglas automáticamente. Se está impulsando como estándar abierto específicamente para que ninguna empresa fije los términos de la licencia de contenido de IA. Para un publisher grande es una forma de declarar términos de licencia a escala; para un negocio típico vale más conocerlo que implementarlo hoy, ya que la decisión más importante es si quieres estar en las respuestas de IA del todo — y usualmente sí.
¿Cobrar o bloquear a los rastreadores de IA daña mi visibilidad?
Puede hacerlo, y este es el compromiso a sopesar con cuidado. Bloquear o cobrar a los rastreadores que alimentan la búsqueda de IA te quita de las respuestas de ChatGPT, Perplexity y Google, que es una forma cada vez más importante en que la gente descubre negocios. El matiz es que no todo el rastreo de IA es igual: puedes permitir a los rastreadores de Search y citación que te dan visibilidad mientras aún te opones a los de Training que absorben tu trabajo sin retorno. Bloquear todo protege tu contenido pero te vuelve invisible en el canal de descubrimiento de IA; la vía media — mantente visible a la citación, decide sobre el entrenamiento por separado — te mantiene descubrible mientras trazas una línea donde de verdad te importa.