7insider
ES
Búsqueda con IA

Qué rastreadores de IA permitir en robots.txt

Permite los rastreadores que te ponen delante de clientes y decide aparte sobre los que entrenan modelos. OAI-SearchBot te muestra en la búsqueda de ChatGPT, GPTBot solo alimenta el entrenamiento, y son dos interruptores independientes. Bloquear Google-Extended no afecta en nada a la Búsqueda de Google, y lo dice Google.

Última comprobación: 2026-08-064 min de lectura

Una puerta de latón entreabierta en una pared color marfil, luz suave

Los cuatro agentes de OpenAI y por qué importa la diferencia

OpenAI documenta cuatro identificadores distintos que hacen trabajos realmente diferentes. OAI-SearchBot se usa para mostrar webs en las funciones de búsqueda de ChatGPT, es el agente que pone tu negocio ante alguien que pregunta. GPTBot rastrea contenido que puede usarse para entrenar modelos fundacionales generativos, que es otra transacción por completo.

ChatGPT-User visita una página cuando alguien hace a ChatGPT una pregunta que lo requiere, y OpenAI señala que las reglas de robots.txt pueden no aplicarse, porque la descarga la inicia el usuario. OAI-AdsBot valida la seguridad de páginas enviadas como anuncio. Cada ajuste funciona por separado, así que puedes estar en la búsqueda y quedarte fuera del entrenamiento.

El interruptor de Google que no cuesta nada

Google-Extended es el identificador con el que los editores controlan si el contenido rastreado puede entrenar futuros modelos Gemini y sostener el grounding de aplicaciones de IA. La documentación es inusualmente clara sobre la consecuencia de bloquearlo: Google-Extended no afecta a la inclusión de un sitio en la Búsqueda de Google ni se usa como señal de posicionamiento.

Esa frase resuelve la duda que de verdad tienen los negocios. Puedes rechazar el entrenamiento de Gemini sin arriesgar tu visibilidad en la Búsqueda. Lo que renuncias es al grounding, es decir, a que Gemini responda sobre ti a partir de tus propias páginas. Para un negocio local que quiere que lo encuentren, suele ser un mal cambio.

Qué hace cada agente y qué cuesta bloquearlo
IdentificadorFunciónCoste de bloquearlo
OAI-SearchBotMostrar webs en la búsqueda de ChatGPTDesapareces de los resultados de ChatGPT
GPTBotContenido para entrenar modelosNada visible; el contenido no entra en el entrenamiento
ChatGPT-UserVisita cuando pregunta un usuariorobots.txt puede no aplicarse siquiera
Google-ExtendedEntrenamiento y grounding de GeminiNingún efecto en la Búsqueda, según el propio Google
GoogleOtherDescargas generales de investigaciónNo afecta a ningún producto concreto
Funciones y efectos proceden de la documentación de OpenAI y Google enlazada abajo. La autoridad es ese texto, no esta tabla.

Cuál de estos agentes envía visitas de verdad

La decisión se simplifica cuando sabes de dónde llega el tráfico. Medido en 101.574 webs durante dieciséis meses, ChatGPT concentró el 74,78 por ciento de las visitas de IA en 2026, Gemini el 11,56 por ciento, Perplexity el 7,23 por ciento, Copilot el 3,51 por ciento y Claude el 2,62 por ciento.

Así que la línea más valiosa de tu robots.txt es la que deja libre a OAI-SearchBot, porque tras ese agente están tres cuartas partes de las visitas. Copilot parece desdeñable con su 3,51 por ciento hasta que recuerdas que se nutre del índice de Bing, en el que se entra bastante más fácil que en el de Google. Mientras tanto, el 45 por ciento de los consumidores usó IA para encontrar un negocio local en 2026, frente al 6 por ciento de 2025, así que la porción de un pastel pequeño crece deprisa.

Un robots.txt para un negocio que quiere que lo encuentren

La posición por defecto es sencilla. Permitir todo lo que lleva a un cliente, es decir OAI-SearchBot, ChatGPT-User, PerplexityBot, Bingbot y el rastreador normal de Google. Después, una decisión propia y consciente sobre los rastreadores de entrenamiento, GPTBot y Google-Extended.

Nuestra auditoría de julio de 2026 sobre 187 hosts activos mostró que el debate queda al margen. Cero hosts bloqueaban rastreador de IA alguno, así que GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, CCBot, Google-Extended y Applebot-Extended tenían acceso libre en todas partes. El robots.txt de la red nombra hoy 10 identificadores de forma expresa, lo que es documentación y no restricción.

El fallo real más frecuente no es una directiva equivocada. En nuestra auditoría de 187 hosts activos, 25 no servían robots.txt alguno, con lo que toda pregunta sobre política de rastreo allí sobraba. Primero escribe el archivo, luego discute su contenido.

Preguntas y respuestas

¿Debo bloquear GPTBot?
Es una cuestión de criterio, no de visibilidad. Bloquearlo mantiene tu contenido fuera del entrenamiento y no te cuesta nada en la búsqueda de ChatGPT, porque de eso se encarga otro agente. Si el entrenamiento te da igual, dejarlo abierto no hace daño.
¿Bloquear Google-Extended perjudica mis posiciones?
No. Google afirma que Google-Extended no afecta a la inclusión en la Búsqueda y no se usa como señal de posicionamiento. Solo rige el entrenamiento y el grounding de Gemini.
¿Y si no tengo robots.txt?
Entonces todo está permitido por defecto, que para la mayoría de negocios locales es el resultado que querían. Aun así merece la pena escribirlo, porque es el archivo donde se anuncia el sitemap.
¿Permitir rastreadores de IA significa que me roban el contenido?
Permitir OAI-SearchBot significa que tus páginas pueden mostrarse y citarse como fuente, que es lo contrario de copiarlas en silencio. Los rastreadores de entrenamiento son la otra pregunta, y por eso son agentes separados.

Fuentes

  1. SE Ranking, AI traffic research study, 18 de junio de 2026 Cuotas por plataforma en 101.574 webs
  2. BrightLocal, Local Consumer Review Survey 2026 1.002 encuestados; la proporción que usa IA para la búsqueda local
  3. OpenAI, documentación de bots y rastreadores Los cuatro identificadores y para qué sirve cada uno
  4. Google Search Central, Google crawlers and user agents Google-Extended, GoogleOther y la declaración sobre el efecto en la Búsqueda

Seguir leyendo

Todos los artículos