Qué rastreadores de IA permitir en robots.txt
Permite los rastreadores que te ponen delante de clientes y decide aparte sobre los que entrenan modelos. OAI-SearchBot te muestra en la búsqueda de ChatGPT, GPTBot solo alimenta el entrenamiento, y son dos interruptores independientes. Bloquear Google-Extended no afecta en nada a la Búsqueda de Google, y lo dice Google.

Los cuatro agentes de OpenAI y por qué importa la diferencia
OpenAI documenta cuatro identificadores distintos que hacen trabajos realmente diferentes. OAI-SearchBot se usa para mostrar webs en las funciones de búsqueda de ChatGPT, es el agente que pone tu negocio ante alguien que pregunta. GPTBot rastrea contenido que puede usarse para entrenar modelos fundacionales generativos, que es otra transacción por completo.
ChatGPT-User visita una página cuando alguien hace a ChatGPT una pregunta que lo requiere, y OpenAI señala que las reglas de robots.txt pueden no aplicarse, porque la descarga la inicia el usuario. OAI-AdsBot valida la seguridad de páginas enviadas como anuncio. Cada ajuste funciona por separado, así que puedes estar en la búsqueda y quedarte fuera del entrenamiento.
El interruptor de Google que no cuesta nada
Google-Extended es el identificador con el que los editores controlan si el contenido rastreado puede entrenar futuros modelos Gemini y sostener el grounding de aplicaciones de IA. La documentación es inusualmente clara sobre la consecuencia de bloquearlo: Google-Extended no afecta a la inclusión de un sitio en la Búsqueda de Google ni se usa como señal de posicionamiento.
Esa frase resuelve la duda que de verdad tienen los negocios. Puedes rechazar el entrenamiento de Gemini sin arriesgar tu visibilidad en la Búsqueda. Lo que renuncias es al grounding, es decir, a que Gemini responda sobre ti a partir de tus propias páginas. Para un negocio local que quiere que lo encuentren, suele ser un mal cambio.
| Identificador | Función | Coste de bloquearlo |
|---|---|---|
| OAI-SearchBot | Mostrar webs en la búsqueda de ChatGPT | Desapareces de los resultados de ChatGPT |
| GPTBot | Contenido para entrenar modelos | Nada visible; el contenido no entra en el entrenamiento |
| ChatGPT-User | Visita cuando pregunta un usuario | robots.txt puede no aplicarse siquiera |
| Google-Extended | Entrenamiento y grounding de Gemini | Ningún efecto en la Búsqueda, según el propio Google |
| GoogleOther | Descargas generales de investigación | No afecta a ningún producto concreto |
Cuál de estos agentes envía visitas de verdad
La decisión se simplifica cuando sabes de dónde llega el tráfico. Medido en 101.574 webs durante dieciséis meses, ChatGPT concentró el 74,78 por ciento de las visitas de IA en 2026, Gemini el 11,56 por ciento, Perplexity el 7,23 por ciento, Copilot el 3,51 por ciento y Claude el 2,62 por ciento.
Así que la línea más valiosa de tu robots.txt es la que deja libre a OAI-SearchBot, porque tras ese agente están tres cuartas partes de las visitas. Copilot parece desdeñable con su 3,51 por ciento hasta que recuerdas que se nutre del índice de Bing, en el que se entra bastante más fácil que en el de Google. Mientras tanto, el 45 por ciento de los consumidores usó IA para encontrar un negocio local en 2026, frente al 6 por ciento de 2025, así que la porción de un pastel pequeño crece deprisa.
Un robots.txt para un negocio que quiere que lo encuentren
La posición por defecto es sencilla. Permitir todo lo que lleva a un cliente, es decir OAI-SearchBot, ChatGPT-User, PerplexityBot, Bingbot y el rastreador normal de Google. Después, una decisión propia y consciente sobre los rastreadores de entrenamiento, GPTBot y Google-Extended.
Nuestra auditoría de julio de 2026 sobre 187 hosts activos mostró que el debate queda al margen. Cero hosts bloqueaban rastreador de IA alguno, así que GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, CCBot, Google-Extended y Applebot-Extended tenían acceso libre en todas partes. El robots.txt de la red nombra hoy 10 identificadores de forma expresa, lo que es documentación y no restricción.
El fallo real más frecuente no es una directiva equivocada. En nuestra auditoría de 187 hosts activos, 25 no servían robots.txt alguno, con lo que toda pregunta sobre política de rastreo allí sobraba. Primero escribe el archivo, luego discute su contenido.
Preguntas y respuestas
¿Debo bloquear GPTBot?
¿Bloquear Google-Extended perjudica mis posiciones?
¿Y si no tengo robots.txt?
¿Permitir rastreadores de IA significa que me roban el contenido?
Fuentes
- SE Ranking, AI traffic research study, 18 de junio de 2026 Cuotas por plataforma en 101.574 webs
- BrightLocal, Local Consumer Review Survey 2026 1.002 encuestados; la proporción que usa IA para la búsqueda local
- OpenAI, documentación de bots y rastreadores Los cuatro identificadores y para qué sirve cada uno
- Google Search Central, Google crawlers and user agents Google-Extended, GoogleOther y la declaración sobre el efecto en la Búsqueda


