robots.txt para Agentes
Cómo robots.txt controla a los agentes de IA
robots.txt (RFC 9309) es un protocolo de cumplimiento voluntario: tú publicas reglas y los rastreadores bien gestionados deciden seguirlas. Nada en el protocolo impone nada — por eso saber qué bots de IA lo respetan importa tanto como escribir las reglas.
Cada gran proveedor de IA opera hoy varios bots con trabajos distintos, y robots.txt trata cada token User-agent como un destinatario separado: un rastreador obedece el grupo más específico que coincide con su propio token e ignora los grupos dirigidos a otros. Bloquear un bot, por tanto, no afecta a sus hermanos. Los tokens se ordenan en tres niveles:
- Rastreadores de entrenamiento (GPTBot, ClaudeBot, meta-externalagent) recopilan contenido para entrenar modelos. Bloquear uno excluye tu contenido de modelos futuros — no afecta a las respuestas en vivo ni a las citas de búsqueda.
- Rastreadores de índice de búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot) construyen los índices que citan los asistentes de IA. Permitirlos es lo que hace tus páginas recuperables y citables en las respuestas de ChatGPT, Claude y Perplexity.
- Recuperadores iniciados por usuario (ChatGPT-User, Claude-User, Perplexity-User, Google-Agent) obtienen una página en vivo porque un humano acaba de preguntar por ella. La mayoría de los proveedores declara que este nivel puede ignorar robots.txt — su razonamiento: una persona, no un rastreador, solicitó la página. (Existen excepciones documentadas — Claude-User de Anthropic y MistralAI-User de Mistral declaran que respetan robots.txt.)
La consecuencia práctica: User-agent: GPTBot + Disallow: / te excluye del entrenamiento de OpenAI pero no te elimina de la búsqueda de ChatGPT (eso es OAI-SearchBot) ni detiene las visitas en vivo de usuarios (eso es ChatGPT-User). Cada comportamiento necesita su propio grupo.
Tokens actuales de rastreadores de IA
| Token | Operador | Nivel | ¿Respeta robots.txt? |
|---|---|---|---|
| GPTBot | OpenAI | Entrenamiento | Sí |
| OAI-SearchBot | OpenAI | Índice de búsqueda | Sí — OpenAI recomienda permitirlo |
| ChatGPT-User | OpenAI | Recuperación por usuario | "Las reglas pueden no aplicarse" (texto de OpenAI) |
| ClaudeBot | Anthropic | Entrenamiento | Sí |
| Claude-SearchBot | Anthropic | Índice de búsqueda | Sí |
| Claude-User | Anthropic | Recuperación por usuario | Sí — una excepción documentada |
| PerplexityBot | Perplexity | Índice de búsqueda | Sí |
| Perplexity-User | Perplexity | Recuperación por usuario | "Generalmente lo ignora" (texto de Perplexity) |
| Google-Extended | Token de política de entrenamiento | Solo token — lo lee Googlebot, no tiene rastreador propio | |
| Google-Agent | Recuperación por usuario | Generalmente lo ignora | |
| meta-externalagent | Meta | Entrenamiento | Sí |
Listas antiguas aún circulan anthropic-ai y claude-web — Anthropic ya no rastrea bajo esos tokens; sus rastreadores actuales son los tres de arriba. Cada token de la tabla tiene una página completa — cadena UA exacta, fragmentos de robots.txt, verificación por rangos IP — en la referencia de user-agents de agentes de IA.
Da la bienvenida a los agentes explícitamente
Un grupo Allow explícito es una señal, no una redundancia: el valor por defecto ya es "permitido", pero nombrar el token de un agente indica a los operadores de rastreo (y a escáneres como AgentGrade) que el acceso es una decisión, no un descuido.
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Sitemap: https://example.com/sitemap.xml
La directiva Sitemap: también importa para los agentes — es cómo un rastreador encuentra tu lista canónica de páginas sin recorrer cada enlace.
Excluirse del entrenamiento y seguir siendo citable
La posición intermedia más común: mantener tus páginas citables en la búsqueda de IA mientras te excluyes del entrenamiento de modelos.
# Bloquear rastreadores de entrenamiento
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: meta-externalagent
Disallow: /
User-agent: Google-Extended
Disallow: /
# Todo lo demás (indexadores de búsqueda, recuperadores de usuario) sigue permitido por defecto
Bloquearlo todo — y lo que cuesta
Prohibir todos los tokens de IA hace tu sitio invisible para los índices de búsqueda de IA, de modo que los asistentes no pueden citarte. Y aun así no detiene firmemente a los recuperadores iniciados por usuario — la mayoría de ese nivel ignora robots.txt por diseño. Un bloqueo firme requiere controles del lado del servidor: filtrar por los rangos IP publicados por los proveedores o una regla WAF. Los endpoints de verificación de cada bot están listados en las páginas /agents.
Preguntas frecuentes
¿Bloquear GPTBot elimina mi sitio de ChatGPT?
No. GPTBot solo recopila datos de entrenamiento. Las citas de búsqueda de ChatGPT provienen del índice de OAI-SearchBot, y las visitas en vivo provienen de ChatGPT-User — ambos siguen funcionando salvo que bloquees también sus tokens (y ChatGPT-User puede ignorar el bloqueo).
¿Los agentes de IA realmente respetan robots.txt?
Por nivel: los rastreadores de entrenamiento y de búsqueda de OpenAI, Anthropic, Perplexity, Google y Meta documentan que sí. Los recuperadores iniciados por usuario mayormente documentan que no (Claude-User y MistralAI-User son las excepciones declaradas). robots.txt es una preferencia publicada, no un control de acceso.
¿Google-Extended es un rastreador que veré en mis logs?
No. Google-Extended es un token de política de robots.txt que lee el Googlebot normal. Prohibirlo excluye tu contenido del entrenamiento y grounding de Gemini sin afectar a Google Search. Ninguna solicitud lleva jamás un user-agent Google-Extended.
¿Mi sitio debería permitir o bloquear los rastreadores de IA?
Es una decisión de negocio sobre dos cosas separadas: el entrenamiento (tu contenido mejorando modelos futuros) y la visibilidad (asistentes citándote y recomendándote). Muchos sitios hoy bloquean los tokens de entrenamiento y permiten los de búsqueda — el patrón "excluirse del entrenamiento, seguir citable" de arriba.
Madurez de la especificación
Estándar establecido. robots.txt está especificado en RFC 9309. Los tokens específicos de IA los define y documenta cada proveedor, y cambian con la suficiente frecuencia como para que la referencia de user-agents se mantenga actualizada por bot.
Más información
- RFC 9309 — la especificación de robots.txt
- User-agents de agentes de IA: la lista de referencia — cadenas UA, comportamiento con robots.txt y verificación IP por bot
Relacionado
- llms.txt — la contraparte aditiva: robots.txt dice qué pueden obtener los agentes; llms.txt les dice por dónde empezar
- Cómo navegan realmente la web los agentes de IA