Cómo navegan realmente la web los agentes de IA
El problema con las suposiciones
La mayoría de la optimización de sitios web asume que un visitante obtiene tu página vía HTTP, ve los encabezados, sigue las redirecciones y renderiza HTML. Los agentes de IA rompen cada una de estas suposiciones.
ChatGPT
La herramienta de navegación de ChatGPT obtiene páginas en vivo vía HTTP, pero el modelo nunca ve la respuesta cruda:
- Solo extracción de texto — el HTML se reduce a un extracto de texto plano acotado antes de que el modelo lo vea (el presupuesto exacto no está documentado; pruebas comunitarias han medido unos pocos miles de tokens)
- Sin encabezados — el modelo nunca conoce el Content-Type, los códigos de estado ni las redirecciones
- SearchGPT intermedio — un modelo secundario verifica si hay inyección de prompts antes de que el contenido llegue al modelo principal
- Agent Mode usa un UA falso de Chrome (
Chrome/138.0.0.0) y se identifica mediante firmas criptográficas RFC 9421, no mediante User-Agent
Qué significa esto: la negociación de contenido funciona en silencio (la capa de la herramienta la maneja), pero el modelo solo ve el texto extraído. Sirve texto limpio y estructurado y tu contenido será más útil para ChatGPT.
Perplexity
Perplexity usa una pipeline de recuperación en múltiples etapas:
- Rastreadores sigilosos — 3-6 millones de solicitudes/día con UAs genéricos de Chrome e IPs rotativas, no
PerplexityBot - Ranking híbrido — coincidencia de palabras clave BM25 + similitud vectorial para encontrar pasajes relevantes
- Recuperación de spans atómicos — extrae fragmentos de texto específicos en lugar de páginas completas
- Índice separado — mantiene su propio índice rastreado junto a los resultados de búsqueda web
Qué significa esto: tus reglas de robots.txt para PerplexityBot pueden no detener a sus rastreadores sigilosos. Contenido estructurado con encabezados claros ayuda a que su extracción de spans encuentre los pasajes correctos.
Gemini
El modo de navegación más común de Gemini nunca llega a tu servidor:
- Basado en índice —
url_contextlee del índice interno de Google, no de HTTP en vivo. En las pruebas, no apareció ninguna solicitud en los logs del servidor - Basado en capturas de pantalla — los modos de navegación agéntica de Gemini renderizan la página visualmente para tareas que lo requieren (según la prensa, el prototipo Project Mariner se integró en las funciones de agente de Gemini en 2026)
- Markdown rechazado — Gemini CLI rechazó respuestas con
Accept: text/markdownen pruebas tempranas
Qué significa esto: tu sitio necesita estar indexado por Googlebot para que Gemini lo vea. Agregar <link rel="alternate" href="/llms.txt"> en tu HTML asegura que Google indexe la relación con llms.txt. Los datos estructurados JSON-LD también sobreviven al pipeline de indexación.
Qué hacer al respecto
| Acción | Ayuda con |
|---|---|
Servir llms.txt con markdown limpio | ChatGPT, Perplexity |
Agregar <link rel="alternate" href="/llms.txt"> | Gemini (vía índice de Google) |
| Agregar datos estructurados JSON-LD | Gemini (vía índice de Google) |
No bloquear Google-Extended en robots.txt | Gemini |
| Usar firmas RFC 9421 para autenticación de bots | Verificación del Agent Mode de ChatGPT |
| Servir contenido estructurado con encabezados claros | Extracción de spans de Perplexity |
Más información
- Dejan.ai: La herramienta URL Context de Google
- Dejan.ai: AI Mode no es web en vivo
- Cloudflare: Los rastreadores sigilosos de Perplexity
- SeatGeek: Persiguiendo la firma
Relacionado
Los niveles de rastreadores detrás de los asistentes
Cada asistente de arriba se alimenta de varios bots distintos con tokens de robots.txt separados: rastreadores de entrenamiento (GPTBot, ClaudeBot), rastreadores de índice de búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot) y recuperadores iniciados por usuario (ChatGPT-User, Claude-User, Perplexity-User) — y bloquear un nivel no afecta a los demás. La referencia de user-agents de agentes de IA documenta la cadena UA exacta, el comportamiento con robots.txt y la verificación IP de cada bot; la guía de robots.txt explica el modelo de niveles con patrones de permitir/bloquear listos para copiar.