Índice
ChatGPT: fuentes reconocibles y respuestas que se puedan extraer en una frase
ChatGPT combina tres rastreadores con funciones distintas: GPTBot recopila contenido para entrenar los modelos de OpenAI, ChatGPT-User se activa cuando una acción del usuario dentro de un chat requiere visitar una página concreta, y OAI-SearchBot es el que determina si tu contenido puede aparecer citado en una respuesta de búsqueda. Este último matiz importa: permitir solo GPTBot no garantiza que aparezcas en respuestas de ChatGPT, hace falta dar acceso explícito también a OAI-SearchBot.Ninguno de los tres ejecuta JavaScript. GPTBot llega a descargar el JS en aproximadamente un 11,5% de sus peticiones, pero nunca lo ejecuta: se queda con el HTML estático. En cuanto a qué prioriza, ChatGPT muestra una inclinación clara hacia fuentes reconocibles y de consenso —Wikipedia aparece con muchísima frecuencia entre sus citas—, y tiene más dificultad para extraer una respuesta cuando esta está enterrada en párrafos largos y genéricos en lugar de presentarse de forma directa tras un encabezado.Qué puedes hacer: permite explícitamente GPTBot, OAI-SearchBot y ChatGPT-User en tu robots.txt; asegúrate de que tu contenido principal se renderiza en servidor (o es estático) para que aparezca en el HTML inicial; revisa que tu CDN o WAF no les esté devolviendo errores 403 o 429; y estructura tus respuestas clave en 40-60 palabras justo después de un H2 formulado como pregunta.Claude: usa Brave Search y penaliza las páginas de «no me han actualizado desde 2019»
Anthropic separa sus rastreadores en tres, siguiendo el mismo patrón de tres niveles que ya vimos en OpenAI: ClaudeBot recopila contenido para entrenar el modelo (y es el único de los tres que puedes bloquear sin perder visibilidad en ningún otro sitio), Claude-SearchBot indexa contenido específicamente para las respuestas de búsqueda, y Claude-User entra en acción cuando un usuario le hace una pregunta concreta a Claude que requiere visitar tu página en ese momento. Bloquear los dos últimos sí reduce tu visibilidad en las respuestas de Claude.Como los demás, ClaudeBot no ejecuta JavaScript — de hecho descarga el archivo JS en un 23,84% de sus peticiones (más que GPTBot, que lo hace en un 11,5%), pero lo ignora igual de completo a la hora de leer el contenido. La diferencia más importante de Claude frente a los otros tres motores es de dónde saca la información en vivo: no usa el índice de Google ni el de Bing, sino Brave Search. Esto significa que si tu web no aparece bien posicionada en Brave para una consulta relacionada, es mucho más difícil que Claude te cite, por muy bien que rankees en Google.En cuanto a qué prioriza: valora mucho la estructura extraíble (encabezados H2/H3 claros, tablas), la actualidad —el contenido de los últimos 12 meses recibe hasta 2-3 veces más citas, y añadir el año en la URL o un «última actualización» visible ayuda— y tiene predilección por formatos de comparativa y listado (casi la mitad de las URLs citadas en un análisis reciente eran del tipo «mejores…», «top 10…» o «X vs Y»). Un dato curioso: apenas cita homepages (solo un 3%), la mayoría de sus citas vienen de páginas de blog específicas, y sorprendentemente no citó ni una vez a medios como Forbes o TechCrunch en ese mismo estudio — prioriza blogs especializados del sector sobre medios generalistas.Qué puedes hacer: permite explícitamente ClaudeBot, Claude-SearchBot y Claude-User en tu robots.txt (decidiendo tú si quieres o no que se entrene con tu contenido, pero sin tocar los otros dos); estructura tus respuestas clave en 40-60 palabras al principio de cada sección; añade fechas de actualización visibles; publica páginas específicas y profundas en vez de depender de páginas de navegación general; y —esto es particular de Claude— revisa cómo posicionas en Brave Search, no solo en Google.Google AI Overviews: la única que sí renderiza JavaScript
Aquí está la excepción de los cuatro. Google AI Overviews no tiene un rastreador propio y separado: se nutre directamente del índice normal de búsqueda de Googlebot, que sí ejecuta JavaScript (aunque de forma más lenta, en una cola de renderizado posterior a la primera lectura). Si tu web ya está indexada en Google, ya eres candidata a aparecer citada.Aquí conviene aclarar una confusión muy habitual: Google-Extended no es un rastreador aparte, sino un token de control introducido en 2023 que solo decide si tu contenido se usa para entrenar los modelos Gemini. Bloquearlo no tiene ningún efecto sobre tu posición en la búsqueda ni sobre si apareces en AI Overviews — eso depende exclusivamente de que Googlebot pueda rastrear e indexar tu web con normalidad.Lo que sí es distinto respecto al SEO clásico es el nivel de extracción: AI Overviews no cita páginas enteras, cita pasajes. Un párrafo tuyo en la posición 15 puede aparecer citado si responde mejor la pregunta que el contenido de la página en el puesto 1. Qué puedes hacer: nunca bloquees Googlebot (parece obvio, pero revisa tu WAF trimestralmente por bloqueos silenciosos con códigos 403/429 a IPs verificadas de Google); si quieres ocultar una sección concreta sin perder la indexación completa, usa el atributo data-nosnippet en lugar de bloquear la página entera.Perplexity: el motor que más premia lo recién publicado
PerplexityBot solo lee HTML estático, sin ejecutar JavaScript en ningún caso. Pero su diferencia de fondo con los demás está en cómo funciona: en vez de depender tanto de un índice propio acumulado con el tiempo, Perplexity lanza búsquedas en tiempo real en el momento en que alguien hace una pregunta, e incorpora activamente comunidades y foros de discusión (al estilo Reddit) como señal de credibilidad.Esto lo convierte, de los cuatro motores, en el más permeable a contenido reciente: si acabas de publicar o actualizar un artículo, tienes más opciones de aparecer citada aquí que en ChatGPT, que depende más de su base de entrenamiento y de fuentes ya consolidadas. Qué puedes hacer: aplica la misma base técnica (HTML legible sin depender de JS, robots.txt abierto al user-agent de Perplexity), pero además prioriza mantener actualizado el contenido con más frecuencia que en cualquier otro canal — aquí la actualidad pesa más que en ningún otro motor de los cuatro.Copilot: el que más depende de que hagas los deberes con el schema
Copilot funciona sobre un sistema de recuperación aumentada (RAG) montado encima del índice tradicional de Bing: cuando alguien pregunta algo, Copilot genera consultas internas que buscan primero en ese índice. La consecuencia es tajante: si tu URL no está indexada y posicionada en la búsqueda normal de Bing, es literalmente imposible que Copilot te cite, por muy bien que te vaya en Google.Bingbot lucha especialmente con contenido cargado mediante JavaScript del lado del cliente, así que el renderizado en servidor es prácticamente obligatorio aquí. Lo que más distingue a Copilot de los otros tres es el peso que da al schema markup en formato JSON-LD — lo describen como su «arma secreta», porque sus modelos extraen de ahí relaciones de datos muy concretas (sujeto-predicado-objeto) que les cuesta mucho más inferir de texto libre. También valora las menciones de marca sin enlace en webs de terceros, lo que se conoce como «ghost equity».Qué puedes hacer: date de alta y verifica tu dominio en Bing Webmaster Tools; activa el protocolo IndexNow, que notifica cambios de contenido casi al instante (hay quien reporta citas en menos de dos horas tras publicar); y refuerza tu schema con FAQPage, HowTo y Organization, además de tablas y listas que faciliten la extracción automática.¿Cómo eligen las IA sus fuentes? Tabla comparativa, qué hacer en cada motor
| Motor / crawler | ¿Renderiza JavaScript? | En qué se fija | Acción SEO clave |
|---|---|---|---|
| ChatGPT(GPTBot / OAI-SearchBot / ChatGPT-User) | No — solo HTML estático | Fuentes reconocibles/consenso, respuestas cortas (40-60 palabras) tras H2 en forma de pregunta | Permitir explícitamente GPTBot, OAI-SearchBot y ChatGPT-User en robots.txt; contenido renderizado en servidor |
| Google AI Overviews(Googlebot) | Sí — única excepción entre los 5 | Completitud semántica y extracción a nivel de párrafo, no de página entera | No confundir con Google-Extended (solo entrenamiento); auditar el WAF por bloqueos silenciosos |
| Perplexity(PerplexityBot) | No — solo HTML estático | Contenido muy reciente y discusiones/comunidades como señal de credibilidad | Actualizar contenido con frecuencia; es el más permeable a lo nuevo |
| Copilot(Bingbot) | Parcial — no fiable a escala | JSON-LD schema markup y menciones de marca sin enlace («ghost equity») | Verificar en Bing Webmaster Tools y activar IndexNow para notificar cambios al instante |
| Claude(ClaudeBot / Claude-SearchBot / Claude-User) | No — descarga JS (23,84%) pero no lo ejecuta | Estructura extraíble, actualidad (año/fecha visible), formatos de comparativa y listado; usa Brave Search, no Google | Permitir Claude-SearchBot y Claude-User por separado del de entrenamiento; revisar tu posición en Brave Search |
Checklist técnica: qué puedes revisar hoy mismo, sin esperar al rediseño
- Haz «ver código fuente» de tus páginas clave: si el contenido principal no aparece ahí (solo tras ejecutar JavaScript), la mayoría de IA no lo está viendo.
- Revisa tu robots.txt y da acceso explícito a GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot y Bingbot.
- Prioriza renderizado en servidor (SSR) o generación estática frente a contenido que depende de JavaScript del cliente.
- Implementa un mínimo viable de schema: Organization, Article, FAQPage — es la señal que más pesa para Copilot y ayuda al resto.
- Da de alta tu dominio en Bing Webmaster Tools y activa IndexNow si te interesa aparecer en Copilot.
- Revisa periódicamente los logs de tu servidor por si tu WAF o CDN está devolviendo 403/429 a estos rastreadores sin que lo sepas.
Entonces, ¿necesitas una estrategia por cada IA o una que valga para todas?
Las cuatro comparten una base que no es negociable: HTML legible sin depender de JavaScript, autoridad de marca consistente y contenido bien estructurado. A partir de ahí, cada motor pesa las cosas de forma distinta — la frecuencia de publicación importa más para Perplexity, el schema pesa más para Copilot, la completitud semántica a nivel de párrafo es la clave en AI Overviews, y la claridad y brevedad de la respuesta es lo que más ayuda en ChatGPT.La buena noticia es que no hace falta construir cuatro estrategias distintas desde cero: construyes bien la base técnica una vez, y luego ajustas matices concretos según en qué motor te interese más aparecer, según de dónde venga tu público objetivo.¿Sabes si tu web es legible para estas cuatro IA a la vez?
Todo esto se puede diagnosticar con bastante precisión: comprobar qué ven realmente GPTBot, PerplexityBot, Googlebot y Bingbot de tu web, si tu robots.txt les está cerrando la puerta sin que lo sepas, y si tu schema está completo o a medias. Es exactamente el tipo de auditoría de visibilidad en IA que hago con mis clientes — no son suposiciones, son datos concretos de qué está viendo cada motor ahora mismo. Si quieres saber dónde estás parada tú, hablamos.Preguntas que nos hacemos sobre cómo eligen las IA sus fuentes:
¿Por qué ChatGPT no cita mi web aunque esté bien posicionada en Google?
Porque posicionar bien en Google no es suficiente: ChatGPT usa sus propios rastreadores (GPTBot, OAI-SearchBot), que no ejecutan JavaScript y priorizan fuentes reconocibles y de consenso. Si tu contenido depende de JS para mostrarse o no está estructurado en respuestas fácilmente extraíbles, ChatGPT no lo está viendo igual que Google.
¿Qué es GPTBot y cómo lo permito en mi robots.txt?
GPTBot es el rastreador de OpenAI que recopila contenido público para entrenar sus modelos. Para permitirlo, añade en tu robots.txt «User-agent: GPTBot» seguido de «Allow: /». Si además quieres aparecer en respuestas de búsqueda de ChatGPT, haz lo mismo con OAI-SearchBot y ChatGPT-User.
¿Perplexity indexa mi web igual que Google?
No. Perplexity no mantiene un índice acumulado tan extenso como el de Google; en el momento en que alguien pregunta algo, lanza búsquedas en tiempo real. Su rastreador, PerplexityBot, solo lee HTML estático y no ejecuta JavaScript en ningún caso.
¿Sirve de algo bloquear Google-Extended si quiero salir en AI Overviews?
No cambia nada respecto a AI Overviews. Google-Extended es un token que solo controla si tu contenido se usa para entrenar los modelos Gemini. Lo que determina si apareces citada en AI Overviews es que Googlebot pueda rastrear e indexar tu web con normalidad, que es un control totalmente distinto.
¿Por qué mi web con mucho JavaScript no aparece citada en ninguna IA?
Porque aproximadamente el 69% de los rastreadores de IA no ejecutan JavaScript: solo leen el HTML que llega en la primera respuesta del servidor. Si tu contenido se inyecta después mediante scripts, es invisible para ellos aunque Google sí lo acabe viendo tras renderizarlo en su propia cola.
¿Qué es el schema markup y por qué importa tanto para Copilot?
Es código estructurado, normalmente en formato JSON-LD, que describe tu contenido de forma inequívoca para las máquinas. Copilot lo usa especialmente para extraer relaciones de datos concretas, así que sin schema pierde información que sí podría estar citando de tu web.
¿Cuánto tarda en notarse un cambio SEO en las respuestas de las IA?
Depende mucho del motor. Copilot puede reflejar cambios en cuestión de horas si usas el protocolo IndexNow, mientras que ChatGPT y Perplexity dependen de cuándo vuelvan a rastrear tu web, lo que puede tardar desde días hasta varias semanas
¿Necesito una estrategia de SEO distinta para cada IA o vale una sola?
Hay una base común a las cuatro (HTML legible sin depender de JavaScript, autoridad de marca, contenido bien estructurado), pero cada motor pesa cosas distintas: la frecuencia de publicación importa más para Perplexity, el schema para Copilot, la completitud semántica para AI Overviews y la claridad de la respuesta para ChatGPT.
¿Qué es IndexNow y tengo que activarlo si no uso Bing?
IndexNow es un protocolo que notifica a los buscadores compatibles (entre ellos Bing y, por tanto, Copilot) en cuanto publicas o actualizas contenido. Si te interesa aparecer en Copilot conviene activarlo; para Google no tiene ningún efecto porque no lo utiliza.
¿Cómo sé si GPTBot o PerplexityBot están rastreando mi web?
Revisando los logs de tu servidor y filtrando por esos user-agents: deberías ver peticiones con código 200, no 403 ni 429. Si no aparecen en absoluto, comprueba que tu robots.txt y tu WAF o CDN no los estén bloqueando sin que lo sepas.





