Una de cada tres webs bloquea sin querer los rastreadores que alimentan ChatGPT y Perplexity. Esta herramienta lee tu robots.txt, las meta robots y las cabeceras, y muestra exactamente cuáles de los 15 bots de IA pueden ver tus páginas.
La portada o una página interna — el comprobador evalúa la ruta exacta que le des, porque las reglas de robots cambian según la ruta.
Reglas de robots.txt para 15 rastreadores de IA, meta robots, cabeceras X-Robots-Tag, presencia de llms.txt y declaración del sitemap — el test de rastreabilidad completo en una pasada.
Una tabla por bot con permitido/bloqueado y la regla exacta de robots.txt responsable, para que puedas comprobar la rastreabilidad de tu web y repararla en minutos.
GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended, Bytespider, CCBot y más — todos los bots que importan para tu visibilidad en IA.
Los presets de CDN y las plantillas viejas de robots.txt bloquean la IA en silencio. Si te has preguntado “¿puede ChatGPT rastrear mi web?”, aquí tienes la respuesta.
robots.txt es solo la primera capa. También comprobamos a nivel de página: meta robots y directivas noindex en X-Robots-Tag.
Cada veredicto cita la línea Allow/Disallow exacta que lo causó — nada de adivinar cuál de tus 40 reglas de robots se aplicó, incluido el clásico User-agent: GPTBot con Disallow.
La misma pasada confirma que tu llms.txt resuelve y que el sitemap está declarado — los dos archivos que un rastreador IA usa para orientarse.
Que te puedan leer es el paso uno; que te recomienden es la meta. Combina esta auditoría con un escaneo de marca gratuito de Kairosy.
¿Qué es un AI crawler? Es el bot que una empresa de IA envía a leer la web pública: GPTBot de OpenAI recopila datos de entrenamiento, OAI-SearchBot alimenta la búsqueda de ChatGPT, ClaudeBot nutre los modelos de Anthropic y PerplexityBot construye el índice de Perplexity. Cuando los compradores piden recomendaciones a esos asistentes, estos solo pueden hablar de los sitios que sus rastreadores pudieron leer. Bloquearlos es invisibilidad por configuración — por eso conviene comprobar si una página es rastreable antes de preocuparse por el contenido.
Para comprobar la rastreabilidad de tu web a mano, lee en robots.txt el grupo User-agent de cada bot (por ejemplo, un “User-agent: GPTBot / Disallow: /” lo bloquea todo), y revisa después las meta robots y las cabeceras X-Robots-Tag de la página — o ejecuta este test de rastreo y tenlo todo en cinco segundos. Preguntarse “¿es rastreable mi web?” una sola vez tampoco basta: los temas, plugins y reglas de CDN cambian los robots.txt sin avisar, así que una auditoría mensual de rastreo IA (y un retest tras cada migración) es el hábito que te mantiene visible.
“La plantilla de nuestro WAF llevaba un año bloqueando a GPTBot. Lo encontramos en la primera ejecución y lo arreglamos el mismo día.”
“Pruebo la rastreabilidad de cada cliente nuevo con esta herramienta. La mitad está bloqueando al menos un bot de IA sin saberlo.”
“Las explicaciones a nivel de regla valen oro — me dijo exactamente qué línea Disallow afectaba a Bytespider y cuál al resto.”
“Simple, honesto y rápido. La comprobación en tres capas (robots, meta, cabeceras) cazó una cabecera noindex que inyectaba nuestro CDN.”
Un bot que las empresas de IA usan para leer páginas web públicas, de modo que sus asistentes puedan conocer — y recomendar — lo que hay en ellas.
Normalmente sí: sin robots.txt no hay restricciones, así que los rastreadores asumen que todo lo público está disponible. Aun así puedes estar bloqueado por meta robots, cabeceras X-Robots-Tag o tu firewall — que es exactamente lo que inspecciona esta herramienta.
Ejecuta la herramienta sobre esa URL y busca el bot en la tabla de resultados. El veredicto cita la regla de robots.txt aplicada, así que puedes ver si la página es rastreable para GPTBot mientras, por ejemplo, Bytespider sigue bloqueado.
Algunos editores bloquean los bots de entrenamiento (GPTBot con Disallow, CCBot) pero permiten los de búsqueda (OAI-SearchBot, PerplexityBot) para seguir siendo citables. Es una estrategia válida — la clave es elegirla a conciencia, no heredarla de una plantilla.
Rastreable significa legible, no recomendado. Lanza un escaneo gratuito de Kairosy para ver qué cuentan realmente ChatGPT, Gemini, Claude y Perplexity a tus compradores, y qué arreglar si la respuesta duele.
Rastrea cualquier web y genera un archivo llms.txt listo para publicar en segundos.
Comprueba si el llms.txt de una web existe, cumple la especificación y no tiene enlaces rotos.
Comprueba en bloque si tus páginas están indexadas en Google, Bing, Yahoo, Yandex y DuckDuckGo.
Kairosy pregunta a ChatGPT, Gemini, Claude y Perplexity lo que preguntan tus compradores — y muestra si te recomiendan, te ignoran o envían a un rival.
Ejecutar escaneo IA gratis