Un site sur trois bloque sans le savoir les robots qui alimentent ChatGPT et Perplexity. Cet outil lit votre robots.txt, vos meta robots et vos en-têtes, puis montre exactement lesquels des 15 crawlers IA voient vos pages.
Page d'accueil ou page profonde — l'outil évalue le chemin exact que vous donnez, car les règles robots varient selon le chemin.
Règles robots.txt pour 15 crawlers IA, balises meta robots, en-têtes X-Robots-Tag, présence du llms.txt et déclaration de sitemap — tout le contrôle en une passe.
Un tableau autorisé/bloqué par robot, avec la règle robots.txt exacte responsable, pour réparer l'accès en quelques minutes.
GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended, Bytespider, CCBot et d'autres — tous les robots qui comptent pour la visibilité IA.
Les presets CDN et les vieux modèles de robots.txt bloquent l'IA en silence. Si vous vous demandez « ChatGPT peut-il lire mon site ? », voici la réponse.
robots.txt n'est que la première couche. Nous testons aussi au niveau de la page : meta robots et directives noindex en X-Robots-Tag.
Chaque verdict cite la ligne Allow/Disallow exacte qui l'a causé — plus besoin de deviner laquelle de vos 40 règles s'est déclenchée.
La même passe confirme que votre llms.txt répond et que votre sitemap est déclaré — les deux fichiers que l'IA utilise pour vous parcourir.
Être lisible est l'étape un ; être recommandé est l'objectif. Complétez cet audit de crawl IA par un scan de marque Kairosy gratuit.
Un crawler IA est le robot qu'une entreprise d'IA envoie lire le web public : GPTBot d'OpenAI collecte des données d'entraînement, OAI-SearchBot alimente la recherche ChatGPT, ClaudeBot nourrit les modèles d'Anthropic et PerplexityBot construit l'index de Perplexity. Quand des acheteurs demandent des recommandations à ces assistants, ceux-ci ne peuvent parler que des sites que leurs robots ont pu lire. Les bloquer, c'est de l'invisibilité par configuration — vérifiez donc l'accès avant de vous soucier du contenu.
Pour contrôler vous-même l'accès d'un crawler IA, lisez le groupe User-agent de chaque robot dans robots.txt, puis vérifiez les meta robots et les en-têtes X-Robots-Tag de la page — ou lancez ce test et obtenez tout en cinq secondes. Une vérification unique ne suffit pas : thèmes, plugins et règles CDN modifient les fichiers robots en silence. Un audit de crawl IA mensuel, plus un re-test après chaque migration, est l'habitude qui vous garde visible.
“Notre modèle de WAF bloquait GPTBot depuis un an. Trouvé à la première exécution, corrigé le jour même.”
“Je teste chaque nouveau client avec ce vérificateur de crawler IA. La moitié bloque au moins un robot IA sans le savoir.”
“Les explications règle par règle valent de l'or — l'outil m'a dit exactement quelle ligne Disallow touchait Bytespider et pas les autres.”
“Simple, honnête et rapide. Le contrôle en trois couches (robots, meta, en-têtes) a repéré un en-tête noindex injecté par notre CDN.”
Un robot que les entreprises d'IA utilisent pour lire les pages web publiques, afin que leurs assistants puissent connaître — et recommander — ce qui s'y trouve.
En général oui : pas de robots.txt signifie pas de restriction, tout ce qui est public est accessible. Vous pouvez rester bloqué par des meta robots, des en-têtes X-Robots-Tag ou votre pare-feu — exactement ce que cet outil inspecte.
Lancez l'outil sur l'URL de la page et cherchez le robot dans le tableau de résultats. Le verdict cite la règle robots.txt appliquée : vous voyez ainsi si GPTBot passe pendant que, disons, Bytespider reste bloqué.
Certains éditeurs bloquent les robots d'entraînement (GPTBot, CCBot) mais autorisent les robots de recherche (OAI-SearchBot, PerplexityBot) pour rester citables. Stratégie valable — l'essentiel est de la choisir délibérément, pas d'en hériter d'un template.
Crawlable veut dire lisible, pas recommandé. Lancez un scan Kairosy gratuit pour voir ce que ChatGPT, Gemini, Claude et Perplexity disent réellement de vous aux acheteurs — et quoi corriger si la réponse pique.
Crawlez n'importe quel site et générez un fichier llms.txt prêt à publier en quelques secondes.
Vérifiez si le fichier llms.txt d'un site existe, respecte la spec et n'a pas de liens morts.
Vérifiez en masse si vos pages sont indexées sur Google, Bing, Yahoo, Yandex et DuckDuckGo.
Kairosy pose à ChatGPT, Gemini, Claude et Perplexity les questions de vos acheteurs — et montre s’ils vous recommandent, vous ignorent ou orientent vers un concurrent.
Lancer un scan IA gratuit