Robots et IA
Moteurs de recherche, robots d’IA, outils SEO, aperçus de liens : voyez qui lit votre site, quelles pages, avec quelles réponses, puis décidez qui autoriser.
Sur cette page
Rendre les robots visibles#
La plupart des robots ne chargent pas le JavaScript : le traceur ne les voit pas. Pour les compter, votre serveur doit signaler leurs passages :
- WordPress : le plugin le fait déjà.
- Next.js, Node, PHP ou autre : une clé d’API et un court extrait (Collecte côté serveur).
Les robots qui exécutent le JavaScript (navigateurs sans interface, certains outils) sont reconnus à la collecte grâce à leur User-Agent et rangés avec les autres. Dans tous les cas, ils sont comptés à part et n’entrent jamais dans l’audience.
Catégories#
Chaque passage est identifié par son User-Agent et rangé dans une catégorie :
| Catégorie | Exemples |
|---|---|
| Moteurs de recherche | Googlebot (et ses variantes Image, Video, News), Bingbot, Applebot, DuckDuckBot, Qwantbot, YandexBot, Baiduspider, KreomnisBot… |
| Robots d’IA | GPTBot, ChatGPT-User, OAI-SearchBot, ClaudeBot, Claude-User, PerplexityBot, Google-Extended, Applebot-Extended, CCBot, Bytespider, Meta-ExternalAgent, Amazonbot… |
| Outils SEO | AhrefsBot, SemrushBot, Majestic, Moz, Screaming Frog, Lighthouse, PageSpeed Insights… |
| Réseaux sociaux et messageries | Aperçus de liens de Facebook, X, LinkedIn, Slack, Discord, WhatsApp, Telegram, Bluesky… |
| Surveillance | UptimeRobot, Pingdom, StatusCake, Better Stack, Datadog, Checkly… |
| Scripts et autres | Navigateurs sans interface (headless), curl, Python, Node.js, lecteurs RSS, User-Agent vide ou inconnu… |
Un User-Agent qui ressemble à un robot sans être connu apparaît sous son propre nom, ou comme « Robot inconnu ».
Le rapport Robots#
Sur 7, 28 ou 90 jours, la page Robots montre :
- le nombre de passages, de robots différents et de pages lues, et la part des robots dans l’ensemble des pages servies (robots et humains) ;
- les passages par jour, séparés entre moteurs, IA et autres ;
- chaque robot : passages, pages distinctes, dernier passage et réponses en erreur (codes 400 et plus) ;
- les pages les plus lues, avec la part des moteurs et des IA ;
- la répartition des codes HTTP renvoyés aux robots.
N’importe quel programme peut se présenter comme Googlebot. Le rapport montre ce que les robots déclarent ; il ne vérifie pas leur adresse d’origine.
Robots d’IA : entraînement ou réponse#
Les robots d’IA n’ont pas tous le même rôle, ce qui guide la décision de les autoriser :
- Collecte pour l’entraînement : GPTBot, ClaudeBot, CCBot, Google-Extended, Applebot-Extended, Bytespider…
- Lecture à la demande d’un utilisateur ou pour une recherche : ChatGPT-User, OAI-SearchBot, Claude-User, Claude-SearchBot, Perplexity-User…
Le fichier /llms.txt présente votre site aux modèles de langage (proposition llmstxt.org) : KreomnisBot le lit à chaque exploration et en affiche l’état (voir Indexation et couverture).
Bloquer les seconds peut vous priver de citations et de visites venues des assistants, visibles dans le canal Assistants IA de vos statistiques.
Autoriser ou bloquer#
Les consignes se donnent dans le fichier robots.txt à la racine de votre site. Par exemple, pour refuser l’entraînement des IA tout en restant lisible par les moteurs et les assistants :
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: CCBot Disallow: / User-agent: Google-Extended Disallow: /
Pour bloquer une partie du site à un robot précis :
User-agent: AhrefsBot Disallow: /recherche/
Les robots sérieux respectent robots.txt, mais rien ne les y oblige techniquement. Le rapportRobots vous permet de vérifier, après quelques jours, qu’un robot bloqué ne lit plus les pages concernées.
Une question sans réponse ici ? Consultez les questions fréquentes.