Robot d’exploration
KreomnisBot
Le robot qui alimente l’index Kreomnis et la console Kreomnis Indexation : ce qu’il lit, et comment le piloter depuis votre site.
KreomnisBot/1.0 (+indexation; respecte robots.txt)Seulement les sites prouvés
KreomnisBot n’explore que les sites dont le propriétaire a prouvé la propriété sur Kreomnis Indexation, et les sites attestés sur KreomnisNet.
Respecte vos consignes
robots.txt(groupeKreomnisBot, sinon*), balisesnoindex/nofollow, en-têteX-Robots-Tag, liensrel="nofollow"et balise canonique.Léger pour vos serveurs
Au plus 4 requêtes simultanées par site, une exploration complète par jour, pages de 3 Mo au plus, 12 s d’attente au plus.
Prudent
Il n’explore jamais d’adresse privée, n’envoie ni cookie ni identifiant, et ne soumet aucun formulaire.
Ce qu’il lit, dans l’ordre
/robots.txt: vos règles d’exploration, relues à chaque passage./llms.txtet/llms-full.txt: la présentation de votre site aux IA. Les pages qu’il cite sont ajoutées à l’exploration.- Vos sitemaps : ceux déclarés dans
robots.txt,/sitemap.xml, et ceux envoyés depuis la console. - La page d’accueil, puis les liens internes, jusqu’à 10 clics de profondeur et dans la limite de pages fixée pour le site.
- Sur chaque page : la balise
robotsoukreomnisbot, l’en-têteX-Robots-Tag, la canonique, les liens.
Régler l’exploration avec robots.txt
Le fichier se trouve à la racine : https://votre-site.fr/robots.txt. KreomnisBot lit le groupe User-agent: KreomnisBot s’il existe ; sinon, le groupe User-agent: *. Un groupe dédié remplace le groupe * : recopiez-y les règles communes que vous voulez lui appliquer.
Bloquer une partie du site
User-agent: KreomnisBot Disallow: /prive/ Disallow: /compte/
Bloquer tout le site
User-agent: KreomnisBot Disallow: /
Les statistiques de visite continuent de fonctionner : elles ne dépendent pas de l’exploration.
Autoriser une exception dans un dossier bloqué
User-agent: KreomnisBot Disallow: /compte/ Allow: /compte/aide
Quand deux règles s’appliquent, la plus longue (la plus précise) l’emporte ; à longueur égale, Allow gagne.
Ignorer des paramètres ou des types de fichiers
User-agent: KreomnisBot # toute URL contenant ?session= Disallow: /*?session= # les pages d’archives en .html ($ = fin de l’adresse) Disallow: /archives/*.html$ # les résultats de recherche interne Disallow: /recherche
Les mêmes règles pour tous les robots
User-agent: * Disallow: /admin/ Disallow: /panier Sitemap: https://votre-site.fr/sitemap.xml
Sans groupe dédié, KreomnisBot applique ce groupe *.
Page par page
Ne pas indexer une page
<!-- pour tous les robots --> <meta name="robots" content="noindex"> <!-- pour KreomnisBot seulement --> <meta name="kreomnisbot" content="noindex">
La page est lue mais classée « Exclue par la balise noindex » dans la couverture.
Ne pas suivre les liens d’une page
<meta name="robots" content="nofollow"> <!-- ou un seul lien --> <a href="/calendrier?mois=2031-01" rel="nofollow">Mois suivant</a>
Sans toucher au HTML : l’en-tête X-Robots-Tag
Pratique pour tout un dossier, ou un site dont vous ne pouvez pas modifier les gabarits.
location /brouillons/ {
add_header X-Robots-Tag "noindex" always;
}Header set X-Robots-Tag "noindex"
async headers() {
return [{ source: '/brouillons/:path*', headers: [{ key: 'X-Robots-Tag', value: 'noindex' }] }];
}Pages en double : la balise canonique
<link rel="canonical" href="https://votre-site.fr/produits/pain-au-levain">
Une page qui désigne une autre adresse comme canonique est classée « Autre page avec balise canonique correcte ».
llms.txt : présenter votre site aux IA
llms.txt est un fichier Markdown à la racine qui résume votre site pour les assistants (ChatGPT, Claude, Perplexity…). KreomnisBot le lit à chaque exploration, ajoute les pages qu’il cite et affiche son état dans la console (Sitemaps › Fichiers pour les IA). llms-full.txt, facultatif, contient le texte complet.
# Boulangerie du Levain > Boulangerie artisanale à Lille : pain au levain, viennoiseries, commandes en ligne. ## Pages principales - [Nos pains](https://votre-site.fr/pains): gamme et allergènes - [Commander](https://votre-site.fr/commande): retrait en boutique sous 24 h - [Horaires et accès](https://votre-site.fr/contact) ## Optional - [Histoire de la maison](https://votre-site.fr/histoire)
- Servez-le en texte (
text/plainoutext/markdown) : une page HTML renvoyée à la place est signalée comme erreur. - Il est soumis à
robots.txt:Disallow: /llms.txtempêche sa lecture. - Taille lue : 1 Mo au plus pour
llms.txt, 2 Mo pourllms-full.txt.
Exemple réel : kreomnisindexation.com/llms.txt.
Sitemaps
Sitemap: https://votre-site.fr/sitemap.xml
KreomnisBot lit aussi /sitemap.xml sans déclaration, et les index de sitemaps. Vous pouvez en envoyer d’autres depuis la console (Sitemaps). Les pages listées sont explorées même si aucun lien n’y mène.
Limites à connaître
- Pas de JavaScript : il lit le HTML renvoyé par le serveur. Un contenu affiché uniquement par JavaScript (application monopage sans rendu serveur) ne sera pas vu.
- Pages de plus de 3 Mo ou plus lentes que 12 s : comptées en erreur.
- Fichiers ignorés d’office : images, PDF, archives, vidéos, polices, CSS, JavaScript, JSON, XML (hors sitemaps).
- Redirections : il les note et explore la page de destination si elle est sur votre site.
- Nombre de pages : 500 par défaut, réglable par le propriétaire dans les paramètres du site.
Le reconnaître
KreomnisBot s’annonce avec le User-Agent ci-dessus. Il fonctionne sur une infrastructure cloud sans plage d’adresses fixe publiée : un autre robot peut donc imiter son nom. En cas de doute, bloquez-le avec robots.txt, ce qu’il respecte toujours.
Vous gérez un site ? Ajoutez-le pour voir ce que KreomnisBot y trouve. Documentation complète : Robots et IA.