Robot d’exploration

KreomnisBot

Le robot qui alimente l’index Kreomnis et la console Kreomnis Indexation : ce qu’il lit, et comment le piloter depuis votre site.

User-AgentKreomnisBot/1.0 (+indexation; respecte robots.txt)
  • Seulement les sites prouvés

    KreomnisBot n’explore que les sites dont le propriétaire a prouvé la propriété sur Kreomnis Indexation, et les sites attestés sur KreomnisNet.

  • Respecte vos consignes

    robots.txt (groupe KreomnisBot, sinon *), balises noindex / nofollow, en-tête X-Robots-Tag, liens rel="nofollow" et balise canonique.

  • Léger pour vos serveurs

    Au plus 4 requêtes simultanées par site, une exploration complète par jour, pages de 3 Mo au plus, 12 s d’attente au plus.

  • Prudent

    Il n’explore jamais d’adresse privée, n’envoie ni cookie ni identifiant, et ne soumet aucun formulaire.

Ce qu’il lit, dans l’ordre

  1. /robots.txt : vos règles d’exploration, relues à chaque passage.
  2. /llms.txt et /llms-full.txt : la présentation de votre site aux IA. Les pages qu’il cite sont ajoutées à l’exploration.
  3. Vos sitemaps : ceux déclarés dans robots.txt, /sitemap.xml, et ceux envoyés depuis la console.
  4. La page d’accueil, puis les liens internes, jusqu’à 10 clics de profondeur et dans la limite de pages fixée pour le site.
  5. Sur chaque page : la balise robots ou kreomnisbot, l’en-tête X-Robots-Tag, la canonique, les liens.

Régler l’exploration avec robots.txt

Le fichier se trouve à la racine : https://votre-site.fr/robots.txt. KreomnisBot lit le groupe User-agent: KreomnisBot s’il existe ; sinon, le groupe User-agent: *. Un groupe dédié remplace le groupe * : recopiez-y les règles communes que vous voulez lui appliquer.

Bloquer une partie du site

robots.txt
User-agent: KreomnisBot
Disallow: /prive/
Disallow: /compte/

Bloquer tout le site

robots.txt
User-agent: KreomnisBot
Disallow: /

Les statistiques de visite continuent de fonctionner : elles ne dépendent pas de l’exploration.

Autoriser une exception dans un dossier bloqué

robots.txt
User-agent: KreomnisBot
Disallow: /compte/
Allow: /compte/aide

Quand deux règles s’appliquent, la plus longue (la plus précise) l’emporte ; à longueur égale, Allow gagne.

Ignorer des paramètres ou des types de fichiers

robots.txt
User-agent: KreomnisBot
# toute URL contenant ?session=
Disallow: /*?session=
# les pages d’archives en .html ($ = fin de l’adresse)
Disallow: /archives/*.html$
# les résultats de recherche interne
Disallow: /recherche

Les mêmes règles pour tous les robots

robots.txt
User-agent: *
Disallow: /admin/
Disallow: /panier

Sitemap: https://votre-site.fr/sitemap.xml

Sans groupe dédié, KreomnisBot applique ce groupe *.

Page par page

Ne pas indexer une page

index.html (dans le <head>)
<!-- pour tous les robots -->
<meta name="robots" content="noindex">

<!-- pour KreomnisBot seulement -->
<meta name="kreomnisbot" content="noindex">

La page est lue mais classée « Exclue par la balise noindex » dans la couverture.

Ne pas suivre les liens d’une page

index.html
<meta name="robots" content="nofollow">

<!-- ou un seul lien -->
<a href="/calendrier?mois=2031-01" rel="nofollow">Mois suivant</a>

Sans toucher au HTML : l’en-tête X-Robots-Tag

Pratique pour tout un dossier, ou un site dont vous ne pouvez pas modifier les gabarits.

nginx.conf
location /brouillons/ {
  add_header X-Robots-Tag "noindex" always;
}
.htaccess (Apache, dans le dossier /brouillons)
Header set X-Robots-Tag "noindex"
next.config.ts (Next.js)
async headers() {
  return [{ source: '/brouillons/:path*', headers: [{ key: 'X-Robots-Tag', value: 'noindex' }] }];
}

Pages en double : la balise canonique

index.html
<link rel="canonical" href="https://votre-site.fr/produits/pain-au-levain">

Une page qui désigne une autre adresse comme canonique est classée « Autre page avec balise canonique correcte ».

llms.txt : présenter votre site aux IA

llms.txt est un fichier Markdown à la racine qui résume votre site pour les assistants (ChatGPT, Claude, Perplexity…). KreomnisBot le lit à chaque exploration, ajoute les pages qu’il cite et affiche son état dans la console (Sitemaps › Fichiers pour les IA). llms-full.txt, facultatif, contient le texte complet.

llms.txt
# Boulangerie du Levain
> Boulangerie artisanale à Lille : pain au levain, viennoiseries, commandes en ligne.

## Pages principales
- [Nos pains](https://votre-site.fr/pains): gamme et allergènes
- [Commander](https://votre-site.fr/commande): retrait en boutique sous 24 h
- [Horaires et accès](https://votre-site.fr/contact)

## Optional
- [Histoire de la maison](https://votre-site.fr/histoire)
  • Servez-le en texte (text/plain ou text/markdown) : une page HTML renvoyée à la place est signalée comme erreur.
  • Il est soumis à robots.txt : Disallow: /llms.txt empêche sa lecture.
  • Taille lue : 1 Mo au plus pour llms.txt, 2 Mo pour llms-full.txt.

Exemple réel : kreomnisindexation.com/llms.txt.

Sitemaps

robots.txt
Sitemap: https://votre-site.fr/sitemap.xml

KreomnisBot lit aussi /sitemap.xml sans déclaration, et les index de sitemaps. Vous pouvez en envoyer d’autres depuis la console (Sitemaps). Les pages listées sont explorées même si aucun lien n’y mène.

Limites à connaître

  • Pas de JavaScript : il lit le HTML renvoyé par le serveur. Un contenu affiché uniquement par JavaScript (application monopage sans rendu serveur) ne sera pas vu.
  • Pages de plus de 3 Mo ou plus lentes que 12 s : comptées en erreur.
  • Fichiers ignorés d’office : images, PDF, archives, vidéos, polices, CSS, JavaScript, JSON, XML (hors sitemaps).
  • Redirections : il les note et explore la page de destination si elle est sur votre site.
  • Nombre de pages : 500 par défaut, réglable par le propriétaire dans les paramètres du site.

Le reconnaître

KreomnisBot s’annonce avec le User-Agent ci-dessus. Il fonctionne sur une infrastructure cloud sans plage d’adresses fixe publiée : un autre robot peut donc imiter son nom. En cas de doute, bloquez-le avec robots.txt, ce qu’il respecte toujours.

Vous gérez un site ? Ajoutez-le pour voir ce que KreomnisBot y trouve. Documentation complète : Robots et IA.