Aller au contenu
aivoma
Vérification gratuite
← Tous les guides

Robots IA et WooCommerce : laisser GPTBot, PerplexityBot et Claude lire votre boutique (robots.txt + Cloudflare, 2026)

Quels robots IA comptent, et les réglages exacts de robots.txt, Cloudflare et hébergement qui empêchent votre boutique WooCommerce d’être invisible pour les…

Par Harri Reili Publié le 7 min de lecture

Si un assistant IA ne peut pas récupérer vos pages, rien de ce que vous ferez d’autre pour votre visibilité IA ne comptera. Pourtant, bloquer les robots IA est devenu le comportement par défaut sur une grande partie du web : Cloudflare l’active pour les nouvelles zones, les extensions de sécurité livrent des listes de bots à bloquer, et les WAF des hébergeurs soumettent à un défi tout ce qui n’est pas un navigateur. Pour une boutique qui veut être recommandée, c’est une invisibilité auto-infligée.

Connaître les robots (et ce que fait chacun)

Il existe trois types d’agents liés à l’IA. Les confondre est la raison pour laquelle tant de boutiques bloquent la mauvaise chose.

Éditeur Index de recherche / récupération (à autoriser) Récupération déclenchée par l’utilisateur (à autoriser) Robot d’entraînement
OpenAI OAI-SearchBot ChatGPT-User GPTBot
Perplexity PerplexityBot Perplexity-User
Anthropic Claude-SearchBot Claude-User ClaudeBot
Google Googlebot (alimente aussi AI Overviews / AI Mode) Google-Agent et autres récupérateurs utilisateur Google-Extended (un jeton robots ; le bloquer ne vous retire pas d’AI Overviews ni d’AI Mode)
Microsoft Bingbot (alimente Copilot) contrôlé par les meta noarchive/nocache, pas par le user agent
Mistral MistralAI-Index MistralAI-User MistralAI-Training
Apple Applebot Applebot-Extended (jeton)

Les robots de recherche décident si vous pouvez être cité. Les récupérateurs déclenchés par l’utilisateur chargent votre page quand quelqu’un interroge l’assistant sur vous à l’instant. Les robots d’entraînement alimentent les futurs modèles. Une boutique doit autoriser les deux premiers sans hésiter ; autoriser les robots d’entraînement est une décision commerciale, mais notez que figurer dans les données d’entraînement d’un modèle est ce qui fait entrer une marque dans sa « mémoire ».

robots.txt pour une boutique qui veut être visible par l’IA

Le fichier correct le plus simple autorise tout sauf les chemins privés :

User-agent: *
Allow: /
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Sitemap: https://votreboutique.fr/sitemap_index.xml

Lister explicitement OAI-SearchBot, PerplexityBot, Claude-SearchBot avec Allow: / est inoffensif et rend l’intention visible lors des audits, mais ce n’est pas nécessaire quand * autorise déjà.

Deux pièges : les récupérateurs déclenchés par l’utilisateur (ChatGPT-User, Perplexity-User) ignorent de toute façon largement robots.txt — la vraie barrière est votre pare-feu. Et pour Bing/Copilot, évitez les balises meta noarchive/nocache sur les pages que vous voulez voir citées.

Cloudflare : cinq réglages à vérifier

  1. Security → Settings → AI bot policy. Depuis juillet 2025, les nouvelles zones sont sur block par défaut. À partir du 15 septembre 2026, le réglage est divisé en Search / Agent / Training ; mettez ceux que vous voulez sur Allow — et notez que Cloudflare avertit que bloquer « Training » peut aussi bloquer des robots polyvalents comme Googlebot et Bingbot sur les pages concernées.
  2. AI Crawl Control. Réglez chaque robot IA sur Allow (pas Block ni Charge). Consultez la vue des violations de robots.txt.
  3. Bot Fight Mode / Super Bot Fight Mode. Le Bot Fight Mode du plan gratuit soumet à un défi les robots reconnus par motif et ne peut pas être contourné par des règles WAF ; désactivez-le ou passez à un plan supérieur et réglez Verified bots = Allow. Si vous utilisez Cloudflare Tunnel, gardez Definitely automated = Allow.
  4. Managed robots.txt. Cette fonction ajoute en tête de votre fichier des règles Disallow: / pour les robots d’entraînement IA et une ligne Content-Signal. Désactivez-la, puis vérifiez que votre /robots.txt en ligne n’affiche que vos règles.
  5. Règles WAF personnalisées et limitation de débit. Cherchez des règles correspondant à des user agents de robots ou à des ASN de fournisseurs cloud, et exemptez des produits bot les catégories cf.verified_bot_category AI Crawler / AI Search / AI Assistant.

Hébergement et extensions WordPress

  • Les extensions de sécurité (Wordfence, All-in-One Security, etc.) livrent souvent des listes de « mauvais bots » qui incluent des user agents IA. Mettez en liste blanche les agents de recherche et de récupération utilisateur ci-dessus.
  • Certains hébergeurs WordPress infogérés bloquent les robots en périphérie ; demandez au support leur politique concernant les robots IA.
  • Les couches de cache ne doivent pas servir de fragments HTML ni de pages de défi aux agents non-navigateurs.

Vérifier de l’extérieur

curl -sI -A "Mozilla/5.0 (compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot)" https://votreboutique.fr/
curl -sI -A "Mozilla/5.0 (compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)" https://votreboutique.fr/

Vous voulez HTTP/2 200 et du vrai HTML, pas un 403, une page de défi ou une boucle de redirection. Répétez pour une fiche produit et une page de catégorie. Regardez ensuite dans Cloudflare Security Analytics les requêtes bloquées portant ces user agents.

Et llms.txt ?

Google a indiqué que Search ne l’utilise pas ; la documentation des robots d’OpenAI recommande robots.txt, pas llms.txt ; et Ahrefs a constaté que 97 % des fichiers llms.txt sur 137 000 sites n’ont jamais été demandés. Le publier est inoffensif, mais ce sont l’accès des robots, les flux et le schéma qui produisent les résultats.

Vous ne savez pas si votre boutique est lisible ? Notre vérification gratuite de visibilité IA comprend un test d’accès de l’extérieur pour chaque grand agent IA.


Sources : documentation des robots OpenAI ; documentation des robots Perplexity ; article d’aide d’Anthropic sur les robots ; Google Search Central — robots courants et « AI features and your website » ; Cloudflare — « Introducing Pay Per Crawl » (juillet 2025), « Content Independence Day » (juillet 2026), documentation AI Crawl Control et Bot Fight Mode ; étude Ahrefs sur llms.txt (juin 2026).

Vérification gratuite instantanée

Voyez ce que les assistants IA peuvent lire sur votre boutique — en 60 secondes

Collez l’URL de votre boutique. Nous testons en direct l’accès des robots IA, le schéma produit, les prix, les GTIN, les flux et la sécurité e-mail, et vous montrons les lacunes exactes. Sans inscription, sans engagement.

Vérifier ma boutique gratuitement