KI-Crawler und WooCommerce: GPTBot, PerplexityBot und Claude den Shop lesen lassen (robots.txt + Cloudflare, 2026)
Welche KI-Bots wirklich zählen und die genauen robots.txt-, Cloudflare- und Hosting-Einstellungen, mit denen Ihr WooCommerce-Shop für sie sichtbar wird.
Von Harri Reili Veröffentlicht 7 Min. Lesezeit
Wenn ein KI-Assistent Ihre Seiten nicht abrufen kann, ist alles andere, was Sie für KI-Sichtbarkeit tun, wirkungslos. Dennoch ist das Blockieren von KI-Crawlern im Web zum Standard geworden – Cloudflare aktiviert es für neue Zonen, Sicherheits-Plugins liefern Bot-Sperrlisten mit, und Hosting-WAFs stellen alles vor eine Challenge, was kein Browser ist. Für einen Shop, der empfohlen werden will, ist das selbst verschuldete Unsichtbarkeit.
Die Bots kennen (und was jeder tut)
Es gibt drei Arten von KI-Agenten. Sie zu verwechseln ist der Grund, warum so viele Shops das Falsche blockieren.
| Anbieter | Such-/Abruf-Index (die wollen Sie) | Nutzerausgelöster Abruf (die wollen Sie) | Trainings-Crawler |
|---|---|---|---|
| OpenAI | OAI-SearchBot |
ChatGPT-User |
GPTBot |
| Perplexity | PerplexityBot |
Perplexity-User |
— |
| Anthropic | Claude-SearchBot |
Claude-User |
ClaudeBot |
Googlebot (speist auch AI Overviews / AI Mode) |
Google-Agent und andere Nutzer-Fetcher | Google-Extended (ein robots-Token; eine Sperre entfernt Sie nicht aus AI Overviews oder AI Mode) |
|
| Microsoft | Bingbot (treibt Copilot an) |
— | gesteuert über noarchive/nocache-Meta, nicht über den User-Agent |
| Mistral | MistralAI-Index |
MistralAI-User |
MistralAI-Training |
| Apple | Applebot |
— | Applebot-Extended (Token) |
Such-Bots entscheiden, ob Sie zitiert werden können. Nutzerausgelöste Fetcher laden Ihre Seite, wenn jemand den Assistenten gerade jetzt nach Ihnen fragt. Trainings-Crawler speisen künftige Modelle. Ein Shop sollte die ersten beiden ohne Zögern erlauben; Trainings-Crawler zuzulassen ist eine Geschäftsentscheidung – aber bedenken Sie, dass eine Marke genau über die Trainingsdaten ins „Gedächtnis“ eines Modells gelangt.
robots.txt für einen Shop, der KI-Sichtbarkeit will
Die einfachste korrekte Datei erlaubt alles außer privaten Pfaden:
User-agent: *
Allow: /
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Sitemap: https://ihrshop.de/sitemap_index.xml
OAI-SearchBot, PerplexityBot, Claude-SearchBot ausdrücklich mit Allow: / aufzuführen schadet nicht und macht die Absicht für Audits sichtbar, ist aber nicht nötig, wenn * bereits erlaubt.
Zwei Fallen: Nutzerausgelöste Fetcher (ChatGPT-User, Perplexity-User) ignorieren robots.txt ohnehin weitgehend – die eigentliche Schranke ist Ihre Firewall. Und für Bing/Copilot sollten Sie noarchive/nocache-Meta-Tags auf Seiten vermeiden, die zitiert werden sollen.
Cloudflare: fünf Schalter, die Sie prüfen sollten
- Security → Settings → AI bot policy. Seit Juli 2025 stehen neue Zonen standardmäßig auf block. Ab dem 15. September 2026 wird die Einstellung in Search / Agent / Training aufgeteilt; setzen Sie die gewünschten auf Allow – und beachten Sie Cloudflares Warnung, dass eine Sperre von „Training“ auf betroffenen Seiten auch Mehrzweck-Crawler wie Googlebot und Bingbot blockieren kann.
- AI Crawl Control. Setzen Sie jeden KI-Crawler auf Allow (nicht Block oder Charge). Prüfen Sie die Ansicht der robots.txt-Verstöße.
- Bot Fight Mode / Super Bot Fight Mode. Der Bot Fight Mode des Free-Plans stellt musterbasierte Bots vor eine Challenge und lässt sich nicht per WAF-Regel überspringen; entweder abschalten oder upgraden und Verified bots = Allow setzen. Wenn Sie Cloudflare Tunnel nutzen, behalten Sie Definitely automated = Allow.
- Managed robots.txt. Diese Funktion stellt Ihrer Datei
Disallow: /-Regeln für KI-Trainings-Bots und eineContent-Signal-Zeile voran. Schalten Sie sie ab und prüfen Sie dann, dass Ihre Live-/robots.txtnur Ihre eigenen Regeln zeigt. - WAF Custom Rules und Rate Limits. Suchen Sie nach Regeln, die auf Bot-User-Agents oder Cloud-Provider-ASNs matchen, und überspringen Sie Bot-Produkte für
cf.verified_bot_categoryin AI Crawler / AI Search / AI Assistant.
Hosting und WordPress-Plugins
- Sicherheits-Plugins (Wordfence, All-in-One Security usw.) liefern oft „Bad Bot“-Listen mit, die KI-User-Agents enthalten. Setzen Sie die oben genannten Such- und nutzerausgelösten Agents auf die Whitelist.
- Manche Managed-WordPress-Hoster blockieren Bots am Edge; fragen Sie den Support nach der KI-Crawler-Richtlinie.
- Caching-Ebenen dürfen Nicht-Browser-Agents keine HTML-Fragmente oder Challenge-Seiten ausliefern.
Von außen prüfen
curl -sI -A "Mozilla/5.0 (compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot)" https://ihrshop.de/
curl -sI -A "Mozilla/5.0 (compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)" https://ihrshop.de/
Sie wollen HTTP/2 200 und echtes HTML – keinen 403, keine Challenge-Seite und keine Redirect-Schleife. Wiederholen Sie das für eine Produktseite und eine Kategorieseite. Sehen Sie sich dann in Cloudflare Security Analytics die blockierten Anfragen mit diesen User-Agents an.
Was ist mit llms.txt?
Google hat erklärt, dass die Suche sie nicht nutzt; OpenAIs Crawler-Dokumentation empfiehlt robots.txt, nicht llms.txt; und Ahrefs hat festgestellt, dass 97 % der llms.txt-Dateien auf 137.000 Websites nie abgerufen wurden. Sie zu veröffentlichen schadet nicht, aber Crawler-Zugang, Feeds und Schema sind es, woher die Ergebnisse kommen.
Nicht sicher, ob Ihr Shop lesbar ist? Unser kostenloser KI-Sichtbarkeits-Check enthält einen Crawler-Test von außen für jeden großen KI-Agenten.
Quellen: OpenAI-Bot-Dokumentation; Perplexity-Bot-Dokumentation; Anthropic-Supportartikel zu Crawlern; Google Search Central – gängige Crawler und „AI features and your website“; Cloudflare – „Introducing Pay Per Crawl“ (Juli 2025), „Content Independence Day“ (Juli 2026), Dokumentation zu AI Crawl Control und Bot Fight Mode; Ahrefs-Studie zu llms.txt (Juni 2026).