Rastreadores de IA y WooCommerce: deja que GPTBot, PerplexityBot y Claude lean tu tienda (robots.txt + Cloudflare, 2026)
Qué bots de IA importan y los ajustes exactos de robots.txt, Cloudflare y hosting que evitan que tu tienda WooCommerce sea invisible para los asistentes de IA.
Por Harri Reili Publicado 7 min de lectura
Si un asistente de IA no puede descargar tus páginas, nada más de lo que hagas por la visibilidad en IA importa. Y, sin embargo, bloquear los rastreadores de IA se ha convertido en el comportamiento por defecto en buena parte de la web: Cloudflare lo activa en las zonas nuevas, los plugins de seguridad incluyen listas de bloqueo de bots y los WAF de los hostings desafían a todo lo que no sea un navegador. Para una tienda que quiere ser recomendada, esto es invisibilidad autoinfligida.
Conoce los bots (y qué hace cada uno)
Hay tres tipos de agentes relacionados con la IA. Confundirlos es la razón por la que tantas tiendas bloquean lo que no deben.
| Proveedor | Índice de búsqueda / recuperación (estos los quieres) | Descarga activada por el usuario (estos los quieres) | Rastreador de entrenamiento |
|---|---|---|---|
| OpenAI | OAI-SearchBot |
ChatGPT-User |
GPTBot |
| Perplexity | PerplexityBot |
Perplexity-User |
— |
| Anthropic | Claude-SearchBot |
Claude-User |
ClaudeBot |
Googlebot (también alimenta AI Overviews / AI Mode) |
Google-Agent y otros fetchers de usuario | Google-Extended (un token de robots; bloquearlo no te elimina de AI Overviews ni de AI Mode) |
|
| Microsoft | Bingbot (alimenta Copilot) |
— | se controla con las metaetiquetas noarchive/nocache, no por user agent |
| Mistral | MistralAI-Index |
MistralAI-User |
MistralAI-Training |
| Apple | Applebot |
— | Applebot-Extended (token) |
Los bots de búsqueda deciden si puedes ser citado. Los fetchers activados por el usuario cargan tu página cuando alguien pregunta al asistente por ti en ese momento. Los rastreadores de entrenamiento alimentan los modelos futuros. Una tienda debería permitir los dos primeros sin dudar; permitir los rastreadores de entrenamiento es una decisión de negocio, pero ten en cuenta que estar en los datos de entrenamiento de un modelo es la forma en que una marca acaba en su «memoria».
robots.txt para una tienda que quiere visibilidad en IA
El archivo correcto más sencillo permite todo excepto las rutas privadas:
User-agent: *
Allow: /
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Sitemap: https://tutienda.es/sitemap_index.xml
Listar explícitamente OAI-SearchBot, PerplexityBot y Claude-SearchBot con Allow: / es inofensivo y hace visible tu intención en las auditorías, pero no es necesario cuando * ya lo permite.
Dos trampas: los fetchers activados por el usuario (ChatGPT-User, Perplexity-User) ignoran en gran medida robots.txt de todos modos; la verdadera puerta es tu firewall. Y para Bing/Copilot, evita las metaetiquetas noarchive/nocache en las páginas que quieres que se citen.
Cloudflare: cinco interruptores que revisar
- Security → Settings → AI bot policy. Desde julio de 2025 las zonas nuevas vienen con block por defecto. Desde el 15 de septiembre de 2026 el ajuste se divide en Search / Agent / Training; pon en Allow los que quieras, y ten en cuenta que Cloudflare advierte de que bloquear «Training» también puede bloquear rastreadores multipropósito como Googlebot y Bingbot en las páginas afectadas.
- AI Crawl Control. Pon cada rastreador de IA en Allow (no Block ni Charge). Revisa la vista de infracciones de robots.txt.
- Bot Fight Mode / Super Bot Fight Mode. El Bot Fight Mode del plan gratuito desafía a los bots detectados por patrón y no se puede omitir con reglas WAF; desactívalo o mejora el plan y pon Verified bots = Allow. Si usas Cloudflare Tunnel, mantén Definitely automated = Allow.
- Managed robots.txt. Esta función antepone reglas
Disallow: /para los bots de entrenamiento de IA y una líneaContent-Signala tu archivo. Desactívala y confirma después que tu/robots.txten producción muestra solo tus reglas. - Reglas personalizadas del WAF y límites de frecuencia. Busca reglas que coincidan con user agents de bots o con ASN de proveedores cloud, y omite los productos de bots para
cf.verified_bot_categoryen AI Crawler / AI Search / AI Assistant.
Hosting y plugins de WordPress
- Los plugins de seguridad (Wordfence, All-in-One Security, etc.) suelen incluir listas de «bots malos» con user agents de IA. Añade a la lista blanca los agentes de búsqueda y activados por el usuario indicados arriba.
- Algunos hostings WordPress gestionados bloquean bots en el borde; pregunta a soporte por su política de rastreadores de IA.
- Las capas de caché no deben servir fragmentos HTML ni páginas de desafío a agentes que no sean navegadores.
Verifícalo desde fuera
curl -sI -A "Mozilla/5.0 (compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot)" https://tutienda.es/
curl -sI -A "Mozilla/5.0 (compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)" https://tutienda.es/
Quieres HTTP/2 200 y HTML real, no un 403, una página de desafío ni un bucle de redirecciones. Repítelo con una página de producto y una de categoría. Después revisa en Cloudflare Security Analytics las peticiones bloqueadas con esos user agents.
¿Y llms.txt?
Google ha dicho que Search no lo usa; la documentación de rastreadores de OpenAI recomienda robots.txt, no llms.txt; y Ahrefs descubrió que el 97 % de los archivos llms.txt de 137 000 sitios nunca se solicitaron. Publicarlo es inofensivo, pero los resultados vienen del acceso de rastreadores, los feeds y el schema.
¿No sabes si tu tienda es legible? Nuestra comprobación gratuita de visibilidad en IA incluye una prueba de rastreadores desde fuera para todos los agentes de IA principales.
Fuentes: documentación de bots de OpenAI; documentación de bots de Perplexity; artículo de soporte sobre rastreadores de Anthropic; Google Search Central: rastreadores comunes y «AI features and your website»; Cloudflare: «Introducing Pay Per Crawl» (julio de 2025), «Content Independence Day» (julio de 2026), documentación de AI Crawl Control y Bot Fight Mode; estudio de Ahrefs sobre llms.txt (junio de 2026).