Cómo comprobar si los robots de IA pueden acceder a tu web WordPress

TL;DR El bloqueo casi nunca está en robots.txt: suele estar en la CDN, el WAF, el hosting o un plugin. Test rápido: curl -A "GPTBot/1.0" -I https://tusitio.com/ y repite por bot. 200 = entra, 403 = bloqueo, 429 = límite de peticiones. No es lo mismo un bot de training que uno de search o uno que se activa cuando un usuario pregunta. Bloquear search te quita visibilidad. El user-agent se puede falsificar: para confirmar identidad valida la IP contra los JSON oficiales y el reverse DNS. Que el bot pueda entrar no significa que la IA te cite. Eso se mide aparte, y ahí entra Semly.

Cómo comprobar si los robots de IA pueden acceder a tu web WordPress: método en 6 pasos

La mayoría de bloqueos no están en el robots.txt. Están en una capa intermedia que casi nadie revisa: la CDN, el firewall, el hosting o un plugin de caché. Por eso el diagnóstico se hace de fuera hacia dentro, empezando por lo más externo y terminando en los logs. Si vas en ese orden, en pocos minutos sabrás exactamente qué capa está cortando el acceso.

Paso 1 — Identifica qué bots te importan (training, search, user-triggered)

Antes de comprobar nada, decide a quién estás comprobando. No todos los bots de IA hacen lo mismo, y bloquear uno no tiene las mismas consecuencias que bloquear otro.

Tipo Ejemplos de user-agent Qué pierdes si lo bloqueas
Training GPTBot, ClaudeBot, Google-Extended, CCBot, Applebot-Extended, Bytespider Alimentar el modelo con tu contenido. No pierdes citas ni tráfico directo.
Search OAI-SearchBot, Claude-SearchBot, PerplexityBot Que tu web pueda aparecer como fuente en las respuestas. Aquí sí pierdes visibilidad.
User-triggered ChatGPT-User, Claude-User, Perplexity-User Que la IA pueda leer tu página cuando un usuario la pide en el momento.

Un detalle que se malinterpreta mucho: Google-Extended no tiene user-agent HTTP propio. Es solo un token de robots.txt. Bloquearlo no saca tu sitio de AI Overviews ni de Search. La evidencia disponible apunta a una correlación con menos recuperación en AI Overviews, pero es correlación, no causalidad. No lo trates como un interruptor mágico.

Cómo saber que lo hiciste bien: tienes claro qué bots quieres permitir y cuáles no, y por qué. Señal típica de error: bloquear todo lo que lleve "bot" en el nombre y luego preguntarte por qué la IA no te menciona.

Paso 2 — Revisa tu robots.txt (y el error del toggle de WordPress)

Abre tudominio.com/robots.txt en el navegador. Busca un Disallow: / global. Si está ahí, ningún bot entra, ni de IA ni de buscadores.

El error más frecuente en WordPress no está en el archivo, sino en un ajuste. Ve a Ajustes > Lectura y comprueba "Visibilidad en motores de búsqueda". Si esa casilla está marcada, WordPress añade un Disallow: / a todo el sitio. Es un interruptor pensado para webs en construcción que mucha gente deja activado sin darse cuenta.

Después, mira si tu robots.txt es físico (un archivo en la raíz) o virtual (lo genera el editor de tu plugin SEO). Si es físico, el editor del plugin no podrá modificarlo y tus cambios no se aplicarán. Y ojo con un User-agent: * con Disallow: arrastra también a Googlebot.

Recuerda que robots.txt gestiona el rastreo, no la indexación. Y que un cambio puede tardar alrededor de 24 horas en reflejarse en los sistemas de OpenAI.

Cómo saber que lo hiciste bien: el archivo permite lo que quieres permitir y el toggle de WordPress está desmarcado. Señal típica de error: tu robots.txt permite el acceso pero el bot sigue recibiendo un 403. Eso significa que el bloqueo está en otra capa, no aquí.

Paso 3 — Haz el test rápido con curl (30 segundos por bot)

Este comando te da una respuesta objetiva sin instalar nada:

curl -A "GPTBot/1.0" -I https://tusitio.com/
curl -A "OAI-SearchBot/1.0" -I https://tusitio.com/
curl -A "ClaudeBot/1.0" -I https://tusitio.com/
curl -A "PerplexityBot/1.0" -I https://tusitio.com/

Lee el código de estado:

  • 200: la capa no bloquea ese user-agent.
  • 403: hay un bloqueo activo, normalmente en WAF o CDN.
  • 429: límite de peticiones. Es típico de hostings gestionados.
  • 503: servidor caído o caché devolviendo algo raro.

Aviso importante: el user-agent se puede falsificar. Un 200 solo prueba que esa capa no bloquea ese texto, no que quien entra sea el bot real.

Cómo saber que lo hiciste bien: obtienes un código claro por cada bot y sabes en qué capa mirar. Señal típica de error: todos los bots devuelven 403. Casi siempre es una regla global en la CDN o el WAF.

Paso 4 — Verifica la IP real, no el nombre del bot

Como el string se puede copiar, la comprobación fiable es la IP. Cada operador publica sus rangos en archivos JSON oficiales (OpenAI, Google, Perplexity). Compara la IP que ves en tus logs con esa lista y, si quieres confirmar, haz un reverse DNS:

dig -x 20.15.240.0

Si el resultado no apunta al dominio oficial del operador, no es el bot legítimo.

Cómo saber que lo hiciste bien: la IP aparece en el JSON oficial y el reverse DNS coincide. Señal típica de error: confiar solo en el user-agent y dejar pasar a cualquiera que se llame "GPTBot".

Paso 5 — Revisa las capas que suelen bloquear: CDN, WAF, hosting, .htaccess, caché

Aquí vive el bloqueo real. Repasa esta checklist:

  • CDN (Cloudflare y similares): revisa las categorías de bots. Cloudflare separa Search, Agent y Training, y desde 2025 aplica bloqueos por defecto a crawlers de IA en dominios nuevos. Comprueba si tienes activada alguna regla de bloqueo de IA sin saberlo.
  • WAF (Wordfence, Sucuri): muchas reglas devuelven 403 a peticiones con user-agents desconocidos. Mira el registro de bloqueos.
  • Hosting gestionado: algunos aplican límites de peticiones y devuelven 429 a los crawlers.
  • .htaccess: busca reglas que bloqueen por user-agent. Es fácil que una regla antigua siga activa.
  • Plugins de caché (WP Rocket, LiteSpeed, caché de la CDN): pueden servir respuestas cacheadas o cambiar cabeceras, y enmascarar el bloqueo real. Purga la caché antes de sacar conclusiones.

Cómo saber que lo hiciste bien: has revisado las cinco capas y sabes cuál devuelve el 403 o el 429. Señal típica de error: das por bueno un resultado sin purgar la caché y ves datos antiguos.

Paso 6 — Confirma con logs (no con Google Analytics)

El último paso es ver si el bot entró de verdad. Mira los logs del servidor, de la CDN o del WAF y filtra por user-agent. Google Analytics no sirve aquí: no ve bots que no ejecutan JavaScript.

El informe de robots.txt de Search Console solo cubre a Googlebot, así que úsalo para eso y no para el resto. Y distingue entre un crawl (el bot lee tu web) y un referral (un usuario llega desde una respuesta de IA). Son cosas distintas, y conviene medir su impacto por separado.

Cómo saber que lo hiciste bien: ves peticiones reales del bot en los logs, con IP válida. Señal típica de error: buscar bots en Analytics y concluir que no entran porque no aparecen.

Errores frecuentes y cómo arreglarlos

Síntoma Causa Arreglo
Ningún bot entra Disallow: / por el toggle de WordPress Desmarca "Visibilidad en motores de búsqueda" en Ajustes > Lectura
Los cambios no se aplican robots.txt físico que bloquea el editor del plugin Pasa a robots.txt virtual o edita el archivo a mano
Googlebot también bloqueado User-agent: * con Disallow Añade reglas específicas por bot
El bot no indexa aunque entra Confundir noindex con robots.txt Usa noindex o X-Robots-Tag para indexación
Resultados incoherentes Caché sirviendo respuestas antiguas Purga la caché de plugin y CDN
Menos visibilidad en IA Bloquear Google-Extended creyendo que saca el sitio de AI Overviews Revisa la decisión: es un token de robots.txt, no un crawler

Qué hacer después: de "puede entrar" a "aparece mi marca"

Permitir el acceso es el prerrequisito, no el resultado. Que el bot entre solo significa que puede leerte. Que la IA te cite es otra cosa, y se mide aparte.

Ahí es donde entra Semly. Es una plataforma de posicionamiento de marca en respuestas de IA que monitoriza tu visibilidad en ChatGPT, Gemini, Claude, Grok y Google AI. Analiza las fuentes citadas y tu Share of Voice, y genera bases de conocimiento (llms.txt, JSON-LD, sitemap) en un subdominio propio para que los modelos puedan leerte mejor. Si tienes una tienda WordPress o WooCommerce, se conecta vía API.

Los datos ayudan a poner esto en contexto. Solo el 6,82% de las citas de ChatGPT coincide con el top 10 de Google, según Semly (2026). Y según un estudio de Omni Eclipse citado por Semly (marzo 2026), solo el 11,9% de las empresas son visibles en ChatGPT en consultas de recomendación. La buena noticia es que se puede mejorar: en el informe Semly 2026, la visibilidad media de 100 tiendas pasó del 11,8% al 22,6% en 90 días.

Si ya te bloquean, el orden es claro: arregla el acceso primero, y mide la visibilidad después.

Preguntas frecuentes

¿robots.txt bloquea la IA? Sí, si incluye un Disallow que afecte a esos bots. Pero solo controla el rastreo, no la indexación, y es una norma voluntaria que cada operador decide respetar.

¿Cuál es la diferencia entre GPTBot y OAI-SearchBot? GPTBot es un bot de training: recoge contenido para entrenar modelos. OAI-SearchBot es un bot de búsqueda: permite que tu web aparezca como fuente en las respuestas. Bloquear el primero no te quita citas; bloquear el segundo, sí.

¿Cuánto tarda un cambio en robots.txt? OpenAI indica que puede tardar alrededor de 24 horas en reflejarse en sus sistemas.

¿Bloquear Google-Extended me quita de AI Overviews? No directamente. Google-Extended no tiene user-agent propio, es solo un token de robots.txt. Hay indicios de correlación con menos recuperación en AI Overviews, pero no es una relación causal demostrada.

¿llms.txt garantiza que me citen? No. Es un estándar propuesto, no oficial, y ningún proveedor importante de LLM ha confirmado que lo lea. Ayuda a que la IA entienda tu contenido, pero no garantiza citas.

Fuentes

Verifica si ve tu marca

Introduce tu sitio web para recibir un informe gratuito de visibilidad en IA