TL;DR Schema.org no es un factor de ranking confirmado por OpenAI ni por Google: es infraestructura de entidad. El formato operativo es JSON-LD (no microdatos), con
@idcanónico y un@graphsin duplicados. El stack mínimo en WordPress combinaOrganization/LocalBusiness+sameAs+knowsAbout+WebSite+BreadcrumbList+Article/Product+FAQPage. Existen tres momentos distintos: pretraining, indexación/Knowledge Graph y recuperación en tiempo real (grounding).Google-Extendeden robots.txt condiciona el grounding de Gemini y no afecta a Google Search. Evidencia: Ahrefs (1.885 páginas, 05/2026) registró cambios marginales en citas de IA; correlación no implica causalidad. La medición antes/después con páginas test y control es obligatoria para saber si el cambio sirvió.
Los rastreadores de IA dejaron de ser una anomalía en los logs de servidor. Cloudflare documentó en julio de 2025 que el tráfico combinado de crawlers de IA y de búsqueda creció un 18% entre mayo de 2024 y mayo de 2025, con GPTBot multiplicando sus peticiones por más de cuatro (+305%) y Googlebot casi duplicándolas (+96%). Ese volumen explica por qué los equipos SEO y GEO buscan una palanca concreta en WordPress: datos estructurados que ayuden a los modelos a entender qué es la marca, qué vende y con qué entidades se relaciona.
La promesa de este artículo es acotada y honesta. No existe confirmación oficial de OpenAI ni de Google de que Schema.org sea un factor de ranking o de citación. Lo que sí está documentado es que los datos estructurados mejoran la comprensión de entidades, reducen ambigüedad y alimentan el Knowledge Graph. Eso es infraestructura, no un atajo.
A continuación se detalla qué lee realmente cada modelo, qué tipos y propiedades implementar, cómo hacerlo en WordPress sin duplicar entidades, qué papel juega Google-Extended y cómo medir el efecto con un diseño test/control.
Datos Schema.org en WordPress para IA: qué lee realmente cada modelo
El error más común es tratar el schema como una señal única que viaja a un único destino. En realidad, los datos estructurados se consumen en tres momentos distintos, con formatos y consecuencias diferentes.
| Momento | Qué se consume | Qué aporta el schema |
|---|---|---|
| Pretraining del modelo | Corpus históricos de rastreo (Common Crawl y similares) | Consistencia de entidad a largo plazo: nombres, relaciones, categorías |
| Indexación / Knowledge Graph | HTML + JSON-LD parseado por el motor de búsqueda | Desambiguación, sameAs, atributos verificables de la organización |
| Recuperación en tiempo real (grounding) | Fragmentos recuperados del índice y del HTML visible | Contexto factual que el modelo puede citar en la respuesta |
La primera capa es la más lenta y la menos controlable: el modelo ya se entrenó con lo que existía. La segunda es donde el schema tiene efecto documentado, porque Google recomienda JSON-LD como formato para datos estructurados y lo usa para construir entidades. La tercera es la más discutida.
¿El schema sube posiciones? No de forma directa. Google mantiene que no existen requisitos específicos de schema para aparecer en AI Overviews más allá de ser elegible en Search. Los datos estructurados afectan a la presentación y a la comprensión, no a la posición.
¿Lo lee ChatGPT? No está confirmado. No existe documentación pública de OpenAI que declare que ChatGPT use JSON-LD durante el grounding. Debe tratarse como NO CONFIRMADO. Lo que sí es público es que ChatGPT Search se apoya en índices de terceros y en fuentes recuperadas, un patrón que conviene entender antes de preguntarte por qué ChatGPT no recomienda tu marca.
¿JSON-LD o microdatos? JSON-LD. Es el formato recomendado por Google, permite @graph y @id para desduplicar entidades, se inyecta sin tocar el HTML visible y es más mantenible desde un CMS o un PIM. Los microdatos (itemprop incrustado en el marcado) son más frágiles y semánticamente más pobres, como se detalla en el análisis de Schema.org frente a itemprop.
Gemini funciona con una lógica distinta: su grounding se apoya en el índice de Google Search, según la documentación de Google Cloud actualizada el 21 de septiembre de 2026. Eso significa que la elegibilidad en Search y la configuración de rastreo condicionan directamente lo que Gemini puede recuperar.
Qué tipos y propiedades implementar (stack mínimo viable)
No hace falta implementar los 800 tipos de Schema.org. Hace falta cubrir las entidades que un modelo necesita para responder "¿quién es esta marca y qué ofrece?".
| Tipo | Propiedades clave | Para qué sirve |
|---|---|---|
Organization / LocalBusiness |
@id, legalName, vatID, iso6523Code, foundingDate, sameAs, knowsAbout |
Identidad canónica de la marca y desambiguación |
WebSite |
@id, url, inLanguage, publisher |
Ancla del grafo y relación con la organización |
BreadcrumbList |
itemListElement, position |
Jerarquía del sitio y contexto de navegación |
Article / BlogPosting |
headline, author, datePublished, dateModified |
Autoría y frescura del contenido |
Product + Offer |
sku, gtin13, mpn, price, availability, priceValidUntil |
Ficha de producto legible por máquina |
Review / AggregateRating |
ratingValue, reviewCount, author |
Señales de validación social |
MerchantReturnPolicy / OfferShippingDetails |
returnPolicyCategory, shippingRate |
Condiciones comerciales verificables |
FAQPage |
mainEntity, Question, acceptedAnswer |
Claridad semántica de preguntas frecuentes |
Las propiedades que más peso tienen en GEO son @id, sameAs y knowsAbout. @id convierte la entidad en un nodo referenciable; sameAs la vincula a fuentes externas inequívocas como Wikipedia, Wikidata o LinkedIn; knowsAbout declara explícitamente las áreas de especialización. Sin estas tres, el resto del grafo pierde cohesión.
Bloque mínimo de Organization con @id, sameAs y knowsAbout:
{
"@context": "https://schema.org",
"@type": "Organization",
"@id": "https://tudominio.com/#organization",
"name": "Tu Marca",
"legalName": "Tu Marca S.L.",
"url": "https://tudominio.com",
"logo": "https://tudominio.com/logo.png",
"sameAs": [
"https://es.wikipedia.org/wiki/Tu_Marca",
"https://www.wikidata.org/wiki/Q000000",
"https://www.linkedin.com/company/tu-marca"
],
"knowsAbout": ["comercio electrónico", "datos estructurados", "visibilidad en IA"]
}
FAQPage en 2026: sigue siendo válido, pero no para rich results de Google
FAQPage continúa siendo un tipo válido en Schema.org y sigue aportando claridad semántica. Lo que cambió es su explotación por parte de Google:
- 12/06/2025: Google retiró siete tipos de datos estructurados (Book Actions, Course Info, Claim Review, Estimated Salary, Learning Video, Special Announcement y Vehicle Listing).
- 07/05/2026: los rich results de FAQ dejaron de mostrarse en los resultados de búsqueda.
La conclusión operativa no es eliminar el marcado. Es mantenerlo por tres razones: otros motores y asistentes siguen procesando el contenido, la estructura pregunta/respuesta mejora la recuperación de fragmentos y el marcado ordena la información para cualquier parser futuro. Lo que ya no tiene sentido es implementarlo esperando un desplegable en Google.
Cómo implementarlo en WordPress sin romper nada
El problema real no es escribir JSON-LD, sino evitar que el CMS genere tres versiones de la misma entidad. Los plugins SEO inyectan por defecto Organization, WebSite y Article en un @graph, y cuando se activa un segundo plugin de schema aparecen dos nodos Organization con @id distintos. El resultado es un grafo contradictorio que obliga al modelo a elegir, y esa elección no siempre favorece a la marca.
Checklist de auditoría de schema en WordPress:
- Extraer el HTML de la home y de una ficha de producto y localizar todos los bloques
application/ld+json. - Listar cada
@typey cada@idpresente para detectar nodos repetidos. - Verificar que existe un único
Organizationcon@idcanónico y que el resto de nodos lo referencian. - Comprobar si
sameAsyknowsAboutestán presentes; la mayoría de plugins no los cubren. - Validar con Rich Results Test (elegibilidad en Google) y con Schema Markup Validator (validez sintáctica y de vocabulario).
- Revisar que
ProductincluyeOffer,availabilityypriceValidUntilsi el sitio vende. - Documentar el estado inicial antes de tocar nada, para poder comparar después.
Vías de implementación comparadas:
| Vía | Control sobre @id y @graph |
Cobertura de knowsAbout/sameAs |
Mantenimiento |
|---|---|---|---|
| Semly (plataforma externa) | Alto: genera JSON-LD desduplicado e inyecta vía API key en WooCommerce/WordPress | Sí, de forma nativa | Automatizado, con auditoría continua del Agente Leon sobre schema.org, llms.txt y robots.txt |
| Plugin SEO generalista | Medio: @graph propio, difícil de extender |
Limitada | Manual |
| Plugin específico de schema | Medio-alto, pero puede colisionar con el plugin SEO | Parcial | Manual |
Inyección manual en functions.php |
Total | Total | Alto coste técnico y riesgo en cada actualización |
¿Por qué salen duplicados? Porque cada plugin declara su propio @id para la organización y ninguno sabe de la existencia del otro. La solución es decidir una única fuente de verdad para la entidad y desactivar el resto.
¿Cómo añado knowsAbout si mi plugin no lo permite? Con un filtro que extienda el @graph existente o con una inyección externa que genere el bloque completo. Semly cubre este caso desde su capa de datos estructurados JSON-LD, disponible desde el plan Premium (49 €/mes), con planes Ultra (119 €/mes) y Scale (239 €/mes) para mayor volumen de prompts y artículos.
¿Cómo valido? Rich Results Test para elegibilidad, Schema Markup Validator para corrección formal, y una comprobación manual del @graph para confirmar que no hay entidades huérfanas.
El rol de Google-Extended y robots.txt en la visibilidad de marca en IA
Google-Extended es un token de robots.txt que controla si el contenido puede usarse para entrenar modelos Gemini y para el grounding en Gemini Apps y Vertex AI. La documentación oficial de Google es explícita en dos puntos: no afecta a Google Search y no es una señal de ranking.
Ejemplo de directiva que permite el uso:
User-agent: Google-Extended
Allow: /
Ejemplo de directiva que lo bloquea:
User-agent: Google-Extended
Disallow: /
La advertencia es clara: no bloquear por inercia. Muchos sitios copiaron configuraciones de robots.txt que restringían crawlers de IA sin evaluar el impacto. Si el objetivo es que Gemini pueda recuperar y citar el contenido, bloquear Google-Extended elimina esa posibilidad, porque Gemini no usa páginas que lo hayan bloqueado. Y como el bloqueo no mejora ni perjudica el rendimiento en Search, la decisión debe tomarse según la estrategia de visibilidad en IA, no por defecto.
¿Bloquear Google-Extended me quita de Gemini? Sí, condiciona el grounding de Gemini Apps y Vertex AI.
¿Afecta a Google Search? No. Search usa Googlebot, que es un token independiente.
Mencionar no es citar: cómo medir el efecto antes y después
La distinción más útil para evaluar resultados es la diferencia entre Tasa de Mención y Tasa de Citación. La primera mide en qué porcentaje de respuestas aparece la marca; la segunda, en qué porcentaje se incluye además un enlace o referencia a la fuente. El informe de visibilidad de comercio electrónico en IA de Semly (2026), sobre 100 tiendas, 10 sectores, 10.000 prompts, 4,5 millones de respuestas y 5 entornos de IA, registró una visibilidad media que pasó del 11,8% al 22,6% en 90 días, mientras la Tasa de Citación avanzó del 2,7% al 6,8%. La brecha entre ambas cifras es la conclusión: aparecer no equivale a ser citado, algo que conviene tener claro al medir la visibilidad de la marca en AI.
El estudio de Ahrefs publicado el 11 de mayo de 2026 siguió 1.885 páginas que añadieron JSON-LD entre agosto de 2025 y marzo de 2026, comparadas con 4.000 páginas de control. Los resultados fueron AI Overviews −4,6%, AI Mode +2,4% y ChatGPT +2,2%. Los dos últimos valores son indistinguibles de cero. El 53% de las páginas citadas por IA tenían schema, pero eso es correlación, no causalidad.
Mini-checklist de medición:
- Definir 20-50 prompts de control representativos de la intención comercial.
- Registrar la línea base de Tasa de Mención, Tasa de Citación, SOV y posición media antes de tocar el schema.
- Seleccionar páginas test y páginas control con características comparables.
- Aplicar el cambio solo al grupo test y mantener el control sin modificaciones.
- Fijar una ventana de observación de al menos 30 a 90 días.
- Monitorizar también fuentes y competidores, porque una variación puede deberse a cambios en el corpus recuperado.
- Comparar la evolución de ambos grupos con un diseño de diferencias en diferencias.
Semly monitoriza prompts, fuentes, SOV y Tasa de Citación en ChatGPT, Gemini, Claude, Google AI y Grok, con informes cada 24 horas, lo que permite mantener el grupo de control bajo observación continua durante toda la ventana de medición. Es el mismo enfoque que se describe al medir el impacto de content y PR en ChatGPT y Gemini.
Conclusión: el schema como infraestructura de entidad, no como atajo
Los datos estructurados no son una palanca mágica ni un factor de ranking confirmado. Son la base de claridad sobre la que se construye todo lo demás: un Organization con @id canónico, un sameAs que apunta a fuentes inequívocas y un knowsAbout que declara la especialización real de la marca. Sin esa base, cualquier modelo tiene que adivinar.
La visibilidad en IA es el resultado de un sistema, no de un plugin. Ese sistema combina contenido que responde a intenciones reales, una entidad bien definida, recuperabilidad técnica (incluida la configuración de Google-Extended) y medición rigurosa antes y después. Cada una de esas capas se puede mejorar por separado, pero solo funcionan juntas, tal como se explica en la guía de las cuatro capas de SEO: SXO, AIO, GEO y AEO.
El siguiente paso práctico es auditar el @graph actual, decidir una única fuente de verdad para la entidad y establecer la línea base de medición antes de cambiar nada. Semly cubre ese recorrido completo: integración con WooCommerce y WordPress mediante API key, generación e inyección de datos estructurados JSON-LD y auditoría continua con el Agente Leon sobre schema.org, llms.txt y robots.txt.
Preguntas frecuentes
¿El schema FAQ sigue sirviendo en 2026?
Sí, como tipo de Schema.org. Lo que dejó de existir el 07/05/2026 es el rich result de FAQ en Google. Mantener FAQPage aporta claridad semántica y facilita la recuperación de fragmentos por parte de otros motores y asistentes.
¿Qué schema es imprescindible para que la IA entienda mi marca?
Organization o LocalBusiness con @id canónico, sameAs y knowsAbout. A partir de ahí, WebSite, BreadcrumbList y el tipo correspondiente al contenido (Article, Product).
¿JSON-LD o microdatos?
JSON-LD. Es el formato recomendado por Google, permite @graph y @id para desduplicar entidades y se mantiene sin modificar el HTML visible.
¿Añadir schema garantiza que ChatGPT me cite? No. No existe confirmación oficial de que ChatGPT use JSON-LD durante el grounding. El schema mejora la comprensión de la entidad, pero la citación depende de múltiples factores de recuperación y contenido.
¿Cuánto tiempo hay que esperar para ver resultados? La ventana mínima razonable es de 30 a 90 días, con páginas test y control. Los cambios en la capa de indexación y en el corpus recuperado no son inmediatos.
Mini-glosario
@id: identificador único y persistente de una entidad dentro del grafo. Permite que otros nodos la referencien sin duplicarla.@graph: contenedor que agrupa varios nodos JSON-LD en un solo bloque, con relaciones explícitas entre ellos.sameAs: propiedad que enlaza la entidad con URLs que la identifican inequívocamente, como Wikipedia o Wikidata.knowsAbout: propiedad que declara las áreas de conocimiento o especialización de una organización o persona.- Grounding: proceso por el cual un modelo recupera información externa en tiempo real para fundamentar su respuesta.
¿Qué implemento primero? Árbol de decisión
- Sitio corporativo o de servicios:
Organizationcon@id,sameAsyknowsAbout, másWebSiteyBreadcrumbList. Después,Articleen el blog. - E-commerce:
Organizationcomo base, seguido deProduct+Offerconsku,gtin13,availabilityypriceValidUntil. AñadirReview,MerchantReturnPolicyyOfferShippingDetails, siguiendo las claves de AEO y GEO para el comercio electrónico. - Negocio local:
LocalBusinesscon dirección,areaServedy horarios, mássameAsa perfiles verificados. - Sitio con contenido editorial:
ArticleoBlogPostingconauthor,datePublishedydateModified, másFAQPagedonde existan preguntas reales de usuarios.
En todos los casos, el orden es el mismo: primero la entidad, después el contenido, después la medición.