No existe un algoritmo único y público que explique exactamente cómo ChatGPT, Perplexity o Gemini eligen qué fuentes citar — pero los patrones observables son coherentes entre motores.
1. Respuesta directa, no introducción
Las páginas que responden a la pregunta implícita en los primeros 100-150 caracteres se extraen más fácilmente que las que tienen una larga introducción antes de ir al grano. Un LLM (como un lector apresurado) prefiere no tener que "excavar".
2. Datos estructurados como atajo de confianza
Un bloque Organization o FAQPage en JSON-LD no "convence" a un LLM por sí solo, pero reduce la ambigüedad: nombre oficial, sitio, tipo de entidad se convierten en hechos ciertos en lugar de inferencias del texto.
3. Coherencia entre páginas (entity consistency)
Si el nombre de la marca, la dirección o la descripción cambian ligeramente de una página a otra, a un motor le cuesta reconocer que es la misma entidad — y en la duda, cita la fuente menos ambigua, aunque sea menos completa.
4. La accesibilidad técnica es lo primero
Nada de esto importa si el bot del motor ni siquiera puede leer el sitio: un robots.txt que bloquea a GPTBot o ClaudeBot excluye al sitio de la competición antes de que empiece.
¿Quieres saber cuáles de estos puntos cumple hoy tu sitio? Haz un análisis gratuito: el informe los enumera uno por uno con la corrección lista para descargar.