Nadie puede garantizarte resultados en GEO
(posicionamiento en ChatGPT y otras IA)
Autor
Carlos Beuvrin
Publicado
jul 2026

Si alguien te está vendiendo "posicionamiento garantizado en ChatGPT", vale la pena hacerle una pregunta muy simple antes de firmar: ¿garantizado medido cómo, y contra qué línea base?
La respuesta suele desarmar la propuesta completa. No porque el GEO sea humo en su totalidad, sino porque el sistema sobre el que se promete control es, por diseño, no determinista. Y eso no es una opinión de mercado: está medido.
Primero: ¿qué es el GEO?
GEO son las siglas de Generative Engine Optimization, u optimización para motores generativos. Es el equivalente del SEO, pero para los sistemas de IA que responden con texto en vez de con una lista de enlaces: ChatGPT, Perplexity, Claude, los resúmenes de IA de Google. El objetivo ya no es aparecer en el primer resultado, sino que la IA te mencione cuando alguien le pregunta a quién contratar.
Es un campo legítimo y hay trabajo real que hacer en él. El problema no es el GEO: es lo que se promete sobre el GEO.
El dato que rompe la promesa
Rand Fishkin (SparkToro) y Patrick O'Donnell (Gumshoe.ai) hicieron el experimento más directo posible: 600 voluntarios ejecutaron 12 prompts idénticos en ChatGPT, Claude y la IA de Google, alrededor de 3,000 veces en total.
El resultado: la probabilidad de obtener la misma lista de marcas dos veces fue menor a 1 en 100. La probabilidad de obtener la misma lista en el mismo orden rondó 1 en 1,000. Es decir, alrededor del 0.1%.
Misma pregunta. Mismo modelo. Mismo día. Y la respuesta prácticamente nunca se repite. Ni siquiera la longitud es estable: la misma consulta devolvía a veces 2 o 3 opciones y a veces más de 10.
Ahora piensa en lo que implica: el ordenamiento completo que te muestra un reporte —"estas cinco marcas, en este orden"— tiene alrededor de 1 en 1,000 probabilidades de volver a ocurrir. No es una métrica. Es la fotografía de un dado en el aire.
Ojo con el matiz, porque importa para no exagerar el argumento: ese 1 en 1,000 aplica a la lista completa en el mismo orden, no a que una marca individual reaparezca. Que tu marca vuelva a salir es bastante más probable que eso. Lo que colapsa no es la presencia: es la posición.
No es un error del sistema. Es el sistema.
La reacción intuitiva es pensar "bueno, es ruido, con suficientes mediciones se promedia". Parcialmente cierto, y ahí está el problema de fondo.
Un análisis de descomposición de varianza sobre 12,933 respuestas (GPT-5.2, Gemini 3 Flash y Perplexity, a temperatura 0.3) intentó responder exactamente esto: de toda la variación que vemos en si una marca aparece o no, ¿cuánto se debe realmente a la marca?
La respuesta es incómoda:
| Fuente de la varianza | Peso |
|---|---|
| Idioma de la consulta | 26.5% |
| Residual (interacciones + remuestreo) | 69.3% |
| Identidad del modelo | 1.6% |
| Identidad de la marca | 1.5% |
| Prompt específico | 1.1% |
La marca —lo único que tu agencia puede tocar— explica alrededor del 1.5% de la varianza. Una sola respuesta de IA tiene una correlación intraclase de 0.0146 para discriminar entre marcas; los autores lo describen como "casi ninguna señal discriminante de marca".
Traducción práctica: una consulta suelta a ChatGPT sobre tu marca no contiene información útil. No es poca información. Es esencialmente cero.
Y hay un detalle más: al descomponer el residual sobre un subconjunto de estabilidad (7,173 respuestas), 34.8% de la varianza viene del remuestreo dentro del mismo prompt — el modelo eligiendo una continuación distinta ante una entrada idéntica, incluso a temperatura baja. Es aleatoriedad estructural, no falta de optimización.
Lo que la investigación dice sobre las tácticas GEO
Aquí es donde la conversación se pone verdaderamente interesante. Un survey crítico de la literatura GEO 2023–2026 revisó lo que realmente sostiene la evidencia.
Sobre el famoso "+40% de visibilidad". Es la cifra que aparece en casi todas las propuestas comerciales, tomada del paper fundacional de GEO. El survey aclara que ese 40% aplica únicamente a un documento que ya estaba dentro de un contexto fijo de cinco documentos entregados al generador. No mide descubribilidad orgánica. No mide tráfico. El experimento subyacente es real; la afirmación comercial "GEO aumenta tu visibilidad 40%" aparece clasificada por el survey como rechazada.
Sobre la transferibilidad de las "recetas". En el benchmark C-SEO Bench, solo 3 de 54 combinaciones método–dominio mostraron significancia estadística — y ninguna resultó positiva en preguntas y respuestas. Lo que funciona en un vertical típicamente no funciona en otro.
Sobre optimizar el contenido de la página. En SAGEO Arena, optimizar solo el cuerpo del texto redujo la presencia en top-20 en 9%, la presencia en top-10 en 16% y la citación final en 6%. Las ganancias aparentes se evaporaron —o se revirtieron— al incluir las etapas de recuperación completas.
Sobre keyword stuffing y "tono autoritativo". Resultados nulos o negativos de forma consistente. Los efectos de fluidez y tono son débiles e inestables.
Sobre cuántas mediciones hacen falta. Los scores Jaccard a nivel de fuente entre días caen a 0.34–0.42, lo que implica un mínimo de 7 a 8 repeticiones por prompt solo para tener un punto de partida.
Sobre un sesgo de medición que casi nadie declara. En el 57.8% de las repeticiones, ChatGPT ni siquiera activó búsqueda web. Si tu herramienta solo analiza respuestas que contienen citas, estás midiendo una muestra sesgada de tu propio desempeño.
Y la conclusión general del survey: ninguna técnica revisada demostró un efecto causal estable, longitudinal y multiplataforma sobre descubribilidad orgánica o comportamiento del usuario. La confianza en que "más citaciones ⇒ más clics, conversiones o ingresos" está clasificada como muy baja.
El terreno se mueve solo
Aun si consiguieras un resultado hoy, no es tuyo para conservar.
- La reformulación lo cambia todo. En una prueba de sensibilidad sobre 30 pares de consultas y siete modelos, en Gemini todos los pares cambiaron los dominios citados al reformular la pregunta.
- Un cambio de proveedor reescribe el tablero. Si un motor ampliamente usado actualiza sus reglas de recuperación, los resultados cambian simultáneamente para toda la población de usuarios. Tú no participaste en esa decisión y no te avisaron.
- No hay un ranking unificado. El 53% de los dominios citados por los resúmenes de IA de Google no aparecen en el top 10 orgánico. Optimizar para uno no te da el otro.
- La ventaja se erosiona sola. C-SEO Bench documentó decaimiento conforme aumenta la adopción: dinámicas congestionadas que se aproximan a suma cero. Cuando todos aplican la misma táctica, la táctica deja de ser una ventaja.
Entonces, ¿todo es humo?
No, y este es el punto donde la honestidad se vuelve más útil que el cinismo. Hay señal real debajo del ruido, y hay hallazgos que apuntan en dirección optimista:
- En el mismo estudio de Fishkin, ciertos nombres aparecieron en el 60%–90% de las respuestas para una intención dada. El patrón se concentra en mercados pequeños y consolidados; las categorías masivas se dispersaron en caos. Es decir: el ordenamiento es aleatorio, pero la pertenencia al conjunto puede ser bastante estable.
- Un análisis de Peec AI sobre 37,804 respuestas en cinco motores encontró que el fraseo del prompt importa menos de lo que asume la industria: la visibilidad de marca se mantiene estable mientras la intención central se conserve.
- El survey clasifica con confianza moderada que la evidencia extraíble —estadísticas, definiciones, citas textuales— produce ganancias bajo condiciones controladas. No es lo mismo que una garantía, pero es de lo más sólido que hay sobre la mesa.
Nada de esto es una garantía. Es algo mejor: es una base para trabajar con expectativas correctas.
Cómo leer una propuesta de GEO
Señales de alarma:
- "Garantizamos posición #1 en ChatGPT." El ordenamiento completo se repite ~1 vez de cada 1,000. No existe un #1 estable que garantizar.
- "Aumentamos tu visibilidad 40%." Pregunta de qué paper viene ese número y a qué condición aplica.
- Reportes basados en una consulta por prompt. Hacen falta 7–8 repeticiones mínimo, y multi-idioma cuando aplique. Una consulta es anécdota.
- Silencio sobre el idioma. El idioma pesa 26.5% de la varianza —más que modelo, marca y prompt juntos. Una propuesta que no lo menciona no leyó la evidencia.
- Ausencia de línea base declarada. Sin una tasa de aparición inicial medida con método, "mejoramos" no significa nada.
Lo que sí puede prometer honestamente un buen proveedor:
- Medición con metodología declarada: número de repeticiones, prompts, idiomas, motores, fechas.
- Tasa de aparición (share of voice) como métrica, no posición.
- Trabajo sobre lo que sí está bajo tu control: presencia y consistencia en las fuentes que estos sistemas efectivamente recuperan, datos estructurados, evidencia extraíble y citable, y reputación en terceros.
- Intervalos de confianza, no promesas puntuales.
El cierre
La diferencia entre un proveedor serio y uno que vende humo no es el conocimiento técnico. Muchas veces es el mismo. La diferencia es qué hace con la incertidumbre: la declara o la esconde.
Un sistema donde la misma pregunta devuelve el mismo ranking una de cada mil veces no admite garantías de posición. Admite método, medición honesta y expectativas calibradas. Quien te ofrezca más que eso, o no leyó la evidencia, o cuenta con que tú no la leíste.
Fuentes
- AI recommendation lists repeat less than 1% of the time — Search Engine Land (estudio de Rand Fishkin / SparkToro y Patrick O'Donnell / Gumshoe.ai)
- Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers — arXiv
- Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026) — arXiv
- Position: Generative Engine Optimization Creates Underexamined Risks — arXiv
- Prompt Tracking: Does prompt variance % impact brand mentions? — Search Engine Journal (estudio de Peec AI)
- GEO: Generative Engine Optimization — paper fundacional, arXiv
