Un benchmark competitivo LLM mide a quién citan ChatGPT, Perplexity y Gemini cuando un cliente hace una pregunta en su mercado, tanto a usted como a sus competidores. El objetivo no es el ranking de Google, sino su cuota de citas en las respuestas generativas. El método consta de seis pasos: construir una lista de prompts que refleje el recorrido de compra, ejecutarlos en cada modelo en condiciones estandarizadas, registrar las marcas citadas en una matriz prompts × modelos, calcular su cuota de citas frente a la competencia, priorizar las acciones y volver a medir cada mes. El resultado es un mapa preciso de su visibilidad IA: en qué preguntas existe, en cuáles un competidor ocupa el espacio en solitario y dónde la ventana sigue abierta. Es el punto de partida de toda estrategia GEO seria, porque solo se corrige lo que se mide. Este es el protocolo exacto, reproducible cada mes.
Por qué hacer benchmark en los LLM
Porque sus prospectos ahora hacen sus preguntas a un modelo antes de abrir Google. Si ChatGPT recomienda tres competidores y nunca su marca, pierde la venta antes incluso de entrar en la carrera. El benchmark competitivo LLM mide exactamente esa brecha.
La lógica difiere del SEO clásico. En la búsqueda tradicional, sigue su posición en una consulta. En lo generativo, no hay página de resultados: el modelo sintetiza una respuesta y cita unas pocas marcas. La métrica correcta ya no es el rango, sino la cuota de citas: sobre el conjunto de prompts de su mercado, cuántas respuestas le mencionan y cuántas mencionan a cada competidor.
Esta distinción es medible y estratégica. Las señales que disparan una cita IA no son las que determinan el ranking de Google. El análisis de Ahrefs sobre 200 000 dominios (dic. 2025) muestra que las menciones de marca off-site correlacionan más con las citas IA (YouTube 0,737, Reddit, Wikipedia) que el Domain Rating (0,266). Puede dominar el SEO y seguir invisible en ChatGPT. El solapamiento es bajo: apenas el 11 % de los dominios son citados a la vez por ChatGPT y por las AI Overviews.
Un benchmark LLM no mide su rango, sino su cuota de citas en las respuestas generativas, usted y sus competidores incluidos. Es la única métrica que refleja lo que realmente ve un prospecto que consulta a una IA.
Antes de medir, defina el perímetro: su mercado, sus tres a cinco competidores directos y las preguntas que se hace un comprador. Es la base de un enfoque estructurado de agencia GEO, donde cada cifra alimenta una decisión y no una intuición.
Construir la lista de prompts
Todo depende de la calidad de sus prompts. Un benchmark solo vale por la representatividad de las preguntas probadas: deben reproducir lo que pide un prospecto real, no lo que a usted le gustaría que pidiera.
Estructure la lista según el recorrido de compra, en tres familias. Este reparto evita el sesgo clásico de probar solo consultas de marca, donde siempre gana y no aprende nada.
Las tres familias de prompts
| Familia | Intención | Ejemplo de prompt |
|---|---|---|
| Descubrimiento | El prospecto explora un problema, sin solución en mente | «¿Cómo mejorar la visibilidad de mi sitio en ChatGPT?» |
| Comparación | El prospecto compara enfoques o proveedores | «Mejores agencias GEO en Francia en 2026» |
| Decisión | El prospecto quiere validar una elección concreta | «¿Qué agencia para optimizar mi visibilidad IA en Albi?» |
Apunte a entre 20 y 40 prompts en total, repartidos entre estas familias. Por debajo de 20, una sola respuesta atípica distorsiona sus porcentajes. Formúlelos en lenguaje natural, como se le habla a un asistente, y no en palabras clave telegráficas. Varíe los ángulos: «mejor», «cómo elegir», «alternativas a», «para [sector]».
Incluya sistemáticamente prompts donde espere ver a sus competidores. Ahí es donde el benchmark se convierte en una herramienta competitiva y no en un simple test de ego. Documente también cada prompt en variantes cercanas: los modelos son sensibles a la formulación, y una pregunta reformulada puede hacer aparecer o desaparecer una marca.
Ejecutar el test en cada modelo
Lance cada prompt en cada modelo en condiciones estandarizadas, de lo contrario los resultados no son comparables de una ola a otra. El protocolo cuenta tanto como los prompts.
Pruebe en navegación privada o en una cuenta dedicada, sin memoria ni personalización activada. El historial de una cuenta personal sesga las respuestas hacia sus propias búsquedas pasadas.
Ejecute cada prompt en ChatGPT, Perplexity y Gemini como mínimo. Se apoyan en mecanismos de cita distintos y no devuelven las mismas marcas.
Para cada respuesta, anote cada marca o dominio mencionado, su posición en la respuesta y si se cita como fuente o se recomienda en el texto.
Conserve una captura o el texto bruto de cada respuesta. Los modelos evolucionan; sin archivo, no podrá verificar ni comparar al mes siguiente.
Los LLM no son deterministas. Lance cada prompt dos veces y registre la presencia de una marca si aparece al menos una vez.
Un detalle técnico pesa mucho en los resultados: los LLM no ejecutan JavaScript. Si el contenido de sus páginas se carga del lado del cliente, el crawler del modelo solo ve una página vacía. El renderizado del lado del servidor (SSR) o un HTML estático es, por tanto, indispensable para existir en el índice que alimenta estas respuestas. Un competidor ausente de su benchmark pese a una fuerte notoriedad suele tener exactamente este problema.
ChatGPT por sí solo representa un volumen de audiencia que justifica incluirlo en cada benchmark. Ignorar este modelo equivale a ignorar la principal interfaz de búsqueda generativa.
Para comparar las soluciones que automatizan esta recogida a escala, consulte nuestro comparativo de herramientas GEO 2026. La recogida manual basta para una primera ola; una herramienta resulta pertinente en cuanto suben la frecuencia y el volumen.
Leer la matriz de resultados
La matriz es una tabla con prompts en filas, modelos en columnas, y cada celda lista las marcas citadas. Es el objeto central del benchmark: transforma decenas de respuestas en un mapa legible de su visibilidad IA.
Lea la matriz según tres ejes de diagnóstico. Cada configuración de celda cuenta una historia competitiva distinta y exige una acción distinta.
Las tres zonas a detectar
| Configuración de la celda | Qué significa | Prioridad de acción |
|---|---|---|
| Usted + competidores citados | Existe en esta pregunta, el mercado está compartido | Consolidar: reforzar su posición relativa |
| Competidor citado solo | Ocupa el espacio, usted es invisible | Atacar: crear el contenido citable que falta |
| Ninguna marca relevante citada | El modelo improvisa o cita fuera de tema | First mover: ventana abierta para ocupar rápido |
La tercera zona es la más rentable. Cuando ningún actor de su mercado es citado en un prompt de alta intención, la primera marca que publique un contenido factual, estructurado y citable se lo lleva todo. Es lo contrario de una batalla frontal: ocupa un terreno vacío.
Detecte también las diferencias entre modelos. Una marca citada en Perplexity pero ausente de ChatGPT revela una señal de cita precisa a trabajar: sourcing web para uno, notoriedad off-site para el otro. La matriz no solo dice dónde pierde, sino por qué.
Calcular la cuota de citas
La cuota de citas es la puntuación que resume toda la matriz en una sola cifra comparable. Se calcula dividiendo el número de respuestas donde aparece entre el número total de respuestas probadas, y repitiendo la operación para cada competidor.
Sobre 30 prompts × 3 modelos, tiene 90 respuestas. Si su marca aparece en 18 de ellas, su cuota de citas bruta es del 20 %. Haga el mismo cálculo para sus competidores: obtiene un ranking de visibilidad IA que a menudo no tiene nada que ver con el ranking de Google de su mercado. Esta métrica se desarrolla en detalle en nuestra guía sobre la cuota de voz IA, que explica cómo ponderarla por el valor de negocio de cada prompt.
Afine después con dos ponderaciones. Primero la posición: una marca citada como primera recomendación pesa más que una relegada al final de la respuesta. Después el valor del prompt: una cita en una pregunta de decisión vale más que una cita en una pregunta de descubrimiento generalista. Una cuota de citas bruta del 20 % puede ocultar una fuerza real si se concentra en los prompts que convierten.
Una fotografía inmediata de su cuota de citas frente a sus competidores directos está disponible sin montar todo el protocolo: nuestro Score de Visibilidad IA le entrega una primera cifra en pocos minutos, ideal para encuadrar su primera ola de benchmark.
Convertirlo en un plan de acción
Un benchmark sin plan de acción es un informe muerto. Cada zona de la matriz se traduce en un proyecto GEO concreto, priorizado por la brecha entre el valor de negocio del prompt y su ausencia actual.
Priorice según una regla simple: empiece por los prompts de decisión donde un competidor es citado solo, luego los prompts de descubrimiento donde la ventana está abierta. Los primeros recuperan ventas; los segundos construyen autoridad de fondo.
Para cada prompt de decisión donde falta, cree o enriquezca una página que responda directamente a la pregunta, con un pasaje citable autónomo de 134 a 167 palabras situado al inicio.
Añada schema FAQPage en estas páginas: es una señal fuerte para las AI Overviews, que facilita la extracción de sus pares pregunta-respuesta por los modelos.
Donde un competidor domina sin ventaja SEO evidente, refuerce sus menciones en YouTube, Reddit y las fuentes que los modelos privilegian. Es lo que más correlaciona con las citas.
Audite cada página objetivo: si el contenido depende de JavaScript, pase a SSR o HTML estático para que el crawler del modelo vea realmente su texto.
Vincule estas acciones a un diagnóstico estructurado; nuestro método y precio de una auditoría GEO detalla cómo cifrar y secuenciar estos proyectos.
El pasaje citable merece una atención particular. Un párrafo de 134 a 167 palabras, factual y autónomo, que responde por completo a la subpregunta, constituye la unidad que los modelos extraen. Demasiado corto, le falta sustancia; demasiado largo, diluye la respuesta y pierde su citabilidad. Es el formato óptimo observado en los contenidos que efectivamente se citan.
Industrializar el seguimiento mensual
Un benchmark único es una fotografía; el valor llega con la serie. Vuelva a lanzar la misma lista de prompts un mes después, con el mismo protocolo, para medir el movimiento real de su cuota de citas.
Documente cada ola en la misma tabla para seguir la trayectoria. Una cuota de citas que sube ola tras ola es la prueba de que su estrategia GEO funciona, mucho antes de que la facturación lo confirme. Sin una segunda ola, nunca sabrá si sus acciones han movido algo.
Para pasar de la recogida puntual a una vigilancia continua, automatice la detección de citas entre dos olas: nuestro método para seguir sus menciones en ChatGPT explica cómo recibir una alerta en cuanto una respuesta le cita o cita a un competidor, sin relanzar todo el benchmark. Así conserva el beneficio del protocolo mensual captando a la vez los movimientos intermedios.
Las cifras de progresión de un caso cliente siguen siendo ilustrativas: lo que cuenta es su propia curva, medida con un protocolo estable. Un benchmark comparable mes a mes vale más que mil informes impresionantes pero no reproducibles.
Nuestra auditoría GEO gratuita compara su visibilidad frente a sus competidores en ChatGPT, Perplexity y Gemini, y le entrega el plan de acción priorizado.
Questions fréquentes
¿Cuántos prompts hay que probar para un benchmark fiable?+
Cuente entre 20 y 40 prompts por mercado para una primera fotografía representativa. Por debajo de 20, el ruido estadístico distorsiona las conclusiones; por encima de 40, el coste de recogida se dispara sin un avance importante de información. Repártalos entre preguntas de descubrimiento, comparación y decisión para cubrir todo el recorrido de compra.
¿En qué modelos hay que lanzar el benchmark?+
Como mínimo ChatGPT, Perplexity y Gemini, porque cubren la mayor parte de los usos y se apoyan en mecanismos de cita diferentes. ChatGPT supera por sí solo los 900 millones de usuarios semanales. Añada Claude y Google AI Overviews si su audiencia los usa. Pruebe cada modelo en una sesión nueva, sin historial, para evitar la personalización.
¿Con qué frecuencia repetir un benchmark competitivo LLM?+
Una vez al mes basta para seguir una tendencia, ya que las respuestas de los modelos evolucionan con las actualizaciones y el índice web. Conserve la misma lista de prompts y el mismo protocolo de una ola a otra, de lo contrario las variaciones dejan de ser comparables. Un seguimiento trimestral sigue siendo aceptable para un mercado estable y poco competitivo.
¿El benchmark LLM reemplaza el seguimiento de posiciones SEO?+
No, lo complementa. El ranking de Google y la cuota de citas IA solo se solapan parcialmente: apenas el 11 % de los dominios son citados a la vez por ChatGPT y por las AI Overviews. Seguir ambos da una visión completa de su visibilidad, desde el enlace azul hasta la respuesta generativa.
¿Hace falta una herramienta de pago para hacer benchmark de su visibilidad IA?+
No para empezar: una hoja de cálculo y una hora de recogida manual bastan para una primera ola sobre 20 prompts. Una herramienta dedicada resulta útil cuando se escala (más de 40 prompts, varios modelos, seguimiento mensual automatizado) porque fiabiliza la recogida e historiza las olas. La elección depende del volumen y la frecuencia que persiga.



