La revista científica Latitude: Multidisciplinary Research Journal, editada por Quality Leadership University (QLU) en Ciudad de Panamá, ha publicado en su volumen 2, número 24 (2026), el estudio «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», firmado por Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. El trabajo, disponible en acceso abierto, es el primer resultado publicado de la línea de investigación sobre Generative Engine Optimization (GEO) que Centria Group desarrolla junto a instituciones académicas y universitarias de cuatro países.
El artículo responde a una pregunta que el marketing digital todavía no sabe contestar con rigor: cuando un asistente de inteligencia artificial recomienda un banco, un seguro o un hotel, ¿cómo se mide si una marca está presente en esa respuesta, con qué prominencia y con qué fiabilidad? Para responderla, el equipo realizó una revisión de alcance (scoping review) siguiendo la metodología del Joanna Briggs Institute (JBI) y reportada conforme a la extensión PRISMA-ScR, que mapea de forma sistemática cómo la literatura emergente mide la presencia, la visibilidad y la citación de fuentes y marcas en los motores generativos.
«Durante casi dos décadas, la visibilidad digital se midió por una capacidad muy concreta: aparecer (y ser pulsado) en una lista de resultados. Hoy el usuario ya no recibe diez enlaces azules: recibe una respuesta sintetizada que integra y reformula varias fuentes, y que las cita de forma parcial o desigual. La pregunta relevante ha dejado de ser si mi enlace aparece y se pulsa, y ha pasado a ser si mi contenido está presente dentro de la respuesta que el usuario realmente lee», explica Néstor Romero, autor corresponsal del estudio y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El texto arranca a partir de una premisa que la propia muestra analizada corrobora mediante datos empíricos: las referencias empleadas por una herramienta conversacional coinciden escasamente con los resultados orgánicos del buscador convencional, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un agente conversacional, circunstancia que anula la extrapolación de métricas y exige replantizar las estrategias de medición. A este escenario se une la tendencia de las búsquedas sin clics, impulsada por las síntesis automáticas dentro de los navegadores: gran parte de las dudas de los internautas se satisfacen actualmente sin que accedan a ninguna página web.
«La cuota de citación es la métrica que la práctica profesional trata como central, y en la literatura académica está formalizada en un único estudio. Esa brecha entre industria y academia es en sí misma un hallazgo», dijo Néstor Romero.
Las cinco preguntas de investigación junto con sus respectivas respuestas
| RQ | Pregunta | Respuesta del estudio |
| RQ1 | ¿Qué familias de métricas se emplean? | Existen siete conjuntos de indicadores parcialmente coincidentes —frecuencia de citación, relevancia posicional, impacto de absorción, clasificación en listados, consistencia, polarización temática y proporción de referencias—, carentes de un enfoque metodológico unificador. |
| RQ2 | ¿Sobre qué unidad de análisis se operacionalizan? | Falta un acuerdo generalizado: el objeto de estudio se desplaza desde el dominio o URL —herencia clásica del posicionamiento web— hacia la entidad corporativa, el informe, el artículo y, en las investigaciones más recientes, los recorridos automatizados de los agentes. Aquellos trabajos con objetos diferentes carecen de comparabilidad directa. |
| RQ3 | ¿Cómo se controla la variabilidad estocástica de los motores? | Tan solo una pequeña parte de los autores implementa réplicas o cálculos formales para gestionar la aleatoriedad. La mayor parte de la literatura recurre a una única consulta o limita el análisis a un periodo específico, obviando la medición del error. |
| RQ4 | ¿Qué evidencia de fiabilidad y validez se reporta? | Ninguna investigación analizada somete sus herramientas a pruebas de validación psicométrica. Tan solo se aprecian supervisiones puntuales y complementarias (consistencia temporal, precisión en las fuentes, validación cruzada y resistencia al sesgo secuencial). La concordancia entre evaluadores apenas se documenta. |
| RQ5 | ¿Existe un instrumento integrado y validado de presencia generativa? | En absoluto. Las pruebas estandarizadas miden el rendimiento de tácticas o variaciones de posición, mas no la validez conceptual de los indicadores; asimismo, las investigaciones principales utilizan parámetros prácticos pero incompletos y carentes de fiabilidad probada. |
Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints
Para contrarrestar las limitaciones individuales de cada estrategia, la búsqueda integró cuatro vías complementarias: un buscador impulsado por inteligencia artificial, consultas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave, y cotejo en un repositorio indexado (Web of Science; Scopus quedó fuera de alcance). Una vez eliminados los duplicados mediante el DOI —evitando el título debido a la elevada coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores examinaron los resúmenes por separado, zanjando los desacuerdos de común acuerdo. En total, se analizaron 36 documentos íntegros, seleccionándose 23 investigaciones originales junto a un par de revisiones catalogadas de manera independiente a modo de marco teórico.
«Una gran porción del saber producido en castellano acerca de este asunto no logra trascender hacia los ámbitos internacionales. Rescatarlo va más allá de un simple afán de completitud: pone al descubierto un prejuicio idiomático latente dentro de la disciplina», puntualizó Néstor Romero.
Siete grupos de indicadores y ningún modelo que los unifique
El mapeo reconoce siete agrupaciones de indicadores que se superponen parcialmente —aparición o mención, visibilidad o emplazamiento, asimilación o peso, posicionamiento en listados, consistencia, tono o enfoque y porción de menciones— y que operan careciendo de un estándar unificador común. Asimismo, la investigación subraya que el límite conceptual más fructífero de esta disciplina radica en la diferenciación entre la citación, entendida como la selección de una fuente, y la asimilación, definida como la integración real de sus contenidos dentro del texto resultante; esto representa una escisión en un par de niveles de aquello que anteriormente se evaluaba de forma binaria.
El foco analítico se desplaza: de la URL hacia la marca y el recorrido de los agentes
No existe acuerdo universal acerca de lo que se mide con precisión. El corpus muestra una evolución constante que parte de la fuente o la URL —como legado tradicional del SEO— y avanza hacia la marca o entidad, el documento, el artículo y, en las investigaciones más recientes, alcanza unidades de categoría superior como el recorrido de navegación de los agentes. Dicho cambio pone de manifiesto la transformación de la cuestión analítica, aunque esto conlleva un precio: las investigaciones basadas en unidades diversas no resultan directamente equiparables, lo cual imposibilita la ejecución de un metaanálisis.
Tipología de la evidencia disponible
|
Grado de evidencia |
Casos prácticos |
Incidencia en el corpus |
|
Evaluación por benchmark |
GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) |
Predominante |
|
Métrica directa (plataformas reales) |
How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) |
Escasa |
|
Investigación aplicada / sectorial |
GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) |
Restringida |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.
La inteligencia artificial no siempre contesta igual, y prácticamente nadie lo evalúa
Los motores generativos son estocásticos: pueden ofrecer respuestas distintas ante la misma pregunta. Una medición fiable exige, por tanto, repetir las mediciones o modelar explícitamente la incertidumbre. Sin embargo, solo una minoría de los estudios lo hace de forma sistemática. Entre quienes sí lo aplican destacan trabajos con cinco ejecuciones por consulta, con 200 evaluaciones y permutaciones de orden, con análisis de sensibilidad para idioma y paráfrasis, o que tratan la visibilidad como una distribución en lugar de como un valor puntual. La mayoría restante se apoya en una única ejecución.
«Dentro de este ámbito, registrar una única ejecución carece de solidez epistemológica. Todo instrumento fiable necesita integrar la repetición y el análisis de la incertidumbre como una exigencia fundamental, más allá de considerarlo un simple detalle opcional», puntualiza Romero.
El hallazgo central: un campo que mide mucho y valida poco
La conclusión determinante del estudio es que ningún trabajo del corpus somete su instrumento de medición a validación psicométrica en sentido estricto. Lo que existe son controles adyacentes y aislados (métricas de estabilidad, fidelidad de la atribución, triangulación por diseño o robustez al orden), y la fiabilidad intercodificadores, requisito básico de cualquier instrumento, apenas se reporta. La validez, cuando se argumenta, descansa en la coherencia interna de benchmarks creados ad hoc antes que en propiedades de medición. De ahí la conclusión central del mapeo: no existe todavía un instrumento integrado y validado para medir la presencia generativa de marca.
Requisitos para participar
|
Criterio |
Inclusión |
Exclusión |
|
Foco |
Medición u operacionalización de presencia, visibilidad, citación o influencia en motores generativos |
SEO clásico, diseño generativo (CAD), GAN, sistemas de recomendación u otros usos ajenos al dominio |
|
Ventana temporal |
2023-2026 (campo born-digital) |
Anterior a 2023 |
|
Idioma |
Español e inglés |
Otros idiomas sin traducción disponible |
|
Tipo |
Estudio primario de medición, benchmark de evaluación o estudio aplicado con métricas |
Editoriales, artículos de opinión, contenido promocional |
|
Estatus |
Preprints admitidos bajo política de sensibilidad |
Literatura gris autopublicada sin control editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.
«Hallamos un sector donde abunda la medición y escasea la validación. Las propuestas de evaluación no escasean —de hecho, sobran—; lo que realmente escasea es la fiabilidad documentada y la validez de constructo. Y es preciso señalarlo con rigor, pues equiparar un simple benchmark con un instrumento debidamente validado eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.
Una brecha entre la práctica profesional y la academia
El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad industrial otorga un peso determinante y presupone como idóneo para una validez convergente— se sustenta, en la práctica, sobre un único trabajo de investigación. Por otra parte, las categorías de tono y perspectiva presentan una escasez similar, a pesar de que la investigación más amplia del conjunto, centrada en el análisis de más de cien marcas, las señala como el indicador más volátil de todo el grupo.
«La visibilidad en Google no garantiza la presencia en un asistente generativo, lo que invalida la transferencia directa de métricas y exige replantear tanto qué evaluamos como la manera de hacerlo».
«La visibilidad generativa se puede manipular, lo cual impone a la medición una exigencia que por regla general no se le pide: la solidez ante la manipulación en calidad de atributo del instrumento.»
La ciencia en español, invisible: una lección metodológica
Asimismo, este análisis arroja una aportación metodológica de notable interés para el ámbito hispanohablante. Hay un corpus de estudios en castellano, difundido en publicaciones de Biblioteconomía y Documentación, que examina la visibilidad frente a la inteligencia artificial generativa desde perspectivas diversas —tales como la inestabilidad de las marcas en las sugerencias de viajes elaboradas por IA, o el ajuste de archivos académicos para facilitar su indexación por parte de motores generativos—, aspectos que los textos en inglés suelen omitir. Dicha literatura únicamente pudo recuperarse a través de consultas en múltiples idiomas, lo que pone de manifiesto un sesgo idiomático implícito en esta disciplina.
A esto se añade una segunda enseñanza derivada del propio procedimiento: el cotejo en una base indexada arrojó 360 entradas en bruto, de las cuales se examinaron las 136 disponibles en abierto —en su gran mayoría interferencias temáticas debidas a la coincidencia de palabras—, sin que se sumara ninguna nueva investigación válida de medición. En resumen, el ámbito se caracteriza por priorizar los preprints y sufrir una cobertura insuficiente en los índices convencionales; de hecho, el 64 % de los textos preliminares se divulga mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil catalogado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Proceso de elección de estudios (PRISMA-ScR, dos ramas)
|
Fase |
Resultado |
|
Rama de descubrimiento (Consensus) |
Se identificaron 70 registros; 23 se descartaron antes del filtrado (duplicados por DOI, depuración y falsos positivos debidos a colisión de siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron a texto completo |
|
Rama de otros métodos |
Se sumaron 18 registros adicionales (mediante rastreo de citas, OpenAlex y comprobación en base indexada); se obtuvieron 15 candidatos para análisis de texto completo |
|
Verificación en Web of Science |
Arrojó 360 registros brutos; se revisaron 136 (por acceso abierto); no se halló ningún estudio de medición elegible nuevo |
|
Evaluación a texto completo |
Se analizaron 36 informes; 13 se descartaron por quedar fuera del alcance o carecer de medición directa de la presencia |
|
Inclusión final |
Se integraron 23 investigaciones primarias en la síntesis, además de 2 revisiones incorporadas como marco conceptual |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los autores detallan que las cifras correspondientes a la identificación y el cribado son definitivas, mientras que aquellas relativas a la evaluación del texto íntegro y la incorporación siguen siendo provisionales.
La visibilidad generativa se puede manipular
Cierta parte de la investigación analizada evidencia que la exposición en los motores generativos resulta manipulable de manera adversarial, ya sea a través de tácticas de alteración de posiciones en los buscadores conversacionales o mediante la optimización discreta de prompts. Dicha investigación traslada esta conclusión al ámbito de la métrica: la solidez frente a los intentos de manipulación tendría que integrar el conjunto de atributos indispensables para cualquier herramienta de visibilidad.
«Un benchmark evalúa si una táctica funciona o si un ítem cambia de rango; no si una métrica mide válidamente un constructo. Confundir los dos niveles infla la madurez aparente del campo».
«En este ámbito, evaluar un único intento resulta epistemológicamente endeble; los sistemas generativos son capaces de ofrecer respuestas diferentes ante idéntica consulta».
Qué viene ahora: del diagnóstico al instrumento
Los investigadores concluyen que la carencia hallada —en lo referente a la validez de constructo y a la fiabilidad constatada— representa el resquicio que legitima la creación y validación formal de un indicador específico de presencia generativa, planteando dicha labor como la prolongación lógica del estudio difundido, y descartándola como una hipótesis ya ratificada. Se trata justamente de la senda en la que el grupo se encuentra laborando durante la etapa posterior.
«Nuestro propósito consiste en transitar desde el diagnóstico hasta la utilidad práctica: diseñar y contrastar un indicador que cualquier entidad, independientemente de su dimensión, logre emplear para medir con rigor científico el posicionamiento de su marca cada vez que la inteligencia artificial emita una respuesta al respecto», señala Néstor Romero.
Limitaciones expresadas por los creadores
El texto deja claros sus propios confines: la fragilidad de los datos en un ámbito tan incipiente y plagado de preprints, lo cual vuelve provisionales sus deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de referencias y el cotejo indexado—; la acotada cobertura idiomática al inglés y al español junto a la carencia de acceso institucional para constatar en Scopus; el etiquetado efectuado de manera parcial sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propia ejecución; y la caducidad temporal intrínseca a cualquier análisis de un sector fundamentado en tecnologías propietarias en mutación constante.
Resulta indispensable considerar estas restricciones con el fin de evaluar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».
.jpg)


