Nuestro sitio web utiliza cookies para mejorar y personalizar su experiencia y para mostrar anuncios (si los hay). Nuestro sitio web también puede incluir cookies de terceros como Google Adsense, Google Analytics, Youtube. Al usar el sitio web, usted consiente el uso de cookies. Hemos actualizado nuestra Política de Privacidad. Por favor, haga clic en el botón para consultar nuestra Política de Privacidad.

La ciencia todavía no sabe medir con precisión qué tan visible es una marca en la inteligencia artificial

estudio GEO panamá


La revista científica Latitude: Multidisciplinary Research Journal, editada por Quality Leadership University (QLU) en Ciudad de Panamá, ha lanzado en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con la firma de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos dados por la línea investigativa centrada en Generative Engine Optimization (GEO) que Centria Group impulsa en colaboración con centros universitarios y académicos de cuatro naciones.

El artículo responde a una pregunta que el marketing digital todavía no sabe contestar con rigor: cuando un asistente de inteligencia artificial recomienda un banco, un seguro o un hotel, ¿cómo se mide si una marca está presente en esa respuesta, con qué prominencia y con qué fiabilidad? Para responderla, el equipo realizó una revisión de alcance (scoping review) siguiendo la metodología del Joanna Briggs Institute (JBI) y reportada conforme a la extensión PRISMA-ScR, que mapea de forma sistemática cómo la literatura emergente mide la presencia, la visibilidad y la citación de fuentes y marcas en los motores generativos.

«Por espacio de casi veinte años, la presencia online se evaluaba mediante un criterio muy específico: figurar (y recibir clics) en un repertorio de búsquedas. Actualmente, el consumidor ya no se topa con diez vínculos azules; en su lugar, obtiene una contestación condensada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o asimétrica. La cuestión fundamental ha dejado de centrarse en si nuestro enlace sobresale y es accionado, transformándose en averiguar si nuestra información figura explícitamente en la solución que el internauta consume de verdad», señala Néstor Romero, investigador firmante de la investigación y COO de Centria Group.

Del clic a la respuesta: por qué las métricas del SEO dejan de servir

El texto arranca a partir de una realidad que la propia muestra analizada corrobora mediante datos empíricos: los enlaces seleccionados por una herramienta generativa coinciden escasamente con los resultados del posicionamiento orgánico clásico, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un chat inteligente, lo cual invalida la extrapolación automática de métricas y exige replantificar los métodos y objetos de medición. Adicionalmente, este escenario se ve potenciado por la tendencia de «cero clics», impulsada por las respuestas sintéticas incrustadas en los propios buscadores: un porcentaje elevado de las búsquedas actuales se satisface plenamente sin que el internauta llegue a navegar por ninguna página.

«La proporción de citas se considera una métrica clave en el ámbito profesional, mientras que en la investigación científica aparece sistematizada en una única investigación. Dicho desfase entre el sector y la academia constituye un descubrimiento por derecho propio», afirmó Néstor Romero.

 Las cinco preguntas de investigación junto con sus respuestas

RQ

Pregunta

Respuesta del estudio

RQ1

¿Qué familias de métricas se emplean?

Siete familias parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— sin ningún marco integrador compartido.

RQ2

¿Sobre qué unidad de análisis se operacionalizan?

No hay consenso: la unidad migra de la fuente/URL —herencia directa del SEO— hacia la marca o entidad, el documento, el producto y, en los trabajos más recientes, la trayectoria de navegación de agentes. Estudios con unidades distintas no son directamente comparables.

RQ3

¿Cómo se controla la variabilidad estocástica de los motores?

Solo una minoría aplica repetición o modelización explícita de la incertidumbre. La mayoría se apoya en una única ejecución o en acotar una ventana temporal, sin cuantificar la incertidumbre.

RQ4

¿Qué evidencia de fiabilidad y validez se reporta?

Ningún estudio del corpus somete su instrumento a validación psicométrica. Existen controles adyacentes y aislados (estabilidad, fidelidad de la atribución, triangulación por diseño, robustez al orden). La fiabilidad intercodificadores apenas se reporta.

RQ5

¿Existe un instrumento integrado y validado de presencia generativa?

No. Los benchmarks evalúan la eficacia de tácticas o cambios de rango, no la validez de constructo de una medida; los estudios primarios operacionalizan métricas útiles pero parciales y sin fiabilidad documentada.

Metodología: cuatro vías de búsqueda junto con una política clara de preprints

Para contrarrestar las limitaciones individuales de cada estrategia, la búsqueda integró cuatro vías complementarias: un buscador impulsado por inteligencia artificial, consultas multilingües y replicables en OpenAlex, seguimiento de referencias a partir de nodos clave, y cotejo en un repositorio indexado (Web of Science; Scopus quedó fuera de alcance). Una vez eliminados los duplicados mediante el DOI —evitando el título debido a la elevada coincidencia de denominaciones genéricas en esta disciplina—, dos evaluadores examinaron los resúmenes por separado, zanjando los desacuerdos de común acuerdo. En total, se analizaron 36 documentos íntegros, seleccionándose 23 investigaciones originales junto a un par de revisiones catalogadas de manera independiente a modo de marco teórico.

«Buena parte del conocimiento generado en español sobre esta materia no llega a los circuitos internacionales. Recuperarlo no es una cuestión de exhaustividad: revela un sesgo lingüístico latente en el campo», recalcó Néstor Romero.

Siete familias de métricas y ningún marco que las integre

Siete familias de métricas parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— quedan mapeadas en la investigación, conviviendo sin un marco integrador compartido. Asimismo, el análisis subraya que la división conceptual más fecunda dentro de este ámbito radica en diferenciar la citación (la simple selección de una fuente) de la absorción (la asimilación efectiva de sus contenidos en la respuesta), fragmentando de este modo en dos capas lo que previamente se cuantificaba mediante una lógica binaria.

El foco analítico se desplaza: de la URL hacia la marca y el recorrido de los agentes

No existe consenso sobre qué se mide exactamente. El corpus revela un desplazamiento progresivo desde la fuente o la URL (herencia directa del SEO) hacia la marca o entidad, el documento, el producto y, en los trabajos más recientes, hacia unidades de orden superior como la trayectoria de navegación de los agentes. Ese desplazamiento refleja la migración de la pregunta del campo, pero tiene un coste: los estudios con unidades distintas no son directamente comparables, lo que refuerza la imposibilidad de realizar un metaanálisis.

Tipología de la evidencia disponible

Grado de evidencia Casos prácticos Proporción en el corpus
Benchmark de evaluación GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) Predominante
Medición primaria (motores reales) How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) Escasa
Estudio aplicado / comercial GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) Restringida

Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.

La IA no responde siempre lo mismo, y casi nadie lo mide

Debido a que los motores generativos funcionan de manera estocástica, son capaces de arrojar contestaciones diferentes frente a una idónea consulta idéntica. Por consiguiente, lograr una evaluación confiable demanda replicar las mediciones o representar formalmente la incertidumbre. Pese a ello, tan solo una minoría de las investigaciones adopta este enfoque de modo metódico. Entre los pocos que lo implementan sobresalen proyectos que realizan cinco corridas por cada consulta, que efectúan doscientos exámenes junto con permutaciones de orden, que llevan a cabo análisis de sensibilidad orientados al idioma y a las paráfrasis, o bien aquellos que abordan la visibilidad en calidad de distribución en vez de un número estático. El resto de los trabajos, en su mayor parte, confía en una sola ejecución.

«Dentro de este ámbito, registrar una única ejecución carece de solidez epistemológica. Todo instrumento fiable necesita integrar la repetición y el análisis de la incertidumbre como una exigencia fundamental, más allá de considerarlo un simple detalle opcional», puntualiza Romero.

El descubrimiento principal: un campo que abarca demasiado pero certifica muy poco

La conclusión determinante del estudio es que ningún trabajo del corpus somete su instrumento de medición a validación psicométrica en sentido estricto. Lo que existe son controles adyacentes y aislados (métricas de estabilidad, fidelidad de la atribución, triangulación por diseño o robustez al orden), y la fiabilidad intercodificadores, requisito básico de cualquier instrumento, apenas se reporta. La validez, cuando se argumenta, descansa en la coherencia interna de benchmarks creados ad hoc antes que en propiedades de medición. De ahí la conclusión central del mapeo: no existe todavía un instrumento integrado y validado para medir la presencia generativa de marca.

Requisitos para participar

Criterio

Inclusión

Exclusión

Foco

Medición u operacionalización de presencia, visibilidad, citación o influencia en motores generativos

SEO clásico, diseño generativo (CAD), GAN, sistemas de recomendación u otros usos ajenos al dominio

Ventana temporal

2023-2026 (campo born-digital)

Anterior a 2023

Idioma

Español e inglés

Otros idiomas sin traducción disponible

Tipo

Estudio primario de medición, benchmark de evaluación o estudio aplicado con métricas

Editoriales, artículos de opinión, contenido promocional

Estatus

Preprints admitidos bajo política de sensibilidad

Literatura gris autopublicada sin control editorial

Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.

«Hallamos un terreno que cuantifica en exceso pero acredita de manera escasa. No escasean las propuestas de medición —de hecho, sobran—; lo que escasea es la validez de constructo junto a una fiabilidad debidamente acreditada. Cabe precisarlo con rigor, puesto que equiparar un parámetro de referencia con una herramienta contrastada eleva artificialmente la supuesta madurez metodológica de la disciplina. Precisamente ese hueco constituye la gran ocasión científica», sostiene Néstor Romero.

Existe una separación entre la enseñanza académica y la labor profesional

El artículo documenta un desajuste llamativo entre lo que la industria considera central y lo que la ciencia ha formalizado. La cuota de citación (citation share) —métrica que la práctica profesional trata como decisiva y candidata natural a validez convergente— está formalizada en esencialmente un solo estudio. Y la familia de sentimiento y encuadre es igualmente escasa, pese a que el trabajo de mayor escala del corpus, que analiza más de un centenar de marcas, la identifica como la señal más inestable de todas.

«La visibilidad en Google no anticipa la presencia en un asistente generativo. Esto anula la transferencia directa de métricas y obliga a replantearse qué evaluamos y de qué manera».

«La visibilidad generativa se puede manipular, lo cual impone a la medición una exigencia que por regla general no se le pide: la solidez ante la manipulación en calidad de atributo del instrumento.»

La ciencia en español, invisible: una lección metodológica

Asimismo, este análisis arroja una aportación metodológica de suma relevancia para los investigadores de habla hispana. Hay un corpus de estudios en español, divulgado en publicaciones de Documentación y Biblioteconomía, que examina la exposición ante la inteligencia artificial generativa desde perspectivas diversas —tales como la inestabilidad de las marcas dentro de las sugerencias turísticas elaboradas por IA, o bien el ajuste de los repositorios académicos para facilitar su indexación por parte de plataformas generativas—, aspectos que los textos anglosajones hegemónicos suelen soslayar. Su rescate únicamente se logró por medio de consultas en varios idiomas, lo cual pone de manifiesto un sesgo idiomático subyacente en esta disciplina.

A esto se añade otra enseñanza derivada del procedimiento: el cotejo en una base de datos indexada arrojó 360 entradas en bruto, de las cuales se examinaron 136 de libre acceso —en su gran mayoría interferencias temáticas debidas a la coincidencia de palabras—, sin que se sumara ninguna investigación de medición apta y novedosa. En resumen, este ámbito prioriza los preprints y su cobertura en los índices convencionales resulta insuficiente; de hecho, el 64 % del conjunto de candidatos se publica mediante arXiv o SSRN, mientras que el 98 % carece de un cuartil indexado.

«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.

Proceso de elección de estudios (PRISMA-ScR, dos ramas)

Fase

Desenlace

Rama de descubrimiento (Consensus)

Se detectaron 70 registros; 23 fueron descartados previamente al filtrado (por duplicidad de DOI, depuración y falsos positivos derivados de colisiones en siglas); 47 se sometieron a cribado por resumen; 26 se desecharon; 21 avanzaron hacia la revisión de texto completo

Rama de otros métodos

Aparecieron 18 registros suplementarios (mediante seguimiento de referencias, OpenAlex y comprobación en bases indizadas); 15 quedaron catalogados como aptos para lectura íntegra

Verificación en Web of Science

Arrojó 360 registros iniciales; 136 examinados (en modalidad de acceso abierto); no se halló ningún trabajo de medición válido adicional

Evaluación a texto completo

Se analizaron 36 documentos; 13 fueron descartados por quedar fuera del objeto de estudio o carecer de estimaciones directas sobre la presencia

Inclusión final

Se incorporaron 23 investigaciones principales al análisis conjunto, sumadas a 2 revisiones catalogadas bajo el apartado de marco conceptual

Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los autores detallan que las cifras correspondientes a la identificación y el cribado son definitivas, mientras que aquellas relativas a la evaluación del texto íntegro y la incorporación siguen siendo provisionales.

Se puede manipular la visibilidad generativa

Cierta parte de la investigación analizada evidencia que la exposición en los motores generativos resulta manipulable de manera adversarial, ya sea a través de tácticas de alteración de posiciones en los buscadores conversacionales o mediante la optimización discreta de prompts. Dicha investigación traslada esta conclusión al ámbito de la métrica: la solidez frente a los intentos de manipulación tendría que integrar el conjunto de atributos indispensables para cualquier herramienta de visibilidad.

«Un benchmark evalúa si una táctica funciona o si un ítem cambia de rango; no si una métrica mide válidamente un constructo. Confundir los dos niveles infla la madurez aparente del campo».

«En este ámbito, evaluar basándose en una única prueba resulta epistemológicamente endeble, ya que los motores generativos son capaces de ofrecer respuestas diferentes ante una misma consulta».

Qué viene ahora: del diagnóstico al instrumento

Los creadores del estudio deducen que el déficit hallado, concretamente en la fiabilidad documentada y en la validez de constructo, representa el hueco idóneo que legitima la creación y validación formal de un indicador propio centrado en la presencia generativa. Del mismo modo, consideran esta labor como el paso lógico que sucede al artículo difundido, descartando que se trate de un hecho ya comprobado. Precisamente, este es el camino que el grupo investiga en la etapa venidera.

«El propósito que perseguimos consiste en transitar desde el diagnóstico hasta la herramienta práctica: diseñar y contrastar un indicador accesible para cualquier tipo de empresa, sin importar su dimensión, permitiéndole medir con rigor científico el impacto de su marca en las respuestas generadas por la inteligencia artificial», señala Néstor Romero.

Limitaciones expresadas por los creadores

El texto deja claros sus propios confines: la fragilidad de los datos en un ámbito tan incipiente y plagado de preprints, lo cual vuelve provisionales sus deducciones; la imposibilidad de replicar el trayecto de hallazgo originario —contrarrestada, si bien no suprimida, mediante OpenAlex, el seguimiento de referencias y el cotejo indexado—; la acotada cobertura idiomática al inglés y al español junto a la carencia de acceso institucional para constatar en Scopus; el etiquetado efectuado de manera parcial sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propia ejecución; y la caducidad temporal intrínseca a cualquier análisis de un sector fundamentado en tecnologías propietarias en mutación constante.

Resulta indispensable considerar estas restricciones con el fin de evaluar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».

Por Otilia Adame Luevano

También te puede gustar