Examen de grado · Maestría en Ciencias de la Computación

Desarrollo de un modelo basado en lenguaje natural
para la recuperación de información histórica y
cultural mediante técnicas de retrieval augmented
generation

Presenta

Ing. Johan Argenis Franco Rogel

Dirección de tesis

Dr. Noé Alejandro Castro Sánchez
Dr. Máximo López Sánchez

Comité revisor

Dr. Juan Gabriel González Serna
Dr. Nimrod González Franco
Dr. Jorge Alberto Fuentes Pacheco

Índice

  1. 01Introducción
  2. 02Marco conceptual
  3. 03Estado del arte
  4. 04Método de solución
  5. 05Resultados y discusión
  6. 06Conclusiones
  7. 07Referencias
  8. 08Anexos

La participación museística sigue siendo limitada y poco recurrente

22,2 % de la población de 12 años y más asistió a una exposición o museo en 2025.
63,2 %de las visitas se concentraron en Ciudad de México, Nuevo León y Guanajuato.
191,316personas visitantes fueron entrevistadas por los museos durante 2025.

Frecuencia declarada durante los últimos 12 meses

80,6 % Primera visita 12,5 % 2–3 6,9 % Cuatro o más

Fuentes: INEGI, MODECULT 2025 y Estadística de Museos 2025.

Museos según tema principal

1,215museos reportaron información
Historia44,4 %
Arte23,5 %
Arqueología20,0 %
Ciencia5,9 %
Otros6,2 %
52,2 Mvisitas registradas durante 2025
25,8 Men Ciudad de México, distribuidas en 166 museos
4,7 Men Nuevo León, distribuidas en 47 museos

Fuente: INEGI, Estadística de Museos 2025.

La visita se concentra en públicos con mayor escolaridad y suele ser breve

Escolaridad de visitantes

Superior61,9 %
Media superior25,4 %
Secundaria9,5 %
Primaria2,7 %

La educación básica representa 12,3 % en conjunto.

Duración de la estancia

56,8 %
Menos de
1 hora
30,1 %
De 1 a
2 horas
13,1 %
Más de
2 horas

86,9 % permanece como máximo dos horas.

Fuente: INEGI, Estadística de Museos 2025. Base: personas visitantes entrevistadas.

Visitantes según principales motivos para no ir a los museos

Falta de difusión, publicidad o conocimiento del acervo18,2 %
Falta de cultura o educación16,4 %
No tienen tiempo15,9 %
No les interesa, falta de motivación o flojera14,4 %
Por el trabajo10,7 %
No les gusta o les parece aburrido8,2 %
Están muy lejos6,5 %
Prefieren ver televisión5,2 %
Resto de los motivos4,5 %

Fuente: INEGI, Estadística de Museos 2025. Opinión de las personas visitantes entrevistadas.

La disponibilidad digital no garantiza un acceso comprensible

01

Patrimonio digitalizado

Las instituciones han creado colecciones y repositorios para preservar y difundir el patrimonio.

02

Información fragmentada

Los registros permanecen dispersos, son heterogéneos y tienen distintos niveles de descripción.

03

Recuperación condicionada

La consulta depende de metadatos, vocabularios y de cómo cada repositorio organiza la información.

04

Brecha de acceso

Estar disponible no significa que el contenido pueda explorarse mediante preguntas naturales.

Oportunidad de investigaciónIncorporar una capa de acceso que conecte preguntas en lenguaje natural con evidencia recuperada de los documentos museográficos.

Fuentes: Galina Russell (2018); Morales-del-Castillo et al. (2019); Molina Salinas (2023); Lewis et al. (2020).

Pregunta de investigación

¿Es viable utilizar un SLM para generar respuestas contextualizadas sobre información museográfica que mantengan fidelidad fáctica respecto de los documentos de referencia?

Objetivo general y objetivos específicos

Objetivo general

Desarrollar un sistema de recuperación y generación de información para el dominio museográfico basado en modelos de lenguaje pequeños, mediante la adaptación y mejora de una arquitectura RAG.

Objetivos específicos

  1. 01

    Analizar las limitaciones actuales en la presentación de información en museos.

  2. 02

    Integrar los componentes de recuperación y generación en una arquitectura RAG para responder consultas sobre información museográfica.

  3. 03

    Evaluar la robustez y efectividad del módulo de recuperación de forma aislada ante ruido ortográfico y variabilidad textual léxica y semántica, y estrategias de fusión de resultados.

  4. 04

    Validar el funcionamiento integral del modelo RAG mediante similitud textual automatizada y análisis estadístico-lingüístico de la interacción de usuarios.

Justificación

El dominio histórico-cultural necesita consultas dinámicas y ancladas en sus propias fuentes

1

Acceso

Permitir preguntas en lenguaje natural sobre colecciones específicas.

2

Confianza

Reducir respuestas no respaldadas mediante recuperación documental.

3

Evidencia local

Aportar evaluación de RAG en un contexto histórico-cultural mexicano.

Alcances y limitaciones

Alcances

  • 01

    Desarrollar un sistema basado en técnicas de RAG para la consulta de información histórica y cultural mediante lenguaje natural.

  • 02

    Implementar un módulo de recuperación de información basado en enfoques léxicos, semánticos y de fusión de rango.

  • 03

    Evaluar la robustez del módulo de recuperación ante escenarios de ruido ortográfico y variabilidad textual.

  • 04

    Integrar un modelo generativo para la construcción de respuestas a partir de la información recuperada.

  • 05

    Validar el funcionamiento del sistema mediante métricas automáticas de recuperación, similitud textual y análisis de la interacción de los usuarios.

  • 06

    Implementar la propuesta mediante una arquitectura de microservicios accesible a través de una aplicación web.

Limitaciones

  • 01

    El sistema estará limitado a información contenida en el corpus documental utilizado durante la investigación.

  • 02

    El estudio se enfocará exclusivamente en información histórica y cultural en idioma español.

  • 03

    La calidad de las respuestas dependerá de la cobertura y calidad de los documentos incorporados al corpus.

  • 04

    La evaluación experimental se realizará sobre los conjuntos de datos y escenarios definidos en esta investigación, por lo que los resultados podrían variar en otros dominios o colecciones documentales.

  • 05

    La investigación no contempla la integración directa con bases de datos institucionales de museos ni la actualización automática de contenidos externos.

  • 06

    El sistema se desarrollará como un prototipo de investigación y no como una plataforma de producción para uso institucional.

LLM y SLM: misma base, distinta escala operativa

Large Language Model

LLM

  • Gran cantidad de parámetros y conocimiento general.
  • Alta capacidad de generación y razonamiento lingüístico.
  • Mayor demanda de memoria, cómputo y energía.

Small Language Model

SLM

  • Menor cantidad de parámetros y despliegue más accesible.
  • Menor latencia y costo de inferencia.
  • Puede especializarse con contexto externo relevante.
Ambos usan conocimiento paramétrico:patrones aprendidos y almacenados en los pesos durante el entrenamiento.

Prompt y embeddings

Prompt

Entrada textual que orienta al modelo

Es el texto que se proporciona a un modelo de lenguaje para comunicar una instrucción, formular una pregunta o especificar una tarea.

Instrucción + pregunta + restricciones
Embedding

Representación vectorial del significado

Es una representación numérica de palabras, oraciones o documentos. Los contenidos con significados semejantes se ubican próximos dentro del espacio vectorial.

[0,18, −0,42, 0,71, …][0,21, −0,39, 0,68, …]

Recuperar información es seleccionar y ordenar evidencia

Consulta

Necesidad expresada por el usuario.

Representación

Palabras, términos ponderados o vectores.

Comparación

Se calcula la relevancia frente al índice.

Ranking Top-k

Se entregan primero los fragmentos más útiles.

La recuperación no responde: decide qué evidencia estará disponible para responder.

Tres estrategias de recuperación complementarias

Dispersa · léxica

BM25

Coincide términos de la consulta con términos del documento.

FortalezaPrecisión ante nombres, fechas y vocabulario exacto.LímiteNo reconoce bien paráfrasis o sinónimos.

Densa · semántica

Embeddings

Compara representaciones vectoriales de consultas y documentos.

FortalezaRecupera significados semejantes aunque cambien las palabras.LímitePuede perder coincidencias léxicas específicas.

Híbrida

Léxica + semántica

Combina rankings o puntuaciones de ambos recuperadores.

FortalezaAprovecha exactitud léxica y cobertura semántica.RetoFusionar resultados con escalas diferentes.

RAG combina lo que el modelo sabe con lo que puede consultar

Conocimiento paramétrico

θ

Está codificado en los pesos del modelo.

  • Fluido y general.
  • Estático y difícil de rastrear.
+

Conocimiento no paramétrico

Está almacenado en documentos e índices externos.

  • Actualizable y verificable.
  • Consultado durante la inferencia.
=

RAG

R

Generación condicionada por evidencia recuperada.

  • Respuesta en lenguaje natural.
  • Mayor trazabilidad documental.

Fuente: Lewis et al. (2020).

La arquitectura RAG tiene dos recorridos

Preparación del conocimientoDocumentosFragmentaciónRepresentaciónÍndice
Respuesta a una consultaPreguntaRecuperación top-kIncorporación de evidencia a la instrucciónGeneraciónRespuesta
Recuperar

Selecciona la evidencia.

Aumentar

Integra evidencia e instrucciones.

Generar

Produce la respuesta fundamentada.

Fuente: Lewis et al. (2020).

RAG evoluciona al incorporar control sobre la evidencia

01

RAG naive

Recupera documentos y los concatena directamente al prompt.

02

RAG avanzado

Preprocesa la consulta, reordena resultados y filtra evidencia.

03

RAG modular

Separa recuperación, reordenamiento, generación y memoria en módulos optimizables.

Fuente: Gao et al. (2023).

RAG naive

Es la implementación más directa: recupera documentos relevantes y los concatena con la consulta antes de enviarlos al modelo generativo.

ConsultaRecuperaciónConcatenaciónGeneración
Ventaja

Es simple de implementar y permite incorporar información externa.

Limitación

La calidad depende directamente de los primeros documentos recuperados.

Fuente: Gao et al. (2023).

RAG avanzado

Añade mecanismos antes y después de la recuperación para mejorar la pertinencia y reducir el ruido del contexto.

Reformular consultaRecuperarReordenarFiltrarGenerar
Ventaja

Entrega evidencia más precisa y mejor organizada al generador.

Mayor complejidad

Incorpora más etapas, decisiones y costo de procesamiento.

Fuente: Gao et al. (2023).

RAG modular

Organiza el sistema mediante componentes intercambiables que pueden configurarse y optimizarse de manera independiente.

RecuperaciónReordenamientoGeneraciónMemoria
Ventaja

Facilita adaptar la arquitectura a distintas tareas y colecciones.

Reto

Requiere coordinar y evaluar cada módulo y sus interacciones.

Fuente: Gao et al. (2023).

Una respuesta convincente no necesariamente es verdadera

AlucinaciónContenido lingüísticamente coherente que es incorrecto, contradictorio o no está respaldado por evidencia verificable.

Datos

Información incorrecta, sesgada, contradictoria o insuficiente en el entrenamiento.

Modelo

La predicción del siguiente token busca producir texto convincente, pero no garantiza que sea verdadero.

Inferencia

Ante conocimiento ausente, el modelo puede generar una continuación no sustentada en lugar de expresar incertidumbre.

Fuentes: Maynez et al. (2020); Zhang et al. (2023).

Estrategias para reducir alucinaciones

01

Preentrenamiento

Depurar información errónea o sesgada, equilibrar la cobertura de los dominios e incorporar señales de veracidad.

02

Ajuste fino

Especializar el modelo para una tarea. RLHF incorpora preferencias humanas sobre calidad y veracidad.

03

Inferencia

Consultar conocimiento externo, guiar el razonamiento y permitir que el modelo exprese incertidumbre.

04

Postprocesamiento

Comparar el texto generado con fuentes externas y verificar cada afirmación mediante fact-checking.

Conclusión: ninguna estrategia aislada elimina completamente las alucinaciones; los sistemas más robustos combinan varios enfoques.

Fuente: Huang et al. (2023).

Un sistema RAG se evalúa por etapas

Recuperación

¿Encontró la evidencia?

Hit@kPrecision@kRecall@kMRR@knDCG@k

Respuesta

¿Cómo se compara con la referencia?

BLEUROUGEMETEORBERTScore

Fundamentación

¿Responde con evidencia?

FaithfulnessAnswer relevanceContext precisionContext recallHallucination rate

Cinco métricas sobre el mismo top-5

10 documentos · 4 relevantes en la colección · top-5 con 3 relevantes y 2 no relevantes

1 · RecuperaciónSe ordenan cinco documentos seleccionados de la colección.
Hit@5 = 1Hay al menos un documento relevante.
Precision@5 = 3/5 = 0,60Tres de los cinco recuperados son relevantes.
Recall@5 = 3/4 = 0,75Se recuperaron tres de los cuatro relevantes existentes.
Reciprocal Rank · RR@5 = 1/2 = 0,50Para esta consulta, el primer acierto está en la posición 2. MRR se obtiene al promediar este valor entre varias consultas.
nDCG@5 ≈ 0,57El descuento posicional reduce la contribución de los aciertos ubicados en posiciones inferiores.

Fuentes: Manning et al. (2008); Järvelin y Kekäläinen (2002).

MRR promedia el primer acierto de varias consultas

Consulta 1

RNNNN
Primer acierto: 1RR = 1/1 = 1,00

Consulta 2

NRNNN
Primer acierto: 2RR = 1/2 = 0,50

Consulta 3

NNNRN
Primer acierto: 4RR = 1/4 = 0,25
Mean Reciprocal RankMRR = (1,00 + 0,50 + 0,25) / 3 = 0,58

Interpretación: un valor próximo a 1 indica que el primer resultado relevante aparece en las primeras posiciones del conjunto de consultas.

Fuente: Manning et al. (2008).

nDCG · Normalized Discounted Cumulative Gain

¿Por qué disminuye el peso?El descuento logarítmico hace que un acierto al inicio aporte más que el mismo acierto en una posición baja.

Ranking recuperado

N0R0,63N0R0,43R0,39

DCG@5 · Discounted Cumulative Gain ≈ 1,45

Ranking ideal

R1,00R0,63R0,50R0,43N0

IDCG@5 · Ideal Discounted Cumulative Gain ≈ 2,56

nDCG@5 · Normalized Discounted Cumulative Gain = 1,45 / 2,56≈ 0,57

Efecto del documento relevante no recuperado: D4 pertenece al ordenamiento ideal y debería aparecer en las primeras cinco posiciones. Su ausencia reduce el DCG y, en consecuencia, el nDCG.

Fuente: Järvelin y Kekäläinen (2002).

Métricas de similitud con una respuesta de referencia

BLEU

Calcula precisión de n-gramas. Premia coincidencias exactas de secuencias.

Más estricto con la redacción
ROUGE

Mide principalmente cobertura mediante recall de unigramas, bigramas o subsecuencias.

¿Cuánto contenido de referencia cubrió?
METEOR

Considera coincidencias, raíces y sinónimos; tolera mejor algunas paráfrasis.

Mayor flexibilidad lingüística
BERTScore

Compara embeddings contextuales para capturar semejanza semántica entre textos.

Compara significado, no solo palabras

Limitación compartida: una alta similitud textual o semántica no garantiza que cada afirmación esté respaldada por el contexto.

Fuentes: Papineni et al. (2002); Lin (2004); Banerjee y Lavie (2005); Zhang et al. (2020).

Métricas específicas de fundamentación

Faithfulness

Proporción de afirmaciones respaldadas por el contexto recuperado.

Answer Relevance

Evalúa si la respuesta aborda de forma directa y pertinente la pregunta del usuario.

Context Precision

Mide cuánto del contexto recuperado es realmente relevante para responder la consulta.

Context Recall

Mide cuánto del contexto necesario para responder fue recuperado por el sistema.

Hallucination Rate

Proporción de afirmaciones generadas que no pueden verificarse en la evidencia disponible.

Interpretación conjunta: relevancia responde “¿sirve?”, mientras fidelidad responde “¿está respaldado?”.

Fuentes: Es et al. (2024), RAGAS; Saad-Falcon et al. (2024), ARES.

LLM-as-a-judge: un modelo evalúa a otro modelo

Pregunta+Contexto+RespuestaLLM evaluadorPuntuación + explicación

¿Qué permite?

  • Evaluar relevancia, fidelidad y calidad sin coincidencia literal.
  • Aplicar una rúbrica consistente a muchas respuestas.

¿Qué riesgo introduce?

  • Sesgos y errores del propio modelo evaluador.
  • Sensibilidad al prompt, al orden y a la escala utilizada.

Alcance metodológico: la evaluación requiere calibración con juicios humanos y el reporte explícito del modelo, la instrucción y la escala empleada.

Fuentes: Zheng et al. (2023); Saad-Falcon et al. (2024).

Sistemas RAG y NLP en entornos culturales · I

TrabajoDominio y corpusMétodoEvaluaciónAporte y límite frente a esta tesis
Jung y Joe (2025)Museos · 199 mil descripcionesSLM + RAG; recuperación semántica y espacialRecall@1, MRR y 110 usuariosCorrespondencia: integra SLM, RAG y usuarios; no evalúa ruido textual.
Wan et al. (2025)Catálogos, museos y documentosGrafo + recuperación léxica + LLMPreguntas multietapa y ablaciónContribución: integra evidencia estructurada y documental; exige mayor complejidad.
Clarizia et al. (2025)Patrimonio cultural y ontologíasTriples + recuperación semánticaFidelidad, relevancia y expertosContribución: explicita la fundamentación; requiere una ontología previa.
Kelly et al. (2025)Folclore, historia oral y archivosEmbeddings, contexto y reordenamientoRecuperación y acceso archivísticoContribución: unifica metadatos heterogéneos; no emplea un SLM.
Zeng et al. (2025)800 pinturas · 16 participantesBúsqueda léxica y generativaComparación con usuariosContribución: compara mecanismos de consulta; muestra reducida.

Fuentes: Jung y Joe (2025); Wan et al. (2025); Clarizia et al. (2025); Kelly et al. (2025); Zeng et al. (2025).

Sistemas RAG y NLP en entornos culturales · II

TrabajoDominio y corpusMétodoEvaluaciónAporte y límite frente a esta tesis
Qi et al. (2024)563 atracciones turísticasRAG con varias vectorizacionesFluidez, exactitud y relevanciaContribución: compara recuperadores; dominio turístico.
Zhou et al. (2025)Diarios y archivos históricosRAG + lectura cercana + revisión humanaFidelidad, contexto e interpretaciónContribución: validación humanística; baja escalabilidad.
Kucia et al. (2025)Exposición · 226 documentosRAG voz a voz y reordenamientoInteracciones realesContribución: despliegue público; 60 % de respuestas relevantes.
Guragain et al. (2025)Dos museos españolesVisión-lenguaje + RAG + grafoDemostración y especialistasContribución: interacción multimodal; evaluación limitada.
Song et al. (2024)Información turística socialRAG con grafo multinivelComparación con RAG tradicionalContribución: recuperación condicionada; dominio no museográfico.

Síntesis: existen soluciones pertinentes para el ámbito cultural, pero pocas integran SLM, recuperación robusta y evaluación integral.

Fuentes: Qi et al. (2024); Zhou et al. (2025); Kucia et al. (2025); Guragain et al. (2025); Song et al. (2024).

Mitigación de alucinaciones en modelos de lenguaje · I

TrabajoÁmbitoEstrategiaEvaluaciónAporte y límite frente a esta tesis
Xu et al. (2024)Folclore tradicionalOntología + grafo + RAGExactitud en evaluación propiaCorrespondencia: reduce errores factuales; requiere conocimiento estructurado.
Wang et al. (2024)Revisión generalCausas, evaluación y mitigaciónSíntesis críticaContribución: marco conceptual; sin evidencia experimental comparable.
Wang et al. (2023)Revisión sobre factualidadLLM, recuperación y adaptaciónMétodos y conjuntos de evaluaciónContribución: relaciona conocimiento paramétrico y externo; presenta solapamiento temático.
Clarizia et al. (2025)Patrimonio culturalSemántica, verificación e instruccionesFidelidad y relevanciaContribución: evaluación en patrimonio; alcance limitado.
Kirchenbauer y Barns (2024)WikipediaRecuperación densa, léxica e híbridaTasa de alucinaciónContribución: compara recuperadores; prepublicación en dominio abierto.

Fuentes: Xu et al. (2024); Y. Wang et al. (2024); C. Wang et al. (2023); Clarizia et al. (2025); Kirchenbauer y Barns (2024).

Mitigación de alucinaciones en modelos de lenguaje · II

TrabajoÁmbitoEstrategiaEvaluaciónAporte y límite frente a esta tesis
Hu et al. (2024)Generación factualAjuste fino orientado a fidelidadEvaluación de factualidadContribución: alternativa a RAG; requiere reentrenamiento.
Ali et al. (2024)Revisión generalPreentrenamiento, ajuste, inferencia y posprocesoClasificación de técnicasContribución: organiza el ciclo de vida; evidencia propia limitada.
Pham y Vo (2024)Preguntas médicasRAG, instrucciones y verificaciónTécnicas y retosContribución: criterios de confiabilidad; dominio médico.
P. Wang et al. (2025)Estados internos del LLMRepresentaciones internasDetección de alucinacionesContribución: explicación interna; no evalúa recuperación.
Liu (2024)Revisión sobre alucinacionesCausas, detección y mitigaciónRevisión narrativaContribución: síntesis introductoria; menor profundidad.

Síntesis: ninguna estrategia elimina por sí sola las alucinaciones; la recuperación externa resulta pertinente cuando la respuesta debe permanecer vinculada al corpus.

Fuentes: Hu et al. (2024); Ali et al. (2024); Pham y Vo (2024); P. Wang et al. (2025); Liu (2024).

El sistema se construyó mediante tres etapas consecutivas

01

Investigación y definición

Se identificaron estrategias de recuperación, modelos de lenguaje pequeños y criterios de evaluación.

Resultado de la etapa

Componentes candidatos para construir el sistema.

02

Diseño e integración

Se separaron recuperación, construcción de contexto y generación en módulos intercambiables.

Resultado de la etapa

Arquitectura RAG funcional y configurable.

03

Validación experimental

Los componentes se evaluaron primero de forma aislada y posteriormente como un sistema completo.

Resultado de la etapa

Evidencia sobre robustez, recuperación, generación e interacción.

Cada problema técnico se convirtió en una decisión evaluable

Variabilidad de escritura¿Los embeddings toleran errores ortográficos?

Evaluar si se requiere una etapa explícita de corrección.

Recursos computacionales¿Qué SLM puede ejecutarse localmente?

Seleccionar un modelo con desempeño y costo operativo aceptables.

Calidad de recuperación¿Cómo combinar evidencia léxica y semántica?

Comparar métodos base y estrategias de fusión bajo las mismas condiciones.

Respuesta fundamentada¿La arquitectura conserva la evidencia documental?

Evaluar la recuperación, la respuesta y la interacción del sistema integral.

Arquitectura RAG propuesta

Arquitectura RAG propuesta con recuperador híbrido, constructor de contexto y generador Phi-3

Módulo de recuperación propuesto

Arquitectura interna del módulo de recuperación con BM25, recuperación semántica y fusión de ranking

Configuración del sistema RAG

Modelo generativoPhi-3-mini-128k-instruct
Embeddingsmultilingual-e5-base
RecuperaciónBM25 + embeddings
Documentos recuperadostop-k = 10
Tamaño de fragmento220 palabras
Solapamiento40 palabras
IdiomaEspañol

Diseño experimental de la evaluación exploratoria

DatasetDanielbrdz/BarcenasMexico

670 000 registros; muestra de 300 pares pregunta–documento.

Consulta original2 o 4 erroresRecuperaciónComparación

Pregunta experimental

¿La recuperación mediante embeddings conserva documentos relevantes cuando la consulta contiene errores ortográficos?

Comparación

Damerau–Levenshtein, embeddings y combinación híbrida con α = 0,3, 0,5 y 0,7.

Medición

MRR, Recall@k y nDCG@k para consultas con transposición, eliminación, sustitución y adición.

Modelos de embeddings incluidos en la evaluación exploratoria

bge-small-en-v1.5bge-base-en-v1.5bge-large-en-v1.5 gte-smallgte-basemultilingual-e5-base Qwen3-Embedding-8Bparaphrase-spanish-distilrobertae5-mistral-7b-instruct e5-smalle5-basee5-large all-MiniLM-L6-v2all-mpnet-base-v2paraphrase-multilingual-MiniLM-L12-v2 bert-base-multilingual-casedbert-base-spanish-wwm-cased

Comparación de los diseños experimentales

Decisión experimentalConfiguración baseConfiguración confirmatoria
Referencia sin ruidoNo incluida0 errores como línea base
Consultas evaluadas300 pares10 000 casos consulta–corpus
CorrupciónUna generación; semilla 42Dos perfiles sobre 10 000 casos
Modelos17 modelos diversos9 modelos agrupados en 3 familias
Inferencia estadísticaNo aplicadaPruebas pareadas y corrección de Holm
Corrección ortográficaDistancia y fusiónCondición ruidosa frente a corrección DL

Fuente: diseños experimentales del estudio.

Diseño de la evaluación confirmatoria

01Consulta limpia

Establece el desempeño de referencia para cada modelo y corpus.

02Ruido controlado

Dos perfiles de error con niveles de 2 y 4 modificaciones.

03Recuperación

Nueve embeddings recuperan el top-5 sobre dos corpus en español.

04Corrección DL

Se mide cuánto desempeño puede recuperarse antes de buscar.

2 corpusBarcenasMexico y MessIRve 9 modelosespañol, multilingües y recuperación 3 métricasMRR@5, nDCG@5 e Hit@5 1 080 000observaciones registradas

Familias de modelos incluidas en la evaluación confirmatoria

Adaptados al español

jina-embeddings-v2-base-es

paraphrase-spanish-distilroberta

sentence_similarity_spanish_es

Multilingües generales

multilingual-MiniLM-L12-v2

multilingual-mpnet-base-v2

LaBSE

Especializados en recuperación

multilingual-e5-base

BAAI/bge-m3

gte-multilingual-base

La agrupación permite comparar familias; los resultados también se conservan por modelo.

Diseño · selección del modelo generativo

Meta

Comparar diez modelos de lenguaje pequeños y tres formatos de prompt para seleccionar el generador del sistema RAG.

H₀

La probabilidad de responder correctamente es igual entre los modelos evaluados.

H₁

Al menos un modelo presenta una probabilidad de respuesta correcta diferente.

Variables independientes

Modelo generativo —10 niveles— y configuración de prompt —3 niveles—.

Variable dependiente

Acierto por pregunta —0 o 1— y su proporción agregada mediante MCRC.

Variables controladas

Mismas preguntas, idioma, opciones de respuesta, muestra estratificada y entorno de ejecución.

Datos · resumen cuantitativo y adquisición

Datasetopenai/MMMLU · ES_LA

Preguntas de opción múltiple en español latinoamericano, distribuidas en 57 categorías de conocimiento.

57categorías

Derecho, historia, matemáticas, química, física y otras áreas.

10preguntas por categoría

Muestreo estratificado: 570 preguntas por configuración.

3prompts

Una letra; formato «Respuesta»; respuesta cerrada con «No sé».

17 100respuestas

1 710 respuestas por modelo × 10 modelos.

MMMLU ES_LAMuestra estratificada fijaMismos ítems para cada modeloRegistro binario de acierto

Evaluación confirmatoria: Google Colab con NVIDIA A100 de 40 GB. La tesis documentó además la integración operativa de Phi-3 Mini en el prototipo.

Análisis · métricas y contraste estadístico

Exactitud

La opción se considera correcta únicamente cuando una etiqueta A–D inequívoca coincide con la referencia de MMMLU.

Exactitud = aciertos / 570 preguntas

Comparación global

Q de Cochran contrasta más de dos modelos sobre los mismos ítems con respuesta binaria.

Comparaciones posteriores

McNemar compara pares de modelos en las preguntas donde discrepan.

Control del error

Holm, α = 0,05 corrige los valores p de las comparaciones múltiples.

Control de validez: se conservó la matriz 0/1 por pregunta, se rechazaron salidas ambiguas y se auditó el cambio respecto del extractor flexible.

Se evaluaron 10 SLM bajo las mismas configuraciones

01-ai/Yi-6B-ChatQwen/Qwen2-7B-Instruct Qwen/Qwen2.5-3B-Instructmeta-llama/Llama-3.1-8B-Instruct microsoft/Phi-3-mini-128k-instructmicrosoft/Phi-3-mini-4k-instruct microsoft/Phi-4-mini-instructmistralai/Mistral-7B-Instruct-v0.3 tiiuae/Falcon3-7B-Instructopenchat/openchat_3.5

Diseño · estrategias de recuperación y fusión

Meta

Determinar si una ponderación ajustable de evidencia léxica y semántica mejora la posición del documento relevante frente a una fusión balanceada.

H0

La ponderación seleccionada fuera de muestra no mejora el MRR respecto de Relative Score Fusion (RSF), equivalente a la combinación lineal con α = 0,50.

H1

La ponderación seleccionada fuera de muestra incrementa el MRR respecto de la fusión balanceada.

Variables independientes

Modelo de embeddings, estrategia de recuperación y peso léxico α.

Variables dependientes

MRR como métrica primaria; Recall@1, Recall@5, Recall@10 y nDCG@10 como métricas secundarias.

Variables controladas

Mismo corpus, consultas, documentos candidatos, normalización por consulta y reglas deterministas de desempate.

Datos · tres muestras independientes de MessIRve

Datasetspanish-ir/messirve · full/test

Cada observación vincula una consulta en español con su documento relevante.

15 000pares evaluados

Tres muestras disjuntas de 5 000 pares.

16modelos de embeddings

Arquitecturas españolas y multilingües.

48bloques experimentales

16 modelos × semillas 2024, 2025 y 2026.

1relevante por consulta

Permite interpretar directamente rango y acierto.

MessIRve full/testMuestreo sin reemplazoÍndices y hashes registradosMuestras sin solapamiento

Fuente de datos: MessIRve. Configuración y manifiestos conservados en el experimento reproducible.

Análisis · selección del peso sin reutilizar la prueba

Control de equivalencia

Se verificó por consulta que RSF y Lineal α = 0,50 producen el mismo orden cuando parten de los mismos puntajes normalizados.

Misma evidencia · misma posición

Validación cruzada anidada

Los datos se dividieron en cinco particiones: α se eligió con cuatro y se evaluó únicamente en la restante.

21 valores: α ∈ {0, 0,05, …, 1}

Contraste pareado

Se aplicó Wilcoxon porque los mismos casos se comparan entre métodos sin asumir normalidad; el intervalo de confianza del 95 % se estimó mediante remuestreo.

Significancia = 0,05 · Holm controla comparaciones múltiples

Criterio de decisión: una mejora se considera robusta cuando el intervalo de confianza de ΔMRR es mayor que cero y pHolm < 0,05.

La comparación incluyó 16 modelos de embeddings

Qwen/Qwen3-Embedding-8Bintfloat/multilingual-e5-large BAAI/bge-m3intfloat/multilingual-e5-base intfloat/multilingual-e5-smallintfloat/e5-mistral-7b-instruct paraphrase-multilingual-mpnet-base-v2sentence-transformers/use-cmlm-multilingual paraphrase-spanish-distilrobertahiiamsid/sentence_similarity_spanish_es paraphrase-multilingual-MiniLM-L12-v2sentence-transformers/LaBSE distiluse-base-multilingual-cased-v2sentence-transformers/all-MiniLM-L6-v2 dccuchile/bert-base-spanish-wwm-casedbert-base-multilingual-cased

Experimento 4 · Evaluación integral de la arquitectura RAG

CorpusDanielbrdz/BarcenasMexico

«Historia de México»: 150 pares de pregunta–respuesta, 78 documentos, 29 consultas de validación y 121 de prueba.

Sistemas comparados

Recuperador propuesto con α seleccionado mediante validación frente al EnsembleRetriever de LangChain, con pesos fijos 0,50/0,50.

Generación

Ambos sistemas usan Phi-3 Mini 128K en BF16. Se generaron 242 respuestas, 121 por sistema.

Evaluación

Recuperación: Hit@10, MRR y nDCG. Generación: BLEU, ROUGE, METEOR, BERTScore, fidelidad, relevancia y cobertura contextual.

Configuración: 231 fragmentos y α ∈ {0; 0,05; …; 1}. El valor de α se seleccionó mediante validación; la prueba se reservó para la evaluación final.

Hipótesis del contraste entre la propuesta y LangChain

H0

No existe diferencia entre la arquitectura propuesta y LangChain en la métrica evaluada.

H1

La arquitectura propuesta presenta un desempeño diferente; se plantea una mejora en recuperación y fundamentación.

Decisión

Se rechaza H0 cuando pHolm < 0,05.

Experimento 5 · Comparación con usuarios

EscenarioConsulta RAG frente a museo virtual

Obras sobre la conquista de México del Museo Nacional de Bellas Artes de Argentina.

Participantes

90 estudiantes de 18 a 28 años: 41 interactuaron con RAG y 49 con el museo virtual.

Instrumentos

Plataforma web, 10 preguntas de comprensión —cinco literales y cinco inferenciales— y escala de carga cognitiva de Paas.

Variables

Tiempo de exploración, respuestas completamente correctas (MCRC), comprensión literal e inferencial, carga mental y eficiencia cognitiva.

H0

No existen diferencias entre las condiciones RAG y museo virtual en las variables evaluadas.

H1

Al menos una variable presenta una distribución diferente entre ambas condiciones.

Decisión

Se rechaza H0 cuando pHolm < 0,05.

Diseño cuasiexperimental con asignación alternada. Las respuestas se calificaron con 0, 0,5 o 1; una respuesta sin respaldo cuenta como incorrecta y se registra por separado.

La revisión contextual identificó cinco barreras de comunicación museográfica

01

Lenguaje especializado

La terminología técnica y las estructuras sintácticas complejas dificultan la comprensión del público general.

02

Organización del contenido

Las cartelas extensas y con poca jerarquización dificultan localizar las ideas principales y favorecen una lectura superficial.

03

Legibilidad visual

El tamaño reducido de letra, el bajo contraste y una tipografía poco adecuada incrementan el esfuerzo de lectura.

04

Recursos gráficos insuficientes

La ausencia de etiquetas o explicaciones limita la capacidad de imágenes e infografías para complementar el texto.

05

Accesibilidad limitada

La falta de formatos alternativos, recursos táctiles y adaptaciones restringe el acceso para personas con discapacidad visual.

Fuente: revisión contextual presentada en la tesis, sección 6.1.

La información estática restringe la profundización del visitante

Limitación transversalLa misma información se presenta a todos los visitantes

Las cédulas no pueden ampliar una explicación, aclarar un término ni responder una pregunta específica durante el recorrido.

Consulta dinámica

Permitir que el visitante formule preguntas en lenguaje natural.

Profundización

Recuperar información adicional cuando el contenido disponible resulta insuficiente.

Respuesta fundamentada

Mantener la explicación vinculada con documentos de referencia.

Implicación metodológica

Estas necesidades fundamentaron la selección de recuperación de información, modelos de lenguaje pequeños y criterios de evaluación para las etapas experimentales.

Resultados de robustez ortográfica

Consultas con 2 errores

MétodoRecall@1Recall@5MRRnDCG@10
DL0,2000,8330,4440,578
Embedding0,2080,8400,4490,581
Híbrido0,2030,8370,4500,583

Consultas con 4 errores

MétodoRecall@1Recall@5MRRnDCG@10
DL0,2170,8500,4580,589
Embedding0,1890,8330,4510,571
Híbrido0,2010,8490,4430,580
InterpretaciónLos embeddings conservaron capacidad de recuperación bajo ruido; sin una condición limpia de referencia, la magnitud de la degradación no podía estimarse.

Fuente: tesis, Tablas 6.2 y 6.3.

Alcance inferencial del estudio

Evidencia obtenida

  • Los embeddings conservaron capacidad de recuperación ante consultas alteradas.
  • Los tres enfoques recuperaron documentos relevantes.
  • La combinación híbrida presentó un desempeño competitivo en la muestra.

Limitaciones del análisis

  • Degradación respecto de consultas limpias.
  • Variabilidad entre realizaciones del proceso de corrupción.
  • Significancia estadística de las diferencias.
  • Robustez relativa de las familias de embeddings.

Efecto del ruido ortográfico sobre MRR@5

Recuperación: 0,702 → 0,465 −33,7 %Español: 0,515 → 0,275 −46,6 %Multilingüe: 0,388 → 0,190 −51,0 %

Fuente: evaluación experimental. Promedios de MRR@5 por familia y nivel de ruido.

Comparación de resultados con k = 5 y k = 10

Métrica0 errores2 errores4 errores
@5@10Δ@5@10Δ@5@10Δ
MRR0,5350,545+0,0100,4110,423+0,0110,3100,321+0,011
nDCG0,5750,599+0,0250,4490,477+0,0280,3440,371+0,028
Hit0,6940,770+0,0770,5620,648+0,0850,4440,529+0,085
MRR

Cambia poco porque los aciertos adicionales aparecen entre las posiciones 6 y 10 y reciben un peso recíproco reducido.

nDCG

Aumenta moderadamente: reconoce los documentos adicionales, pero descuenta su contribución por aparecer en posiciones inferiores.

Hit

Presenta el mayor incremento porque solo evalúa si existe al menos un documento relevante dentro del corte.

Decisión: se conserva k = 5 como análisis principal; k = 10 se utiliza como análisis de sensibilidad y confirma la misma conclusión.

Fuente: evaluación experimental. Promedio de las tres familias de modelos.

Degradación relativa de MRR@5 por modelo

BAAI/bge-m3−27,0 %
Alibaba-NLP/gte-multilingual-base−32,7 %
jinaai/jina-embeddings-v2-base-es−37,0 %
sentence-transformers/LaBSE−41,4 %
intfloat/multilingual-e5-base−41,9 %
hiiamsid/sentence_similarity_spanish_es−53,8 %
sentence-transformers/paraphrase-multilingual-mpnet-base-v2−54,4 %
sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2−54,7 %
hackathon-pln-es/paraphrase-spanish-distilroberta−56,2 %

Degradación relativa de MRR@5 entre 0 y 4 errores.

Efecto de la corrección ortográfica sobre MRR@5

1

Consulta alteradaSe aplica únicamente a las variantes con 2 o 4 errores.

2

CandidatosSymSpell propone términos del vocabulario del corpus.

3

SelecciónDamerau–Levenshtein elige el término más cercano antes del embedding.

4

ComparaciónLa misma recuperación se ejecuta con consulta ruidosa y corregida.

Referencia limpiaMRR@5 = 0,535

2 errores

0,4110,488

+18,6 % respecto de la consulta ruidosa

4 errores

0,3100,432

+39,3 % respecto de la consulta ruidosa

Consulta ruidosaDespués de corrección DL

Conclusión: el embedding tolera parcialmente el ruido. La corrección recupera parte del MRR@5, pero no alcanza la condición limpia; por ello, la normalización constituye una etapa auxiliar.

Fuente: evaluación experimental; promedios globales de MRR@5. DL = Damerau–Levenshtein.

Contraste estadístico del efecto del ruido ortográfico

H₀ La diferencia pareada entre la consulta ruidosa y la limpia es igual a cero.

H₁ La diferencia pareada es distinta de cero; la dirección observada es negativa.

1

Diferencia por consultaΔ = métrica ruidosa − métrica limpia.

2

Shapiro–WilkEvalúa normalidad de las diferencias, no de los valores originales.

3

Prueba pareadaValor p de Shapiro–Wilk ≥ 0,05: t de Student; si es menor: Wilcoxon.

4

Ajuste de HolmControla el error familiar de los 36 contrastes simultáneos.

Métrica2 errores4 erroresEfecto mediano
MRR@536 / 36 rechazan H₀36 / 36 rechazan H₀−0,629 / −0,781
nDCG@536 / 36 rechazan H₀36 / 36 rechazan H₀−0,662 / −0,817

Criterio de decisión: α = 0,05 representa un riesgo máximo de 5 % de rechazar H₀ cuando es verdadera. Se rechaza H₀ cuando el valor p ajustado por Holm es menor que 0,05. Los estadísticos t y W varían por modelo, corpus y perfil; el resumen muestra la decisión conjunta de los 36 contrastes.

Conclusión del experimento de robustez ortográfica

Tolerancia parcial

Los embeddings conservan capacidad de recuperación bajo ruido; sin embargo, el desempeño disminuye significativamente conforme aumenta el número de errores.

Conservación

Las tres familias mantuvieron capacidad de recuperación con 2 y 4 errores.

Degradación

Todas las familias presentaron una disminución significativa de MRR@5.

Variación

Los modelos orientados a recuperación mostraron la mayor robustez relativa.

Mitigación

La corrección DL recuperó parte del desempeño sin alcanzar la condición limpia.

Resultados de la evaluación de los modelos SLM

Phi-3 Mini 128K · 57,78 %

La tesis priorizó su ventana de contexto de 128K tokens para construir respuestas con evidencia documental extensa.

ModeloConf. 1Conf. 2Conf. 3MCRC global
tiiuae/Falcon3-7B-Instruct34239632662,22 %
Qwen/Qwen2-7B-Instruct32440333161,87 %
microsoft/Phi-3-mini-4k-instruct30140929858,95 %
microsoft/Phi-3-mini-128k-instruct33239026657,78 %
meta-llama/Llama-3.1-8B-Instruct25839027553,98 %

Fuente: tesis, Tablas 6.5 y 6.6. Se muestran los cinco modelos más pertinentes para la decisión.

Los contrastes separan exactitud máxima y capacidad de contexto

Comparación globalQ = 285,07

p = 3,82 × 10−56: existen diferencias entre los diez modelos.

Phi-3 4K vs. 128KpHolm = 0,0737

Sin diferencia significativa con α = 0,05.

Falcon vs. Phi-3 128KpHolm = 0,0308

Falcon presenta mayor exactitud.

Interpretación:

Phi-3 128K no maximiza la exactitud; su selección se sustenta en la ausencia de diferencias significativas frente a la variante 4K y en una ventana de contexto considerablemente mayor.

Q de Cochran y prueba exacta de McNemar con corrección de Holm; α = 0,05.

Phi-3 Mini 128K responde al requisito de contexto del sistema RAG

Capacidad contextual128K tokens

Permite incorporar más evidencia recuperada, instrucciones y antecedentes conversacionales.

Comparación internapHolm = 0,0737

No difiere significativamente de Phi-3 Mini 4K en la evaluación estricta.

Desempeño estricto54,74 %

Resultado con extracción inequívoca sobre 570 preguntas en español latinoamericano.

Decisión

Se conserva microsoft/Phi-3-mini-128k-instruct: la prioridad del sistema es procesar contexto documental amplio; la variante 128K mantiene un desempeño comparable a Phi-3 4K y ya fue integrada en la arquitectura de la tesis.

RSF y la combinación lineal con α = 0,50 producen el mismo ranking

Relative Score Fusionsléxico + ssemántico
mismoorden
Lineal α = 0,500,50 sléxico + 0,50 ssemántico
0

discrepancias de ranking

en 48 combinaciones de modelo y muestra
MRR = 0,6601

para ambos métodos

el empate es un control esperado
InterpretaciónMultiplicar todos los puntajes por 0,50 modifica su escala, pero conserva su orden; por ello, α = 0,50 no constituye una estrategia distinta de RSF.

Fuente: tesis, Tabla 6.7; verificación por consulta del experimento reproducido.

Comparación de tres pesos fijos de fusión

RSF: suma puntajes normalizados · RRF: combina las posiciones de ambos rankings · Embedding: recuperación semántica sin BM25

MétodoMRRRecall@1Recall@5Recall@10
RSF / Lineal α=0,500,66010,56050,78250,8360
Lineal α=0,700,63270,54330,73610,7787
Lineal α=0,300,62630,53830,72890,7779
RRF0,57960,47990,68450,7655
BM250,55940,47000,66280,7136
Embedding0,51960,43910,60890,6624
+0,1007 MRR frente a BM25

Entre los pesos evaluados (0,30, 0,50 y 0,70), α = 0,50 obtuvo el mayor promedio.

Fuente: tesis, Tablas 6.7 y 6.9. Promedios sobre 16 modelos de embeddings.

El MRR promedio global alcanza su máximo con α = 0,30

0,550,600,650,70 00,100,200,300,400,500,600,700,800,901 MRR 0,6780RSF 0,6512Peso léxico α
Máximo agregadoα = 0,30

MRR = 0,6780
Δ frente a RSF = +0,0268
p ajustado por Holm = 0,009

Muy próximoα = 0,35

MRR promedio = 0,6778

Fusión balanceadaα = 0,50

MRR promedio = 0,6512

Interpretación

Se evaluaron 21 valores de α en tres muestras disjuntas. El máximo global se obtiene con 0,30; la validación determina el peso adecuado para cada modelo.

48 bloques: 16 modelos × semillas 2024, 2025 y 2026; α de 0 a 1 en incrementos de 0,05. Fuente: metrics_by_model_seed_method.csv.

El MRR cambia al modificar el peso léxico α · I

α = 0 solo embeddingα = 0,50 fusión balanceada / RSFα = 1 solo BM25Verde mayor MRR mostrado
Modeloα = 0α = 0,30α = 0,50α = 0,70α = 1
Qwen/Qwen3-Embedding-8B0,91220,88230,77510,66300,5259
intfloat/multilingual-e5-large0,88170,83810,72840,63730,5259
BAAI/bge-m30,86970,83740,73400,64290,5259
intfloat/multilingual-e5-base0,85110,81430,71380,63050,5259
intfloat/multilingual-e5-small0,83100,80050,70500,62640,5259
intfloat/e5-mistral-7b-instruct0,38850,65570,62930,58270,5259
sentence-transformers/paraphrase-multilingual-mpnet-base-v20,57480,69370,66880,61110,5259
sentence-transformers/use-cmlm-multilingual0,48290,66910,64920,60060,5259
Interpretación

Qwen3, BGE-M3 y la familia multilingual-E5 favorecen valores bajos de α; E5-Mistral, MPNet y USE-CMLM alcanzan mejores resultados con una mayor contribución léxica.

8 de 16 modelos

MRR promedio de las semillas 2024–2026, calculado desde metrics_by_model_seed_method.csv.

El MRR cambia al modificar el peso léxico α · II

α = 0 solo embeddingα = 0,50 fusión balanceada / RSFα = 1 solo BM25Verde mayor MRR mostrado
Modeloα = 0α = 0,30α = 0,50α = 0,70α = 1
somosnlp-hackathon-2022/paraphrase-spanish-distilroberta0,47830,66130,64760,59920,5259
hiiamsid/sentence_similarity_spanish_es0,45180,62470,63850,59830,5259
sentence-transformers/paraphrase-multilingual-MiniLM-L12-v20,48650,63060,64030,59870,5259
sentence-transformers/LaBSE0,39310,59610,59900,57220,5259
sentence-transformers/distiluse-base-multilingual-cased-v20,43990,58920,61390,58600,5259
sentence-transformers/all-MiniLM-L6-v20,39310,57370,58410,56630,5259
dccuchile/bert-base-spanish-wwm-cased0,20320,53490,55010,54090,5259
bert-base-multilingual-cased0,15310,44700,54230,54630,5259
Interpretación

En este grupo, la mayoría de los modelos favorece valores de α próximos a 0,50; BERT multilingüe alcanza su máximo en 0,70.

43 de 48 bloques aumentaron el MRR · 37 de 48 cumplieron el criterio de robustez

MRR promedio de las semillas 2024–2026 desde metrics_by_model_seed_method.csv; robustez desde paired_comparisons.csv.

La contribución es una fusión ponderable, no un peso universal

Se conservaFusión lineal configurable

Permite adaptar la contribución léxica y semántica al modelo y al corpus.

Se descartaSuperioridad universal

En cinco de 48 escenarios no hubo mejora y el efecto fue pequeño en varios modelos.

Conclusión estadísticaDependencia del modelo

La selección de α debe realizarse con validación separada, no fijarse a partir del conjunto de prueba.

Respuesta del experimento

Ajustar el peso puede mejorar la recuperación frente a RSF, pero la magnitud y el valor de α dependen del modelo de embeddings. El resultado respalda una arquitectura configurable y una evaluación específica por corpus.

El recuperador propuesto mejora la evidencia disponible

0,876Hit@10 · propuesta

Frente a 0,521 con LangChain.

+0,295Δ nDCG

IC bootstrap 95 %: diferencia positiva.

+0,275Δ MRR

p ajustado (Holm) = 2,06 × 10−8.

MétricaPropuestaLangChainDiferenciap ajustado (Holm)
Hit@100,8760,521+0,3559,09 × 10−13
MRR0,6210,345+0,2752,06 × 10−8
nDCG0,6820,387+0,2951,24 × 10−8
Context recall0,8760,521+0,3551,64 × 10−10

121 consultas de prueba por sistema. Contrastes pareados con corrección de Holm.

La propuesta mejora las métricas de similitud textual

Embeddings: intfloat/multilingual-e5-basePropuesta: α = 0,10LangChain: pesos 0,50/0,50Generación: Phi-3 Mini 128K

Métricas textuales

MétricaPropuestaLangChainp ajustado por Holm
BLEU0,0340,018<0,001
ROUGE-10,3050,266<0,001
METEOR0,1350,109<0,001
BERTScore0,6970,676<0,001
Las cuatro diferencias son estadísticamente significativas a favor de la propuesta.

La propuesta incrementa el respaldo documental de las respuestas

Fundamentación

MétricaPropuestaLangChainp ajustado por Holm
Faithfulness0,4260,2910,00039
Hallucination Rate57,4 %70,9 %
Diferencia de fidelidad+13,5 puntos porcentuales0,00039
El valor ajustado es inferior a 0,05; se rechaza H0 y se concluye que la mejora de fidelidad es estadísticamente significativa.

Interpretación: la ventaja se atribuye a un contexto documental más completo y pertinente, no a una diferencia en el conocimiento paramétrico del modelo generativo.

La relevancia de la respuesta no presenta diferencias significativas

Relevancia de la respuesta

MétricaPropuestaLangChainp ajustado por Holm
Answer Relevance0,8380,8360,335
El valor ajustado es igual o superior a 0,05; no existe evidencia suficiente para afirmar una diferencia entre los sistemas.

Criterio de decisión estadística: el ajuste de Holm controla falsos positivos en comparaciones múltiples. Valores inferiores a 0,05 permiten rechazar H0; valores iguales o superiores no aportan evidencia suficiente de diferencia. El valor α = 0,10 se seleccionó mediante validación y permaneció fijo durante la prueba y la generación.

Respuesta del experimento 4

La recuperación propuesta es más eficaz y fundamenta mejor la generación

La evidencia cuantitativa respalda una mejora clara en recuperación, cobertura contextual y métricas textuales. La factualidad se estima afirmación por afirmación: una afirmación se considera respaldada solo cuando el clasificador NLI identifica entailment con el contexto recuperado.

Hallazgo

Hit@10, MRR y nDCG favorecen al recuperador propuesto.

Evidencia

Faithfulness aumenta 13,5 puntos porcentuales; Hallucination Rate = 1 − Faithfulness, por lo que disminuye en la misma magnitud.

Decisión

Se conserva la arquitectura propuesta; LangChain constituye la línea base reproducible.

La comparación reunió 90 participantes y 220 consultas RAG

41condición RAG

26 hombres, 15 mujeres; edad media 20,98 años.

49museo virtual

27 hombres, 22 mujeres; edad media 20,88 años.

10preguntas abiertas

Cinco literales y cinco inferenciales por participante.

220consultas RAG

Promedio de 5,37 consultas entre quienes usaron el sistema.

140 registros de encuesta50 sesiones duplicadas excluidas90 participantes únicosComparación por condición
352 consultas registradas132 duplicadas excluidas220 consultas únicasAnálisis temático descriptivo

Fuente: registros consolidados del experimento 5. La unidad inferencial es el participante; las consultas se describen por separado.

El análisis separa desempeño, carga e interacción

Preparación

Las respuestas se calificaron como correcta = 1, parcial = 0,5 e incorrecta = 0. La ausencia de respaldo se registró como indicador independiente.

Supuestos

Shapiro–Wilk evaluó normalidad y Levene homogeneidad de varianzas. Las variables discretas y no normales se contrastaron sin asumir distribución normal.

Contraste

U de Mann–Whitney comparó grupos independientes. Se reporta delta de Cliff para cuantificar dirección y magnitud del efecto.

Decisión

Nivel de significancia α = 0,05. Holm ajustó los valores p de las siete variables para controlar falsos positivos.

Separación necesaria

Una respuesta no respaldada vale 0 para comprensión y, simultáneamente, suma al indicador de respuestas no respaldadas; nunca reduce el desempeño por debajo de cero.

RAG prolongó la exploración, pero no mejoró la comprensión

VariableRAGMuseo virtualEfectop ajustado (Holm)Decisión
Tiempo de exploraciónMediana 968 sMediana 610 sδ = +0,3640,0184Rechazar H0
Carga mentalMedia 6,61Media 7,06δ = −0,0850,9842No rechazar H0
MCRCMedia 1,17Media 1,61δ = −0,1880,5060No rechazar H0
Eficiencia cognitivaMedia −0,186Media 0,156δ = −0,2020,5060No rechazar H0
Comprensión literalMedia 0,344Media 0,359δ = −0,0820,9842No rechazar H0
Comprensión inferencialMedia 0,093Media 0,204δ = −0,3600,0177Rechazar H0
Respuestas no respaldadas5,12 %5,92 %δ = −0,1060,9842No rechazar H0

Interpretación: δ positivo favorece RAG y δ negativo favorece el museo virtual. Un pHolm inferior a 0,05 indica significancia estadística tras ajustar siete comparaciones.

Las consultas muestran exploración adicional, no una ventaja pedagógica

Buscar más información118 · 53,6 %
Entender el texto78 · 35,5 %
Interactuar con el bot15 · 6,8 %
Fuera del tópico6 · 2,7 %
Condensar información3 · 1,4 %
Respuesta del experimento

El acceso conversacional modificó el comportamiento de exploración: los participantes permanecieron más tiempo y formularon preguntas para ampliar o aclarar información. En esta muestra no produjo una mejora en comprensión; la condición de museo virtual obtuvo mayor desempeño inferencial.

La contribución demostrada es una capa adicional de consulta y exploración documental.

Fuente: experimento 5; categorías calculadas sobre 220 consultas únicas. El análisis temático es descriptivo.

La recuperación determina el desempeño del sistema completo

RobustezLos embeddings toleran ruido, pero se degradan

Los modelos orientados a recuperación conservaron el mejor desempeño con dos y cuatro errores; la normalización ayudó en consultas más dañadas.

ConfiguraciónNo existe un α universal

La ponderación léxica-semántica puede mejorar la recuperación, pero el valor conveniente depende del modelo y debe elegirse con validación separada.

Sistema integralLa propuesta superó a LangChain

Hit@10, MRR, nDCG, cobertura contextual y fidelidad favorecieron al recuperador propuesto con diferencias significativas.

UsuariosRAG cambió la forma de explorar

La interacción fue más prolongada y estuvo orientada a ampliar o aclarar información; no produjo una ventaja en comprensión.

Conclusión central: en un RAG especializado, mejorar la evidencia recuperada es condición necesaria para fundamentar la respuesta, pero no garantiza por sí sola comprensión ni ausencia de alucinaciones.

La propuesta es viable como prototipo, con límites de fidelidad

Pregunta de investigación

¿Es viable utilizar un SLM para generar respuestas contextualizadas sobre información museográfica que mantengan fidelidad fáctica respecto de los documentos de referencia?

Sí, en el dominio y corpus evaluados, como prototipo de investigación.Phi-3 Mini 128K generó respuestas contextualizadas y la propuesta mejoró la fidelidad frente a LangChain. La tasa de respuestas no respaldadas de 57,4 % impide recomendar su uso institucional sin verificación adicional.
Objetivo general

Cumplido a nivel de prototipo: se desarrolló y evaluó un sistema RAG museográfico basado en un SLM.

OE1 · Contexto

Se documentaron las limitaciones de acceso y consulta de información museográfica.

OE2 · Integración

Se integraron recuperación, construcción de contexto y generación en una arquitectura RAG.

OE3 · Recuperación

Se evaluaron ruido ortográfico, variabilidad textual y fusión léxica-semántica.

OE4 · Validación

Se contrastó el sistema integral y se analizó la interacción de 90 participantes.

La aportación corresponde a una arquitectura evaluada para investigación

Aportaciones

  • Recuperación híbrida con ponderación configurable.
  • Integración de Phi-3 Mini 128K en un RAG museográfico.
  • Evaluación desde componentes hasta interacción con usuarios.
  • Evidencia experimental en información histórica y cultural en español.

Limitaciones

  • Corpus y dominio específicos.
  • Muestra formada principalmente por estudiantes universitarios.
  • Fidelidad automática insuficiente para despliegue institucional.
  • Sin actualización automática ni integración con repositorios de museos.

Trabajo futuro

  • Reranking con cross-encoders y recuperación multietapa.
  • Evaluación con visitantes reales y perfiles diversos.
  • Corpus de referencia anotado manualmente.
  • Contexto multimodal y actualización continua del conocimiento.

Fuentes institucionales y patrimonio digital

[1]

INEGI. (2026). Estadística de Museos (EM) 2025. Reporte de resultados 15/26. https://www.inegi.org.mx/contenidos/saladeprensa/boletines/2026/museos/EM2025_RR.pdf

[2]

INEGI. (2025). Módulo sobre Eventos Culturales Seleccionados (MODECULT) 2025. Reporte de resultados. https://www.inegi.org.mx/contenidos/saladeprensa/boletines/2025/modecult/modecult2025_RR.pdf

[3]

Galina Russell, I. (2018). La digitalización de fondos patrimoniales. El caso de México. Relaciones, 39(155), 135–166. doi:10.24901/rehs.v39i154.300

[4]

Morales-del-Castillo, J. M., Ángeles Jiménez, P. y Molina Salinas, C. (2019). Mexico’s Tradition and Culture Entering the Digital Age. Heritage, 2(1), 356–365. doi:10.3390/heritage2010024

[5]

Molina Salinas, C. (2023). Desafíos de la preservación digital del patrimonio cultural en México: el caso de Mexicana. Cuadernos.info, 55, 211–232. doi:10.7764/cdi.55.48751

[6]

Treviño, R. (2026). From Museum to Server: The Challenge of Preserving History in the Digital Age. TecScience. tecscience.tec.mx/en/education-and-humanism/digitizing-cultural-heritage/

Fundamentos de RAG y recuperación

[7]

Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS, 33, 9459–9474.

[8]

Gao, Y. et al. (2023). Retrieval-Augmented Generation for Large Language Models: A Survey. arXiv:2312.10997. doi:10.48550/arXiv.2312.10997

[9]

Manning, C. D., Raghavan, P. y Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press.

[10]

Järvelin, K. y Kekäläinen, J. (2002). Cumulated gain-based evaluation of IR techniques. ACM TOIS, 20(4), 422–446. doi:10.1145/582415.582418

[11]

Maynez, J. et al. (2020). On Faithfulness and Factuality in Abstractive Summarization. ACL, 1906–1919. doi:10.18653/v1/2020.acl-main.173

[12]

Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions. arXiv:2311.05232.

Métricas de respuesta y fundamentación

[13]

Zhang, Y. et al. (2023). Siren’s Song in the AI Ocean: A Survey on Hallucination in Large Language Models. arXiv:2309.01219.

[14]

Papineni, K. et al. (2002). BLEU: a Method for Automatic Evaluation of Machine Translation. ACL, 311–318. doi:10.3115/1073083.1073135

[15]

Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarization Branches Out, 74–81.

[16]

Banerjee, S. y Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation. ACL Workshop, 65–72. doi:10.3115/1626355.1626389

[17]

Zhang, T. et al. (2020). BERTScore: Evaluating Text Generation with BERT. ICLR 2020. arXiv:1904.09675.

Evaluación automatizada de RAG

[18]

Es, S., James, J., Espinosa Anke, L. y Schockaert, S. (2024). RAGAs: Automated Evaluation of Retrieval Augmented Generation. EACL System Demonstrations, 150–158. doi:10.18653/v1/2024.eacl-demo.16

[19]

Saad-Falcon, J., Khattab, O., Potts, C. y Zaharia, M. (2024). ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems. NAACL, 338–354. doi:10.18653/v1/2024.naacl-long.20

[20]

Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685. doi:10.48550/arXiv.2306.05685

RAG y NLP en entornos culturales · I

[21]

Jung, T. y Joe, I. (2025). An Intelligent Docent System with a Small Large Language Model Based on RAG. Applied Sciences, 15(17), 9398. doi:10.3390/app15179398

[22]

Wan, J. et al. (2025). An LLM-Based QA System for Chinese Painting and Calligraphy with Knowledge Graphs and External Documents. npj Heritage Science. doi:10.1038/s40494-025-02219-3

[23]

Clarizia, F. et al. (2025). Enhancement Large Language Models Domain Through Ontology-Based RAG. IJSWIS, 21(1), 1–29. doi:10.4018/IJSWIS.392507

[24]

Kelly, P., Schild, J. y Jafari, A. (2025). FolkRAG: A RAG System for Cultural Heritage Materials. Neural Computing and Applications, 37, 20281–20297. doi:10.1007/s00521-025-11455-4

[25]

Zeng, Y. et al. (2025). Is AIGC Technology Useful? A Comparative Analysis of Search Technologies for Online Museums. Proc. ASIS&T, 62, 1155–1160. doi:10.1002/pra2.1362

RAG y NLP en entornos culturales · II

[26]

Qi, J. et al. (2024). RAG-Optimized Tibetan Tourism LLMs: Enhancing Accuracy and Personalization. arXiv:2408.12003. doi:10.48550/arXiv.2408.12003

[27]

Zhou, J., Si, L. y Hou, W. (2025). Humanities-in-the-Loop: Using Close Reading as a Method for RAG. Proc. ASIS&T, 62(1), 1185–1189. doi:10.1002/pra2.1355

[28]

Kucia, F. J. et al. (2025). How to Make Museums More Interactive? Case Study of Artistic Chatbot. ACM CIKM, 6654–6658. arXiv:2509.00572.

[29]

Guragain, A. et al. (2025). A Personalized, Multimodal AI Assistant for Enhancing Museum Visitor Experience. ALA Workshop, CEUR-WS, 4136.

[30]

Song, S. et al. (2024). TravelRAG: A Tourist Attraction Retrieval Framework Based on Multi-Layer Knowledge Graph. ISPRS IJGI, 13(11), 414. doi:10.3390/ijgi13110414

Mitigación de alucinaciones · I

[31]

Xu, J. et al. (2024). ChatTf: A Knowledge Graph-Enhanced Intelligent Q&A System for Mitigating Factuality Hallucinations in Traditional Folklore. IEEE Access, 12, 162638–162650. doi:10.1109/ACCESS.2024.3485877

[32]

Wang, Y. et al. (2024). Factuality of Large Language Models: A Survey. arXiv:2402.02420. doi:10.48550/arXiv.2402.02420

[33]

Wang, C. et al. (2023). Survey on Factuality in Large Language Models: Knowledge, Retrieval and Domain-Specificity. arXiv:2310.07521.

[34]

Clarizia, F. et al. (2025). Reducing Hallucinations in LLMs: A Semantic Approach for Cultural Heritage. i-Cities 2025.

[35]

Kirchenbauer, J. y Barns, C. (2024). Hallucination Reduction in Large Language Models with RAG Using Wikipedia Knowledge. OSF Preprints. doi:10.31219/osf.io/pv7r5

Mitigación de alucinaciones · II

[36]

Hu, M. et al. (2024). Mitigating Large Language Model Hallucination with Faithful Finetuning. arXiv:2406.11267.

[37]

Ali, M., Mabrouk, M. y Taha, Z. (2024). Hallucination Mitigation Techniques in Large Language Models. IJICIS, 24(4), 73–81. doi:10.21608/ijicis.2024.336135.1365

[38]

Pham, D. K. y Vo, B. Q. (2024). Towards Reliable Medical Question Answering: Techniques and Challenges in Mitigating Hallucinations. arXiv:2408.13808.

[39]

Wang, P. et al. (2025). What Are Models Thinking About? Understanding LLM Hallucinations Through Model Inner State Analysis. arXiv:2502.13490.

[40]

Liu, X. (2024). A Survey of Hallucination Problems Based on Large Language Models. Applied and Computational Engineering, 97, 24–30. doi:10.54254/2755-2721/97/2024.17851

Anexos y productos derivados de la investigación

A

Prompt de evaluación automática

Criterios, reglas y formato JSON utilizados por los evaluadores.

B

Artículo presentado en COMIA 2026

Postprocesamiento geométrico de espacios de embeddings.

C

Conferencia sobre LLM

Participación como ponente en jornadas académicas.

D

Taller de lenguaje natural

Actividad formativa impartida en el campamento de IA de CENIDET.

E

Participación en InnovaTec 2025

Presentación del proyecto SanEEG en la etapa local.

Anexo A · Prompt utilizado en la evaluación automática

Entrada por registro

Pregunta, respuesta generada, diez contextos recuperados, perfil demográfico y documento de referencia.

Variables evaluadas

  • Documento de referencia en top-10.
  • Corrección y respaldo contextual.
  • Comprensibilidad demográfica.
  • Rechazo y tipo de rechazo.
  • Alucinación.

Restricciones

Usar solamente los contextos proporcionados, evaluar cada registro y devolver un arreglo JSON estricto.

Primera página del prompt de evaluación automática

Fuente: tesis, Anexo A.

Anexos B y C · Artículo y conferencia

Constancias del artículo COMIA 2026 y conferencia sobre LLM
Anexo B

COMIA 2026

Constancia de presentación del artículo sobre postprocesamiento geométrico de embeddings para clasificación de textos.

Anexo C

La magia detrás de los LLM

Reconocimiento como ponente en las Jornadas Académicas de Innovación, Tecnología, Liderazgo y Sostenibilidad 2025.

Fuente: tesis, Anexos B y C.

Anexos D y E · Taller e innovación tecnológica

Reconocimiento por taller y constancia de InnovaTec 2025
Anexo D

Sistemas de Lenguaje Natural en IA

Reconocimiento por impartir el taller durante el Primer Campamento de Verano de Inteligencia Artificial de CENIDET.

Anexo E

InnovaTec 2025

Constancia de participación con el proyecto SanEEG en la categoría Servicios para la Salud Humana.

Fuente: tesis, Anexos D y E.