Examen de grado · Maestría en Ciencias de la Computación
Ing. Johan Argenis Franco Rogel
Dr. Noé Alejandro Castro Sánchez
Dr. Máximo López Sánchez
Dr. Juan Gabriel González Serna
Dr. Nimrod González Franco
Dr. Jorge Alberto Fuentes Pacheco
Fuentes: INEGI, MODECULT 2025 y Estadística de Museos 2025.
Fuente: INEGI, Estadística de Museos 2025.
La educación básica representa 12,3 % en conjunto.
86,9 % permanece como máximo dos horas.
Fuente: INEGI, Estadística de Museos 2025. Base: personas visitantes entrevistadas.
Fuente: INEGI, Estadística de Museos 2025. Opinión de las personas visitantes entrevistadas.
Las instituciones han creado colecciones y repositorios para preservar y difundir el patrimonio.
Los registros permanecen dispersos, son heterogéneos y tienen distintos niveles de descripción.
La consulta depende de metadatos, vocabularios y de cómo cada repositorio organiza la información.
Estar disponible no significa que el contenido pueda explorarse mediante preguntas naturales.
Fuentes: Galina Russell (2018); Morales-del-Castillo et al. (2019); Molina Salinas (2023); Lewis et al. (2020).
Pregunta de investigación
Desarrollar un sistema de recuperación y generación de información para el dominio museográfico basado en modelos de lenguaje pequeños, mediante la adaptación y mejora de una arquitectura RAG.
Analizar las limitaciones actuales en la presentación de información en museos.
Integrar los componentes de recuperación y generación en una arquitectura RAG para responder consultas sobre información museográfica.
Evaluar la robustez y efectividad del módulo de recuperación de forma aislada ante ruido ortográfico y variabilidad textual léxica y semántica, y estrategias de fusión de resultados.
Validar el funcionamiento integral del modelo RAG mediante similitud textual automatizada y análisis estadístico-lingüístico de la interacción de usuarios.
Justificación
Permitir preguntas en lenguaje natural sobre colecciones específicas.
Reducir respuestas no respaldadas mediante recuperación documental.
Aportar evaluación de RAG en un contexto histórico-cultural mexicano.
Desarrollar un sistema basado en técnicas de RAG para la consulta de información histórica y cultural mediante lenguaje natural.
Implementar un módulo de recuperación de información basado en enfoques léxicos, semánticos y de fusión de rango.
Evaluar la robustez del módulo de recuperación ante escenarios de ruido ortográfico y variabilidad textual.
Integrar un modelo generativo para la construcción de respuestas a partir de la información recuperada.
Validar el funcionamiento del sistema mediante métricas automáticas de recuperación, similitud textual y análisis de la interacción de los usuarios.
Implementar la propuesta mediante una arquitectura de microservicios accesible a través de una aplicación web.
El sistema estará limitado a información contenida en el corpus documental utilizado durante la investigación.
El estudio se enfocará exclusivamente en información histórica y cultural en idioma español.
La calidad de las respuestas dependerá de la cobertura y calidad de los documentos incorporados al corpus.
La evaluación experimental se realizará sobre los conjuntos de datos y escenarios definidos en esta investigación, por lo que los resultados podrían variar en otros dominios o colecciones documentales.
La investigación no contempla la integración directa con bases de datos institucionales de museos ni la actualización automática de contenidos externos.
El sistema se desarrollará como un prototipo de investigación y no como una plataforma de producción para uso institucional.
Large Language Model
Small Language Model
Es el texto que se proporciona a un modelo de lenguaje para comunicar una instrucción, formular una pregunta o especificar una tarea.
Es una representación numérica de palabras, oraciones o documentos. Los contenidos con significados semejantes se ubican próximos dentro del espacio vectorial.
Necesidad expresada por el usuario.
Palabras, términos ponderados o vectores.
Se calcula la relevancia frente al índice.
Se entregan primero los fragmentos más útiles.
La recuperación no responde: decide qué evidencia estará disponible para responder.
BM25
Coincide términos de la consulta con términos del documento.
FortalezaPrecisión ante nombres, fechas y vocabulario exacto.LímiteNo reconoce bien paráfrasis o sinónimos.Embeddings
Compara representaciones vectoriales de consultas y documentos.
FortalezaRecupera significados semejantes aunque cambien las palabras.LímitePuede perder coincidencias léxicas específicas.Léxica + semántica
Combina rankings o puntuaciones de ambos recuperadores.
FortalezaAprovecha exactitud léxica y cobertura semántica.RetoFusionar resultados con escalas diferentes.Conocimiento paramétrico
Está codificado en los pesos del modelo.
Conocimiento no paramétrico
Está almacenado en documentos e índices externos.
RAG
Generación condicionada por evidencia recuperada.
Fuente: Lewis et al. (2020).
Selecciona la evidencia.
Integra evidencia e instrucciones.
Produce la respuesta fundamentada.
Fuente: Lewis et al. (2020).
Recupera documentos y los concatena directamente al prompt.
Preprocesa la consulta, reordena resultados y filtra evidencia.
Separa recuperación, reordenamiento, generación y memoria en módulos optimizables.
Fuente: Gao et al. (2023).
Es la implementación más directa: recupera documentos relevantes y los concatena con la consulta antes de enviarlos al modelo generativo.
Es simple de implementar y permite incorporar información externa.
La calidad depende directamente de los primeros documentos recuperados.
Fuente: Gao et al. (2023).
Añade mecanismos antes y después de la recuperación para mejorar la pertinencia y reducir el ruido del contexto.
Entrega evidencia más precisa y mejor organizada al generador.
Incorpora más etapas, decisiones y costo de procesamiento.
Fuente: Gao et al. (2023).
Organiza el sistema mediante componentes intercambiables que pueden configurarse y optimizarse de manera independiente.
Facilita adaptar la arquitectura a distintas tareas y colecciones.
Requiere coordinar y evaluar cada módulo y sus interacciones.
Fuente: Gao et al. (2023).
AlucinaciónContenido lingüísticamente coherente que es incorrecto, contradictorio o no está respaldado por evidencia verificable.
Información incorrecta, sesgada, contradictoria o insuficiente en el entrenamiento.
La predicción del siguiente token busca producir texto convincente, pero no garantiza que sea verdadero.
Ante conocimiento ausente, el modelo puede generar una continuación no sustentada en lugar de expresar incertidumbre.
Fuentes: Maynez et al. (2020); Zhang et al. (2023).
Depurar información errónea o sesgada, equilibrar la cobertura de los dominios e incorporar señales de veracidad.
Especializar el modelo para una tarea. RLHF incorpora preferencias humanas sobre calidad y veracidad.
Consultar conocimiento externo, guiar el razonamiento y permitir que el modelo exprese incertidumbre.
Comparar el texto generado con fuentes externas y verificar cada afirmación mediante fact-checking.
Conclusión: ninguna estrategia aislada elimina completamente las alucinaciones; los sistemas más robustos combinan varios enfoques.
Fuente: Huang et al. (2023).
Recuperación
Respuesta
Fundamentación
10 documentos · 4 relevantes en la colección · top-5 con 3 relevantes y 2 no relevantes
Fuentes: Manning et al. (2008); Järvelin y Kekäläinen (2002).
Consulta 1
Consulta 2
Consulta 3
Interpretación: un valor próximo a 1 indica que el primer resultado relevante aparece en las primeras posiciones del conjunto de consultas.
Fuente: Manning et al. (2008).
DCG@5 · Discounted Cumulative Gain ≈ 1,45
IDCG@5 · Ideal Discounted Cumulative Gain ≈ 2,56
Efecto del documento relevante no recuperado: D4 pertenece al ordenamiento ideal y debería aparecer en las primeras cinco posiciones. Su ausencia reduce el DCG y, en consecuencia, el nDCG.
Fuente: Järvelin y Kekäläinen (2002).
Calcula precisión de n-gramas. Premia coincidencias exactas de secuencias.
Más estricto con la redacciónMide principalmente cobertura mediante recall de unigramas, bigramas o subsecuencias.
¿Cuánto contenido de referencia cubrió?Considera coincidencias, raíces y sinónimos; tolera mejor algunas paráfrasis.
Mayor flexibilidad lingüísticaCompara embeddings contextuales para capturar semejanza semántica entre textos.
Compara significado, no solo palabrasLimitación compartida: una alta similitud textual o semántica no garantiza que cada afirmación esté respaldada por el contexto.
Fuentes: Papineni et al. (2002); Lin (2004); Banerjee y Lavie (2005); Zhang et al. (2020).
Proporción de afirmaciones respaldadas por el contexto recuperado.
Evalúa si la respuesta aborda de forma directa y pertinente la pregunta del usuario.
Mide cuánto del contexto recuperado es realmente relevante para responder la consulta.
Mide cuánto del contexto necesario para responder fue recuperado por el sistema.
Proporción de afirmaciones generadas que no pueden verificarse en la evidencia disponible.
Interpretación conjunta: relevancia responde “¿sirve?”, mientras fidelidad responde “¿está respaldado?”.
Fuentes: Es et al. (2024), RAGAS; Saad-Falcon et al. (2024), ARES.
Alcance metodológico: la evaluación requiere calibración con juicios humanos y el reporte explícito del modelo, la instrucción y la escala empleada.
Fuentes: Zheng et al. (2023); Saad-Falcon et al. (2024).
| Trabajo | Dominio y corpus | Método | Evaluación | Aporte y límite frente a esta tesis |
|---|---|---|---|---|
| Jung y Joe (2025) | Museos · 199 mil descripciones | SLM + RAG; recuperación semántica y espacial | Recall@1, MRR y 110 usuarios | Correspondencia: integra SLM, RAG y usuarios; no evalúa ruido textual. |
| Wan et al. (2025) | Catálogos, museos y documentos | Grafo + recuperación léxica + LLM | Preguntas multietapa y ablación | Contribución: integra evidencia estructurada y documental; exige mayor complejidad. |
| Clarizia et al. (2025) | Patrimonio cultural y ontologías | Triples + recuperación semántica | Fidelidad, relevancia y expertos | Contribución: explicita la fundamentación; requiere una ontología previa. |
| Kelly et al. (2025) | Folclore, historia oral y archivos | Embeddings, contexto y reordenamiento | Recuperación y acceso archivístico | Contribución: unifica metadatos heterogéneos; no emplea un SLM. |
| Zeng et al. (2025) | 800 pinturas · 16 participantes | Búsqueda léxica y generativa | Comparación con usuarios | Contribución: compara mecanismos de consulta; muestra reducida. |
Fuentes: Jung y Joe (2025); Wan et al. (2025); Clarizia et al. (2025); Kelly et al. (2025); Zeng et al. (2025).
| Trabajo | Dominio y corpus | Método | Evaluación | Aporte y límite frente a esta tesis |
|---|---|---|---|---|
| Qi et al. (2024) | 563 atracciones turísticas | RAG con varias vectorizaciones | Fluidez, exactitud y relevancia | Contribución: compara recuperadores; dominio turístico. |
| Zhou et al. (2025) | Diarios y archivos históricos | RAG + lectura cercana + revisión humana | Fidelidad, contexto e interpretación | Contribución: validación humanística; baja escalabilidad. |
| Kucia et al. (2025) | Exposición · 226 documentos | RAG voz a voz y reordenamiento | Interacciones reales | Contribución: despliegue público; 60 % de respuestas relevantes. |
| Guragain et al. (2025) | Dos museos españoles | Visión-lenguaje + RAG + grafo | Demostración y especialistas | Contribución: interacción multimodal; evaluación limitada. |
| Song et al. (2024) | Información turística social | RAG con grafo multinivel | Comparación con RAG tradicional | Contribución: recuperación condicionada; dominio no museográfico. |
Síntesis: existen soluciones pertinentes para el ámbito cultural, pero pocas integran SLM, recuperación robusta y evaluación integral.
Fuentes: Qi et al. (2024); Zhou et al. (2025); Kucia et al. (2025); Guragain et al. (2025); Song et al. (2024).
| Trabajo | Ámbito | Estrategia | Evaluación | Aporte y límite frente a esta tesis |
|---|---|---|---|---|
| Xu et al. (2024) | Folclore tradicional | Ontología + grafo + RAG | Exactitud en evaluación propia | Correspondencia: reduce errores factuales; requiere conocimiento estructurado. |
| Wang et al. (2024) | Revisión general | Causas, evaluación y mitigación | Síntesis crítica | Contribución: marco conceptual; sin evidencia experimental comparable. |
| Wang et al. (2023) | Revisión sobre factualidad | LLM, recuperación y adaptación | Métodos y conjuntos de evaluación | Contribución: relaciona conocimiento paramétrico y externo; presenta solapamiento temático. |
| Clarizia et al. (2025) | Patrimonio cultural | Semántica, verificación e instrucciones | Fidelidad y relevancia | Contribución: evaluación en patrimonio; alcance limitado. |
| Kirchenbauer y Barns (2024) | Wikipedia | Recuperación densa, léxica e híbrida | Tasa de alucinación | Contribución: compara recuperadores; prepublicación en dominio abierto. |
Fuentes: Xu et al. (2024); Y. Wang et al. (2024); C. Wang et al. (2023); Clarizia et al. (2025); Kirchenbauer y Barns (2024).
| Trabajo | Ámbito | Estrategia | Evaluación | Aporte y límite frente a esta tesis |
|---|---|---|---|---|
| Hu et al. (2024) | Generación factual | Ajuste fino orientado a fidelidad | Evaluación de factualidad | Contribución: alternativa a RAG; requiere reentrenamiento. |
| Ali et al. (2024) | Revisión general | Preentrenamiento, ajuste, inferencia y posproceso | Clasificación de técnicas | Contribución: organiza el ciclo de vida; evidencia propia limitada. |
| Pham y Vo (2024) | Preguntas médicas | RAG, instrucciones y verificación | Técnicas y retos | Contribución: criterios de confiabilidad; dominio médico. |
| P. Wang et al. (2025) | Estados internos del LLM | Representaciones internas | Detección de alucinaciones | Contribución: explicación interna; no evalúa recuperación. |
| Liu (2024) | Revisión sobre alucinaciones | Causas, detección y mitigación | Revisión narrativa | Contribución: síntesis introductoria; menor profundidad. |
Síntesis: ninguna estrategia elimina por sí sola las alucinaciones; la recuperación externa resulta pertinente cuando la respuesta debe permanecer vinculada al corpus.
Fuentes: Hu et al. (2024); Ali et al. (2024); Pham y Vo (2024); P. Wang et al. (2025); Liu (2024).
Se identificaron estrategias de recuperación, modelos de lenguaje pequeños y criterios de evaluación.
Resultado de la etapaComponentes candidatos para construir el sistema.
Se separaron recuperación, construcción de contexto y generación en módulos intercambiables.
Resultado de la etapaArquitectura RAG funcional y configurable.
Los componentes se evaluaron primero de forma aislada y posteriormente como un sistema completo.
Resultado de la etapaEvidencia sobre robustez, recuperación, generación e interacción.
Evaluar si se requiere una etapa explícita de corrección.
Seleccionar un modelo con desempeño y costo operativo aceptables.
Comparar métodos base y estrategias de fusión bajo las mismas condiciones.
Evaluar la recuperación, la respuesta y la interacción del sistema integral.
670 000 registros; muestra de 300 pares pregunta–documento.
¿La recuperación mediante embeddings conserva documentos relevantes cuando la consulta contiene errores ortográficos?
Damerau–Levenshtein, embeddings y combinación híbrida con α = 0,3, 0,5 y 0,7.
MRR, Recall@k y nDCG@k para consultas con transposición, eliminación, sustitución y adición.
| Decisión experimental | Configuración base | Configuración confirmatoria |
|---|---|---|
| Referencia sin ruido | No incluida | 0 errores como línea base |
| Consultas evaluadas | 300 pares | 10 000 casos consulta–corpus |
| Corrupción | Una generación; semilla 42 | Dos perfiles sobre 10 000 casos |
| Modelos | 17 modelos diversos | 9 modelos agrupados en 3 familias |
| Inferencia estadística | No aplicada | Pruebas pareadas y corrección de Holm |
| Corrección ortográfica | Distancia y fusión | Condición ruidosa frente a corrección DL |
Fuente: diseños experimentales del estudio.
Establece el desempeño de referencia para cada modelo y corpus.
Dos perfiles de error con niveles de 2 y 4 modificaciones.
Nueve embeddings recuperan el top-5 sobre dos corpus en español.
Se mide cuánto desempeño puede recuperarse antes de buscar.
jina-embeddings-v2-base-es
paraphrase-spanish-distilroberta
sentence_similarity_spanish_es
multilingual-MiniLM-L12-v2
multilingual-mpnet-base-v2
LaBSE
multilingual-e5-base
BAAI/bge-m3
gte-multilingual-base
La agrupación permite comparar familias; los resultados también se conservan por modelo.
Comparar diez modelos de lenguaje pequeños y tres formatos de prompt para seleccionar el generador del sistema RAG.
La probabilidad de responder correctamente es igual entre los modelos evaluados.
Al menos un modelo presenta una probabilidad de respuesta correcta diferente.
Modelo generativo —10 niveles— y configuración de prompt —3 niveles—.
Acierto por pregunta —0 o 1— y su proporción agregada mediante MCRC.
Mismas preguntas, idioma, opciones de respuesta, muestra estratificada y entorno de ejecución.
Preguntas de opción múltiple en español latinoamericano, distribuidas en 57 categorías de conocimiento.
Derecho, historia, matemáticas, química, física y otras áreas.
Muestreo estratificado: 570 preguntas por configuración.
Una letra; formato «Respuesta»; respuesta cerrada con «No sé».
1 710 respuestas por modelo × 10 modelos.
Evaluación confirmatoria: Google Colab con NVIDIA A100 de 40 GB. La tesis documentó además la integración operativa de Phi-3 Mini en el prototipo.
La opción se considera correcta únicamente cuando una etiqueta A–D inequívoca coincide con la referencia de MMMLU.
Exactitud = aciertos / 570 preguntasQ de Cochran contrasta más de dos modelos sobre los mismos ítems con respuesta binaria.
McNemar compara pares de modelos en las preguntas donde discrepan.
Holm, α = 0,05 corrige los valores p de las comparaciones múltiples.
Control de validez: se conservó la matriz 0/1 por pregunta, se rechazaron salidas ambiguas y se auditó el cambio respecto del extractor flexible.
Determinar si una ponderación ajustable de evidencia léxica y semántica mejora la posición del documento relevante frente a una fusión balanceada.
La ponderación seleccionada fuera de muestra no mejora el MRR respecto de Relative Score Fusion (RSF), equivalente a la combinación lineal con α = 0,50.
La ponderación seleccionada fuera de muestra incrementa el MRR respecto de la fusión balanceada.
Modelo de embeddings, estrategia de recuperación y peso léxico α.
MRR como métrica primaria; Recall@1, Recall@5, Recall@10 y nDCG@10 como métricas secundarias.
Mismo corpus, consultas, documentos candidatos, normalización por consulta y reglas deterministas de desempate.
Cada observación vincula una consulta en español con su documento relevante.
Tres muestras disjuntas de 5 000 pares.
Arquitecturas españolas y multilingües.
16 modelos × semillas 2024, 2025 y 2026.
Permite interpretar directamente rango y acierto.
Fuente de datos: MessIRve. Configuración y manifiestos conservados en el experimento reproducible.
Se verificó por consulta que RSF y Lineal α = 0,50 producen el mismo orden cuando parten de los mismos puntajes normalizados.
Misma evidencia · misma posiciónLos datos se dividieron en cinco particiones: α se eligió con cuatro y se evaluó únicamente en la restante.
21 valores: α ∈ {0, 0,05, …, 1}Se aplicó Wilcoxon porque los mismos casos se comparan entre métodos sin asumir normalidad; el intervalo de confianza del 95 % se estimó mediante remuestreo.
Significancia = 0,05 · Holm controla comparaciones múltiplesCriterio de decisión: una mejora se considera robusta cuando el intervalo de confianza de ΔMRR es mayor que cero y pHolm < 0,05.
«Historia de México»: 150 pares de pregunta–respuesta, 78 documentos, 29 consultas de validación y 121 de prueba.
Recuperador propuesto con α seleccionado mediante validación frente al EnsembleRetriever de LangChain, con pesos fijos 0,50/0,50.
Ambos sistemas usan Phi-3 Mini 128K en BF16. Se generaron 242 respuestas, 121 por sistema.
Recuperación: Hit@10, MRR y nDCG. Generación: BLEU, ROUGE, METEOR, BERTScore, fidelidad, relevancia y cobertura contextual.
Configuración: 231 fragmentos y α ∈ {0; 0,05; …; 1}. El valor de α se seleccionó mediante validación; la prueba se reservó para la evaluación final.
No existe diferencia entre la arquitectura propuesta y LangChain en la métrica evaluada.
La arquitectura propuesta presenta un desempeño diferente; se plantea una mejora en recuperación y fundamentación.
Se rechaza H0 cuando pHolm < 0,05.
Obras sobre la conquista de México del Museo Nacional de Bellas Artes de Argentina.
90 estudiantes de 18 a 28 años: 41 interactuaron con RAG y 49 con el museo virtual.
Plataforma web, 10 preguntas de comprensión —cinco literales y cinco inferenciales— y escala de carga cognitiva de Paas.
Tiempo de exploración, respuestas completamente correctas (MCRC), comprensión literal e inferencial, carga mental y eficiencia cognitiva.
No existen diferencias entre las condiciones RAG y museo virtual en las variables evaluadas.
Al menos una variable presenta una distribución diferente entre ambas condiciones.
Se rechaza H0 cuando pHolm < 0,05.
Diseño cuasiexperimental con asignación alternada. Las respuestas se calificaron con 0, 0,5 o 1; una respuesta sin respaldo cuenta como incorrecta y se registra por separado.
La terminología técnica y las estructuras sintácticas complejas dificultan la comprensión del público general.
Las cartelas extensas y con poca jerarquización dificultan localizar las ideas principales y favorecen una lectura superficial.
El tamaño reducido de letra, el bajo contraste y una tipografía poco adecuada incrementan el esfuerzo de lectura.
La ausencia de etiquetas o explicaciones limita la capacidad de imágenes e infografías para complementar el texto.
La falta de formatos alternativos, recursos táctiles y adaptaciones restringe el acceso para personas con discapacidad visual.
Fuente: revisión contextual presentada en la tesis, sección 6.1.
Las cédulas no pueden ampliar una explicación, aclarar un término ni responder una pregunta específica durante el recorrido.
Permitir que el visitante formule preguntas en lenguaje natural.
Recuperar información adicional cuando el contenido disponible resulta insuficiente.
Mantener la explicación vinculada con documentos de referencia.
Estas necesidades fundamentaron la selección de recuperación de información, modelos de lenguaje pequeños y criterios de evaluación para las etapas experimentales.
| Método | Recall@1 | Recall@5 | MRR | nDCG@10 |
|---|---|---|---|---|
| DL | 0,200 | 0,833 | 0,444 | 0,578 |
| Embedding | 0,208 | 0,840 | 0,449 | 0,581 |
| Híbrido | 0,203 | 0,837 | 0,450 | 0,583 |
| Método | Recall@1 | Recall@5 | MRR | nDCG@10 |
|---|---|---|---|---|
| DL | 0,217 | 0,850 | 0,458 | 0,589 |
| Embedding | 0,189 | 0,833 | 0,451 | 0,571 |
| Híbrido | 0,201 | 0,849 | 0,443 | 0,580 |
Fuente: tesis, Tablas 6.2 y 6.3.
Fuente: evaluación experimental. Promedios de MRR@5 por familia y nivel de ruido.
| Métrica | 0 errores | 2 errores | 4 errores | ||||||
|---|---|---|---|---|---|---|---|---|---|
| @5 | @10 | Δ | @5 | @10 | Δ | @5 | @10 | Δ | |
| MRR | 0,535 | 0,545 | +0,010 | 0,411 | 0,423 | +0,011 | 0,310 | 0,321 | +0,011 |
| nDCG | 0,575 | 0,599 | +0,025 | 0,449 | 0,477 | +0,028 | 0,344 | 0,371 | +0,028 |
| Hit | 0,694 | 0,770 | +0,077 | 0,562 | 0,648 | +0,085 | 0,444 | 0,529 | +0,085 |
Cambia poco porque los aciertos adicionales aparecen entre las posiciones 6 y 10 y reciben un peso recíproco reducido.
Aumenta moderadamente: reconoce los documentos adicionales, pero descuenta su contribución por aparecer en posiciones inferiores.
Presenta el mayor incremento porque solo evalúa si existe al menos un documento relevante dentro del corte.
Decisión: se conserva k = 5 como análisis principal; k = 10 se utiliza como análisis de sensibilidad y confirma la misma conclusión.
Fuente: evaluación experimental. Promedio de las tres familias de modelos.
Degradación relativa de MRR@5 entre 0 y 4 errores.
Consulta alteradaSe aplica únicamente a las variantes con 2 o 4 errores.
CandidatosSymSpell propone términos del vocabulario del corpus.
SelecciónDamerau–Levenshtein elige el término más cercano antes del embedding.
ComparaciónLa misma recuperación se ejecuta con consulta ruidosa y corregida.
+18,6 % respecto de la consulta ruidosa
+39,3 % respecto de la consulta ruidosa
Conclusión: el embedding tolera parcialmente el ruido. La corrección recupera parte del MRR@5, pero no alcanza la condición limpia; por ello, la normalización constituye una etapa auxiliar.
Fuente: evaluación experimental; promedios globales de MRR@5. DL = Damerau–Levenshtein.
H₀ La diferencia pareada entre la consulta ruidosa y la limpia es igual a cero.
H₁ La diferencia pareada es distinta de cero; la dirección observada es negativa.
Diferencia por consultaΔ = métrica ruidosa − métrica limpia.
Shapiro–WilkEvalúa normalidad de las diferencias, no de los valores originales.
Prueba pareadaValor p de Shapiro–Wilk ≥ 0,05: t de Student; si es menor: Wilcoxon.
Ajuste de HolmControla el error familiar de los 36 contrastes simultáneos.
| Métrica | 2 errores | 4 errores | Efecto mediano |
|---|---|---|---|
| MRR@5 | 36 / 36 rechazan H₀ | 36 / 36 rechazan H₀ | −0,629 / −0,781 |
| nDCG@5 | 36 / 36 rechazan H₀ | 36 / 36 rechazan H₀ | −0,662 / −0,817 |
Criterio de decisión: α = 0,05 representa un riesgo máximo de 5 % de rechazar H₀ cuando es verdadera. Se rechaza H₀ cuando el valor p ajustado por Holm es menor que 0,05. Los estadísticos t y W varían por modelo, corpus y perfil; el resumen muestra la decisión conjunta de los 36 contrastes.
Los embeddings conservan capacidad de recuperación bajo ruido; sin embargo, el desempeño disminuye significativamente conforme aumenta el número de errores.
Las tres familias mantuvieron capacidad de recuperación con 2 y 4 errores.
Todas las familias presentaron una disminución significativa de MRR@5.
Los modelos orientados a recuperación mostraron la mayor robustez relativa.
La corrección DL recuperó parte del desempeño sin alcanzar la condición limpia.
La tesis priorizó su ventana de contexto de 128K tokens para construir respuestas con evidencia documental extensa.
| Modelo | Conf. 1 | Conf. 2 | Conf. 3 | MCRC global |
|---|---|---|---|---|
| tiiuae/Falcon3-7B-Instruct | 342 | 396 | 326 | 62,22 % |
| Qwen/Qwen2-7B-Instruct | 324 | 403 | 331 | 61,87 % |
| microsoft/Phi-3-mini-4k-instruct | 301 | 409 | 298 | 58,95 % |
| microsoft/Phi-3-mini-128k-instruct | 332 | 390 | 266 | 57,78 % |
| meta-llama/Llama-3.1-8B-Instruct | 258 | 390 | 275 | 53,98 % |
Fuente: tesis, Tablas 6.5 y 6.6. Se muestran los cinco modelos más pertinentes para la decisión.
p = 3,82 × 10−56: existen diferencias entre los diez modelos.
Sin diferencia significativa con α = 0,05.
Falcon presenta mayor exactitud.
Phi-3 128K no maximiza la exactitud; su selección se sustenta en la ausencia de diferencias significativas frente a la variante 4K y en una ventana de contexto considerablemente mayor.
Q de Cochran y prueba exacta de McNemar con corrección de Holm; α = 0,05.
Permite incorporar más evidencia recuperada, instrucciones y antecedentes conversacionales.
No difiere significativamente de Phi-3 Mini 4K en la evaluación estricta.
Resultado con extracción inequívoca sobre 570 preguntas en español latinoamericano.
Se conserva microsoft/Phi-3-mini-128k-instruct: la prioridad del sistema es procesar contexto documental amplio; la variante 128K mantiene un desempeño comparable a Phi-3 4K y ya fue integrada en la arquitectura de la tesis.
discrepancias de ranking
en 48 combinaciones de modelo y muestrapara ambos métodos
el empate es un control esperadoFuente: tesis, Tabla 6.7; verificación por consulta del experimento reproducido.
RSF: suma puntajes normalizados · RRF: combina las posiciones de ambos rankings · Embedding: recuperación semántica sin BM25
| Método | MRR | Recall@1 | Recall@5 | Recall@10 |
|---|---|---|---|---|
| RSF / Lineal α=0,50 | 0,6601 | 0,5605 | 0,7825 | 0,8360 |
| Lineal α=0,70 | 0,6327 | 0,5433 | 0,7361 | 0,7787 |
| Lineal α=0,30 | 0,6263 | 0,5383 | 0,7289 | 0,7779 |
| RRF | 0,5796 | 0,4799 | 0,6845 | 0,7655 |
| BM25 | 0,5594 | 0,4700 | 0,6628 | 0,7136 |
| Embedding | 0,5196 | 0,4391 | 0,6089 | 0,6624 |
Entre los pesos evaluados (0,30, 0,50 y 0,70), α = 0,50 obtuvo el mayor promedio.
Fuente: tesis, Tablas 6.7 y 6.9. Promedios sobre 16 modelos de embeddings.
MRR = 0,6780
Δ frente a RSF = +0,0268
p ajustado por Holm = 0,009
MRR promedio = 0,6778
MRR promedio = 0,6512
Se evaluaron 21 valores de α en tres muestras disjuntas. El máximo global se obtiene con 0,30; la validación determina el peso adecuado para cada modelo.
48 bloques: 16 modelos × semillas 2024, 2025 y 2026; α de 0 a 1 en incrementos de 0,05. Fuente: metrics_by_model_seed_method.csv.
| Modelo | α = 0 | α = 0,30 | α = 0,50 | α = 0,70 | α = 1 |
|---|---|---|---|---|---|
| Qwen/Qwen3-Embedding-8B | 0,9122 | 0,8823 | 0,7751 | 0,6630 | 0,5259 |
| intfloat/multilingual-e5-large | 0,8817 | 0,8381 | 0,7284 | 0,6373 | 0,5259 |
| BAAI/bge-m3 | 0,8697 | 0,8374 | 0,7340 | 0,6429 | 0,5259 |
| intfloat/multilingual-e5-base | 0,8511 | 0,8143 | 0,7138 | 0,6305 | 0,5259 |
| intfloat/multilingual-e5-small | 0,8310 | 0,8005 | 0,7050 | 0,6264 | 0,5259 |
| intfloat/e5-mistral-7b-instruct | 0,3885 | 0,6557 | 0,6293 | 0,5827 | 0,5259 |
| sentence-transformers/paraphrase-multilingual-mpnet-base-v2 | 0,5748 | 0,6937 | 0,6688 | 0,6111 | 0,5259 |
| sentence-transformers/use-cmlm-multilingual | 0,4829 | 0,6691 | 0,6492 | 0,6006 | 0,5259 |
Qwen3, BGE-M3 y la familia multilingual-E5 favorecen valores bajos de α; E5-Mistral, MPNet y USE-CMLM alcanzan mejores resultados con una mayor contribución léxica.
8 de 16 modelosMRR promedio de las semillas 2024–2026, calculado desde metrics_by_model_seed_method.csv.
| Modelo | α = 0 | α = 0,30 | α = 0,50 | α = 0,70 | α = 1 |
|---|---|---|---|---|---|
| somosnlp-hackathon-2022/paraphrase-spanish-distilroberta | 0,4783 | 0,6613 | 0,6476 | 0,5992 | 0,5259 |
| hiiamsid/sentence_similarity_spanish_es | 0,4518 | 0,6247 | 0,6385 | 0,5983 | 0,5259 |
| sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 | 0,4865 | 0,6306 | 0,6403 | 0,5987 | 0,5259 |
| sentence-transformers/LaBSE | 0,3931 | 0,5961 | 0,5990 | 0,5722 | 0,5259 |
| sentence-transformers/distiluse-base-multilingual-cased-v2 | 0,4399 | 0,5892 | 0,6139 | 0,5860 | 0,5259 |
| sentence-transformers/all-MiniLM-L6-v2 | 0,3931 | 0,5737 | 0,5841 | 0,5663 | 0,5259 |
| dccuchile/bert-base-spanish-wwm-cased | 0,2032 | 0,5349 | 0,5501 | 0,5409 | 0,5259 |
| bert-base-multilingual-cased | 0,1531 | 0,4470 | 0,5423 | 0,5463 | 0,5259 |
En este grupo, la mayoría de los modelos favorece valores de α próximos a 0,50; BERT multilingüe alcanza su máximo en 0,70.
43 de 48 bloques aumentaron el MRR · 37 de 48 cumplieron el criterio de robustezMRR promedio de las semillas 2024–2026 desde metrics_by_model_seed_method.csv; robustez desde paired_comparisons.csv.
Permite adaptar la contribución léxica y semántica al modelo y al corpus.
En cinco de 48 escenarios no hubo mejora y el efecto fue pequeño en varios modelos.
La selección de α debe realizarse con validación separada, no fijarse a partir del conjunto de prueba.
Ajustar el peso puede mejorar la recuperación frente a RSF, pero la magnitud y el valor de α dependen del modelo de embeddings. El resultado respalda una arquitectura configurable y una evaluación específica por corpus.
Frente a 0,521 con LangChain.
IC bootstrap 95 %: diferencia positiva.
p ajustado (Holm) = 2,06 × 10−8.
| Métrica | Propuesta | LangChain | Diferencia | p ajustado (Holm) |
|---|---|---|---|---|
| Hit@10 | 0,876 | 0,521 | +0,355 | 9,09 × 10−13 |
| MRR | 0,621 | 0,345 | +0,275 | 2,06 × 10−8 |
| nDCG | 0,682 | 0,387 | +0,295 | 1,24 × 10−8 |
| Context recall | 0,876 | 0,521 | +0,355 | 1,64 × 10−10 |
121 consultas de prueba por sistema. Contrastes pareados con corrección de Holm.
| Métrica | Propuesta | LangChain | p ajustado por Holm |
|---|---|---|---|
| BLEU | 0,034 | 0,018 | <0,001 |
| ROUGE-1 | 0,305 | 0,266 | <0,001 |
| METEOR | 0,135 | 0,109 | <0,001 |
| BERTScore | 0,697 | 0,676 | <0,001 |
| Métrica | Propuesta | LangChain | p ajustado por Holm |
|---|---|---|---|
| Faithfulness | 0,426 | 0,291 | 0,00039 |
| Hallucination Rate | 57,4 % | 70,9 % | — |
| Diferencia de fidelidad | +13,5 puntos porcentuales | 0,00039 | |
Interpretación: la ventaja se atribuye a un contexto documental más completo y pertinente, no a una diferencia en el conocimiento paramétrico del modelo generativo.
| Métrica | Propuesta | LangChain | p ajustado por Holm |
|---|---|---|---|
| Answer Relevance | 0,838 | 0,836 | 0,335 |
Criterio de decisión estadística: el ajuste de Holm controla falsos positivos en comparaciones múltiples. Valores inferiores a 0,05 permiten rechazar H0; valores iguales o superiores no aportan evidencia suficiente de diferencia. El valor α = 0,10 se seleccionó mediante validación y permaneció fijo durante la prueba y la generación.
La evidencia cuantitativa respalda una mejora clara en recuperación, cobertura contextual y métricas textuales. La factualidad se estima afirmación por afirmación: una afirmación se considera respaldada solo cuando el clasificador NLI identifica entailment con el contexto recuperado.
Hit@10, MRR y nDCG favorecen al recuperador propuesto.
Faithfulness aumenta 13,5 puntos porcentuales; Hallucination Rate = 1 − Faithfulness, por lo que disminuye en la misma magnitud.
Se conserva la arquitectura propuesta; LangChain constituye la línea base reproducible.
26 hombres, 15 mujeres; edad media 20,98 años.
27 hombres, 22 mujeres; edad media 20,88 años.
Cinco literales y cinco inferenciales por participante.
Promedio de 5,37 consultas entre quienes usaron el sistema.
Fuente: registros consolidados del experimento 5. La unidad inferencial es el participante; las consultas se describen por separado.
Las respuestas se calificaron como correcta = 1, parcial = 0,5 e incorrecta = 0. La ausencia de respaldo se registró como indicador independiente.
Shapiro–Wilk evaluó normalidad y Levene homogeneidad de varianzas. Las variables discretas y no normales se contrastaron sin asumir distribución normal.
U de Mann–Whitney comparó grupos independientes. Se reporta delta de Cliff para cuantificar dirección y magnitud del efecto.
Nivel de significancia α = 0,05. Holm ajustó los valores p de las siete variables para controlar falsos positivos.
Una respuesta no respaldada vale 0 para comprensión y, simultáneamente, suma al indicador de respuestas no respaldadas; nunca reduce el desempeño por debajo de cero.
| Variable | RAG | Museo virtual | Efecto | p ajustado (Holm) | Decisión |
|---|---|---|---|---|---|
| Tiempo de exploración | Mediana 968 s | Mediana 610 s | δ = +0,364 | 0,0184 | Rechazar H0 |
| Carga mental | Media 6,61 | Media 7,06 | δ = −0,085 | 0,9842 | No rechazar H0 |
| MCRC | Media 1,17 | Media 1,61 | δ = −0,188 | 0,5060 | No rechazar H0 |
| Eficiencia cognitiva | Media −0,186 | Media 0,156 | δ = −0,202 | 0,5060 | No rechazar H0 |
| Comprensión literal | Media 0,344 | Media 0,359 | δ = −0,082 | 0,9842 | No rechazar H0 |
| Comprensión inferencial | Media 0,093 | Media 0,204 | δ = −0,360 | 0,0177 | Rechazar H0 |
| Respuestas no respaldadas | 5,12 % | 5,92 % | δ = −0,106 | 0,9842 | No rechazar H0 |
Interpretación: δ positivo favorece RAG y δ negativo favorece el museo virtual. Un pHolm inferior a 0,05 indica significancia estadística tras ajustar siete comparaciones.
El acceso conversacional modificó el comportamiento de exploración: los participantes permanecieron más tiempo y formularon preguntas para ampliar o aclarar información. En esta muestra no produjo una mejora en comprensión; la condición de museo virtual obtuvo mayor desempeño inferencial.
La contribución demostrada es una capa adicional de consulta y exploración documental.Fuente: experimento 5; categorías calculadas sobre 220 consultas únicas. El análisis temático es descriptivo.
Los modelos orientados a recuperación conservaron el mejor desempeño con dos y cuatro errores; la normalización ayudó en consultas más dañadas.
La ponderación léxica-semántica puede mejorar la recuperación, pero el valor conveniente depende del modelo y debe elegirse con validación separada.
Hit@10, MRR, nDCG, cobertura contextual y fidelidad favorecieron al recuperador propuesto con diferencias significativas.
La interacción fue más prolongada y estuvo orientada a ampliar o aclarar información; no produjo una ventaja en comprensión.
Conclusión central: en un RAG especializado, mejorar la evidencia recuperada es condición necesaria para fundamentar la respuesta, pero no garantiza por sí sola comprensión ni ausencia de alucinaciones.
¿Es viable utilizar un SLM para generar respuestas contextualizadas sobre información museográfica que mantengan fidelidad fáctica respecto de los documentos de referencia?
Sí, en el dominio y corpus evaluados, como prototipo de investigación.Phi-3 Mini 128K generó respuestas contextualizadas y la propuesta mejoró la fidelidad frente a LangChain. La tasa de respuestas no respaldadas de 57,4 % impide recomendar su uso institucional sin verificación adicional.Cumplido a nivel de prototipo: se desarrolló y evaluó un sistema RAG museográfico basado en un SLM.
Se documentaron las limitaciones de acceso y consulta de información museográfica.
Se integraron recuperación, construcción de contexto y generación en una arquitectura RAG.
Se evaluaron ruido ortográfico, variabilidad textual y fusión léxica-semántica.
Se contrastó el sistema integral y se analizó la interacción de 90 participantes.
INEGI. (2026). Estadística de Museos (EM) 2025. Reporte de resultados 15/26. https://www.inegi.org.mx/contenidos/saladeprensa/boletines/2026/museos/EM2025_RR.pdf
INEGI. (2025). Módulo sobre Eventos Culturales Seleccionados (MODECULT) 2025. Reporte de resultados. https://www.inegi.org.mx/contenidos/saladeprensa/boletines/2025/modecult/modecult2025_RR.pdf
Galina Russell, I. (2018). La digitalización de fondos patrimoniales. El caso de México. Relaciones, 39(155), 135–166. doi:10.24901/rehs.v39i154.300
Morales-del-Castillo, J. M., Ángeles Jiménez, P. y Molina Salinas, C. (2019). Mexico’s Tradition and Culture Entering the Digital Age. Heritage, 2(1), 356–365. doi:10.3390/heritage2010024
Molina Salinas, C. (2023). Desafíos de la preservación digital del patrimonio cultural en México: el caso de Mexicana. Cuadernos.info, 55, 211–232. doi:10.7764/cdi.55.48751
Treviño, R. (2026). From Museum to Server: The Challenge of Preserving History in the Digital Age. TecScience. tecscience.tec.mx/en/education-and-humanism/digitizing-cultural-heritage/
Lewis, P. et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS, 33, 9459–9474.
Gao, Y. et al. (2023). Retrieval-Augmented Generation for Large Language Models: A Survey. arXiv:2312.10997. doi:10.48550/arXiv.2312.10997
Manning, C. D., Raghavan, P. y Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press.
Järvelin, K. y Kekäläinen, J. (2002). Cumulated gain-based evaluation of IR techniques. ACM TOIS, 20(4), 422–446. doi:10.1145/582415.582418
Maynez, J. et al. (2020). On Faithfulness and Factuality in Abstractive Summarization. ACL, 1906–1919. doi:10.18653/v1/2020.acl-main.173
Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions. arXiv:2311.05232.
Zhang, Y. et al. (2023). Siren’s Song in the AI Ocean: A Survey on Hallucination in Large Language Models. arXiv:2309.01219.
Papineni, K. et al. (2002). BLEU: a Method for Automatic Evaluation of Machine Translation. ACL, 311–318. doi:10.3115/1073083.1073135
Lin, C.-Y. (2004). ROUGE: A Package for Automatic Evaluation of Summaries. Text Summarization Branches Out, 74–81.
Banerjee, S. y Lavie, A. (2005). METEOR: An Automatic Metric for MT Evaluation. ACL Workshop, 65–72. doi:10.3115/1626355.1626389
Zhang, T. et al. (2020). BERTScore: Evaluating Text Generation with BERT. ICLR 2020. arXiv:1904.09675.
Es, S., James, J., Espinosa Anke, L. y Schockaert, S. (2024). RAGAs: Automated Evaluation of Retrieval Augmented Generation. EACL System Demonstrations, 150–158. doi:10.18653/v1/2024.eacl-demo.16
Saad-Falcon, J., Khattab, O., Potts, C. y Zaharia, M. (2024). ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems. NAACL, 338–354. doi:10.18653/v1/2024.naacl-long.20
Zheng, L. et al. (2023). Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. arXiv:2306.05685. doi:10.48550/arXiv.2306.05685
Jung, T. y Joe, I. (2025). An Intelligent Docent System with a Small Large Language Model Based on RAG. Applied Sciences, 15(17), 9398. doi:10.3390/app15179398
Wan, J. et al. (2025). An LLM-Based QA System for Chinese Painting and Calligraphy with Knowledge Graphs and External Documents. npj Heritage Science. doi:10.1038/s40494-025-02219-3
Clarizia, F. et al. (2025). Enhancement Large Language Models Domain Through Ontology-Based RAG. IJSWIS, 21(1), 1–29. doi:10.4018/IJSWIS.392507
Kelly, P., Schild, J. y Jafari, A. (2025). FolkRAG: A RAG System for Cultural Heritage Materials. Neural Computing and Applications, 37, 20281–20297. doi:10.1007/s00521-025-11455-4
Zeng, Y. et al. (2025). Is AIGC Technology Useful? A Comparative Analysis of Search Technologies for Online Museums. Proc. ASIS&T, 62, 1155–1160. doi:10.1002/pra2.1362
Qi, J. et al. (2024). RAG-Optimized Tibetan Tourism LLMs: Enhancing Accuracy and Personalization. arXiv:2408.12003. doi:10.48550/arXiv.2408.12003
Zhou, J., Si, L. y Hou, W. (2025). Humanities-in-the-Loop: Using Close Reading as a Method for RAG. Proc. ASIS&T, 62(1), 1185–1189. doi:10.1002/pra2.1355
Kucia, F. J. et al. (2025). How to Make Museums More Interactive? Case Study of Artistic Chatbot. ACM CIKM, 6654–6658. arXiv:2509.00572.
Guragain, A. et al. (2025). A Personalized, Multimodal AI Assistant for Enhancing Museum Visitor Experience. ALA Workshop, CEUR-WS, 4136.
Song, S. et al. (2024). TravelRAG: A Tourist Attraction Retrieval Framework Based on Multi-Layer Knowledge Graph. ISPRS IJGI, 13(11), 414. doi:10.3390/ijgi13110414
Xu, J. et al. (2024). ChatTf: A Knowledge Graph-Enhanced Intelligent Q&A System for Mitigating Factuality Hallucinations in Traditional Folklore. IEEE Access, 12, 162638–162650. doi:10.1109/ACCESS.2024.3485877
Wang, Y. et al. (2024). Factuality of Large Language Models: A Survey. arXiv:2402.02420. doi:10.48550/arXiv.2402.02420
Wang, C. et al. (2023). Survey on Factuality in Large Language Models: Knowledge, Retrieval and Domain-Specificity. arXiv:2310.07521.
Clarizia, F. et al. (2025). Reducing Hallucinations in LLMs: A Semantic Approach for Cultural Heritage. i-Cities 2025.
Kirchenbauer, J. y Barns, C. (2024). Hallucination Reduction in Large Language Models with RAG Using Wikipedia Knowledge. OSF Preprints. doi:10.31219/osf.io/pv7r5
Hu, M. et al. (2024). Mitigating Large Language Model Hallucination with Faithful Finetuning. arXiv:2406.11267.
Ali, M., Mabrouk, M. y Taha, Z. (2024). Hallucination Mitigation Techniques in Large Language Models. IJICIS, 24(4), 73–81. doi:10.21608/ijicis.2024.336135.1365
Pham, D. K. y Vo, B. Q. (2024). Towards Reliable Medical Question Answering: Techniques and Challenges in Mitigating Hallucinations. arXiv:2408.13808.
Wang, P. et al. (2025). What Are Models Thinking About? Understanding LLM Hallucinations Through Model Inner State Analysis. arXiv:2502.13490.
Liu, X. (2024). A Survey of Hallucination Problems Based on Large Language Models. Applied and Computational Engineering, 97, 24–30. doi:10.54254/2755-2721/97/2024.17851
Criterios, reglas y formato JSON utilizados por los evaluadores.
Postprocesamiento geométrico de espacios de embeddings.
Participación como ponente en jornadas académicas.
Actividad formativa impartida en el campamento de IA de CENIDET.
Presentación del proyecto SanEEG en la etapa local.
Pregunta, respuesta generada, diez contextos recuperados, perfil demográfico y documento de referencia.
Usar solamente los contextos proporcionados, evaluar cada registro y devolver un arreglo JSON estricto.
Fuente: tesis, Anexo A.

Constancia de presentación del artículo sobre postprocesamiento geométrico de embeddings para clasificación de textos.
Reconocimiento como ponente en las Jornadas Académicas de Innovación, Tecnología, Liderazgo y Sostenibilidad 2025.
Fuente: tesis, Anexos B y C.

Reconocimiento por impartir el taller durante el Primer Campamento de Verano de Inteligencia Artificial de CENIDET.
Constancia de participación con el proyecto SanEEG en la categoría Servicios para la Salud Humana.
Fuente: tesis, Anexos D y E.