HERMES
Historical Ecology Retrieval & Multi-LLM Evaluation System
Una plataforma web para consultar y comparar seis grafos de conocimiento marino, generar respuestas con distintos LLMs y verificar —afirmación por afirmación— si cada respuesta está respaldada por las tripletas recuperadas.
El problema
Una respuesta plausible no necesariamente está fundamentada
GraphRAG puede recuperar un subgrafo y entregarlo como contexto a un modelo de lenguaje, pero eso no garantiza que la respuesta generada utilice realmente esa evidencia. El LLM todavía puede incorporar conocimiento paramétrico o producir afirmaciones que no aparecen en el grafo.
Los evaluadores tradicionales de RAG trabajan principalmente con fragmentos de texto. HERMES traslada la evaluación al contexto estructurado de GraphRAG: tripletas explícitas de sujeto, predicado y objeto.
Contribución científica
Grounding Fidelity: trazabilidad entre afirmaciones y evidencia simbólica
La contribución central de HERMES es un verificador neuro-simbólico post-generación. Descompone la respuesta en afirmaciones atómicas, contrasta cada una exclusivamente con las tripletas recuperadas y asigna uno de tres estados.
Existe evidencia directa y trazable en las tripletas.
La evidencia respalda solo una parte de la afirmación.
No hay evidencia suficiente en el subgrafo recuperado.
supported claims / total claimsUna medida conservadora que solo acredita afirmaciones completamente respaldadas.
(supported + 0.5 × partial) / totalUna variante que reconoce evidencia parcial sin equipararla con respaldo completo.
Arquitectura
Del corpus histórico a una respuesta auditable
El diseño expone toda la cadena de evidencia: consulta → nodos recuperados → subgrafo → tripletas → respuesta → verificación por afirmación.
Evaluación
Un experimento factorial sobre grafos y modelos
La evaluación combina 10 preguntas de competencia, 6 grafos construidos con distintos LLMs y 4 modelos generadores de respuestas: 240 configuraciones, de las cuales 235 produjeron resultados válidos.
La Grounding Fidelity ponderada promedio fue 0.50. El modelo de respuesta tuvo un efecto dominante, mientras que la calidad y cohesión del grafo también influyeron sobre la fundamentación final.
La mejor combinación fue el grafo construido con GPT-4o-mini y respuestas generadas con Llama 3.3 70B, con GF ponderada de 0.95 y GF estricta de 0.91.
Origen de la propuesta
De comparar grafos a evaluar la evidencia
HERMES surgió de la necesidad de comparar, bajo condiciones controladas, cómo distintos modelos de lenguaje afectan la estructura de los grafos de conocimiento y la calidad de las respuestas obtenidas a partir de ellos.
Durante ese desarrollo apareció una pregunta adicional: ¿cómo determinar si una respuesta está realmente fundamentada en el subgrafo recuperado? Esa necesidad dio origen a Grounding Fidelity, una métrica que cuantifica la trazabilidad de las afirmaciones generadas respecto de las tripletas utilizadas como contexto.
Tecnología y apertura
Un prototipo reproducible y abierto
Código publicado bajo licencia MIT. El repositorio incluye resultados de evaluación y análisis de sensibilidad.
Explorar el proyecto