← Volver al portfolio
Caso de estudio · GraphRAG · IA neuro-simbólica

HERMES

Historical Ecology Retrieval & Multi-LLM Evaluation System

Una plataforma web para consultar y comparar seis grafos de conocimiento marino, generar respuestas con distintos LLMs y verificar —afirmación por afirmación— si cada respuesta está respaldada por las tripletas recuperadas.

6grafos comparables
4LLMs de respuesta
240evaluaciones factoriales
0.95mejor GF ponderada

El problema

Una respuesta plausible no necesariamente está fundamentada

GraphRAG puede recuperar un subgrafo y entregarlo como contexto a un modelo de lenguaje, pero eso no garantiza que la respuesta generada utilice realmente esa evidencia. El LLM todavía puede incorporar conocimiento paramétrico o producir afirmaciones que no aparecen en el grafo.

Los evaluadores tradicionales de RAG trabajan principalmente con fragmentos de texto. HERMES traslada la evaluación al contexto estructurado de GraphRAG: tripletas explícitas de sujeto, predicado y objeto.

Contribución científica

Grounding Fidelity: trazabilidad entre afirmaciones y evidencia simbólica

La contribución central de HERMES es un verificador neuro-simbólico post-generación. Descompone la respuesta en afirmaciones atómicas, contrasta cada una exclusivamente con las tripletas recuperadas y asigna uno de tres estados.

Respaldada

Existe evidencia directa y trazable en las tripletas.

Parcial

La evidencia respalda solo una parte de la afirmación.

×No respaldada

No hay evidencia suficiente en el subgrafo recuperado.

GFstrictsupported claims / total claims

Una medida conservadora que solo acredita afirmaciones completamente respaldadas.

GFweighted(supported + 0.5 × partial) / total

Una variante que reconoce evidencia parcial sin equipararla con respaldo completo.

Arquitectura

Del corpus histórico a una respuesta auditable

01Seis grafosEl mismo corpus y prompts; cambia el LLM constructor.
02RecuperaciónEmbeddings, selección semántica y expansión de 1–3 saltos.
03GeneraciónUn LLM responde usando las tripletas serializadas como contexto.
04VerificaciónCada afirmación se audita contra el subgrafo recuperado.

El diseño expone toda la cadena de evidencia: consulta → nodos recuperados → subgrafo → tripletas → respuesta → verificación por afirmación.

Evaluación

Un experimento factorial sobre grafos y modelos

La evaluación combina 10 preguntas de competencia, 6 grafos construidos con distintos LLMs y 4 modelos generadores de respuestas: 240 configuraciones, de las cuales 235 produjeron resultados válidos.

La Grounding Fidelity ponderada promedio fue 0.50. El modelo de respuesta tuvo un efecto dominante, mientras que la calidad y cohesión del grafo también influyeron sobre la fundamentación final.

La mejor combinación fue el grafo construido con GPT-4o-mini y respuestas generadas con Llama 3.3 70B, con GF ponderada de 0.95 y GF estricta de 0.91.

Mejor combinación KGGPT-4o-mini × Llama 3.3 70B
0.95GF weighted
0.91GF strict

Origen de la propuesta

De comparar grafos a evaluar la evidencia

HERMES surgió de la necesidad de comparar, bajo condiciones controladas, cómo distintos modelos de lenguaje afectan la estructura de los grafos de conocimiento y la calidad de las respuestas obtenidas a partir de ellos.

Durante ese desarrollo apareció una pregunta adicional: ¿cómo determinar si una respuesta está realmente fundamentada en el subgrafo recuperado? Esa necesidad dio origen a Grounding Fidelity, una métrica que cuantifica la trazabilidad de las afirmaciones generadas respecto de las tripletas utilizadas como contexto.

Paper: Gustavo Nuñez, Marcos Zárate y Pablo R. Fillottrani.

Tecnología y apertura

Un prototipo reproducible y abierto

PythonStreamlitNetworkXMicrosoft GraphRAGOpenAIGroqGeminiPyVisPandas

Código publicado bajo licencia MIT. El repositorio incluye resultados de evaluación y análisis de sensibilidad.

Explorar el proyecto

Consultá un grafo, inspeccioná la evidencia y evaluá la respuesta.