La mayoría de los proyectos RAG fallan no por el modelo, sino porque nadie definió qué significa "respuesta correcta" antes de desplegar.
Nuestro framework evalúa en tres capas: precisión de recuperación (¿trajo el documento correcto?), fidelidad de generación (¿inventó algo?) y utilidad operativa (¿el usuario puede actuar con la respuesta?).
Corremos este pipeline en cada release. Sin métricas baseline, no hay deploy.