Todos los posts
Agentes autónomos en operaciones reales: lo que aprendimos en producción
Seis meses corriendo agentes con aprobación humana en procesos de back-office. Qué funcionó, qué no, y por qué el límite humano-importa más que el modelo.
Cómo evaluamos sistemas RAG antes de ponerlos en producción
Un framework de evaluación en tres capas: recuperación, generación y comportamiento en el flujo real del negocio.
Orquestación multi-agente: cuándo tiene sentido y cuándo no
Más agentes no es mejor. Patrones de coordinación que reducen latencia y errores en flujos complejos.
Automatización con aprobaciones: el modelo que más escala
No todo debe ser 100% autónomo. El sweet spot está en automatizar el 80% y reservar el 20% crítico para humanos.
LLMs en LATAM: infraestructura, latencia y costos reales
Benchmark de latencia y costo por token para despliegues en México y Colombia. Datos de campo, no marketing.
Memoria conversacional en agentes de larga duración
Cómo diseñamos memoria que persiste entre sesiones sin filtrar datos sensibles.
Observabilidad para agentes: trazas, costos y decisiones
Qué loguear cuando un agente toma decisiones autónomas y cómo auditar sin frenar el sistema.
Fine-tuning vs prompting: cuándo invertir en cada uno
Reglas prácticas basadas en 12 proyectos. El 90% de casos no necesita fine-tuning.