Fine-tuning tiene sentido cuando tienes miles de ejemplos etiquetados, un dominio muy específico y latencia crítica. Para todo lo demás, prompting estructurado con evaluación continua gana.
El error más común: fine-tunear antes de tener un baseline sólido con el modelo base.