El diseño que usé — una cascada de coste
- Claude Haiku hace las siete llamadas de clasificación/extracción por campo. Es una tarea acotada (leer un fragmento de texto, decidir sí/no y extraer una cita), donde un modelo rápido y barato rinde prácticamente igual que uno caro.
- Claude Sonnet entra solo una vez, al final, para la síntesis: recibe los datos ya estructurados (no el texto en bruto) y da el nivel de confianza del análisis con su justificación — el único paso donde el razonamiento de más calidad realmente cambia el resultado.
- Antes de que cualquier LLM entre en juego, un paso de recuperación por embeddings (gratis, corre en local) filtra qué fragmentos del texto son relevantes para cada pregunta — así ningún modelo, ni el barato ni el caro, procesa nunca el documento entero.