¿Alguien usa Humanloop para evaluar prompts en producción?
Llevo dos semanas integrando Humanloop en nuestro pipeline de prompts y la verdad es que está mejorando bastante el control de calidad. Antes teníamos versiones de prompts esparcidas por todos lados. ¿Alguien más lo usa aquí? Me gustaría saber cómo manejan los A/B tests entre variantes y si vale la pena para equipos pequeños.