Resumen
Construimos la plataforma que el equipo usa para calificar las salidas del modelo antes y después de las corridas de entrenamiento: creación de rúbricas, comparaciones pareadas a ciegas, calibración de evaluadores y tarjetas de puntuación exportables que alimentan directamente el conjunto de datos de preferencias de RLHF. Reemplazó un mosaico de hojas de cálculo y scripts improvisados.
Qué entregamos
- Interfaz para la creación de rúbricas
- Flujo de comparación pareada a ciegas
- Incorporación y calibración de evaluadores
- Exportación de tarjetas de puntuación (CSV + JSONL)
- Métricas de administración (IRR, deriva, rendimiento)
- Adaptador de proveedor de modelos para salidas de referencia
Stack
Python · FastAPI · PostgreSQL · Next.js · LangGraph · OpenAI API
Duración: 6 meses
Año: 2025
Industria: IA / ML