SONNET CODE
← Volver a todos los casos
IA / ML 2025 · 6 meses

Plataforma de evaluación con humanos en el ciclo

Resumen

Construimos la plataforma que el equipo usa para calificar las salidas del modelo antes y después de las corridas de entrenamiento: creación de rúbricas, comparaciones pareadas a ciegas, calibración de evaluadores y tarjetas de puntuación exportables que alimentan directamente el conjunto de datos de preferencias de RLHF. Reemplazó un mosaico de hojas de cálculo y scripts improvisados.

Qué entregamos

  • Interfaz para la creación de rúbricas
  • Flujo de comparación pareada a ciegas
  • Incorporación y calibración de evaluadores
  • Exportación de tarjetas de puntuación (CSV + JSONL)
  • Métricas de administración (IRR, deriva, rendimiento)
  • Adaptador de proveedor de modelos para salidas de referencia

Stack

Python · FastAPI · PostgreSQL · Next.js · LangGraph · OpenAI API


Duración: 6 meses
Año: 2025
Industria: IA / ML

¿Quieres que construyamos el tuyo? Agenda una llamada de 15 minutos.