Cómo se sabe que hace falta

  • Alguien mejoró el prompt la semana pasada y nadie puede demostrar que ayudó.
  • Cambió la versión de un modelo por debajo y la calidad se movió, pero se enteraron por un cliente.
  • Probar un cambio significa que una persona pruebe cinco preguntas a mano y se forme una impresión.
  • El equipo tiene miedo de tocar un prompt que funciona, así que la función dejó de mejorar en silencio.
  • El costo por request crece y nadie puede atribuir el aumento a un cambio concreto.

Qué obtiene

Un conjunto fijo de preguntas que refleja la realidad

Construido con su tráfico real y sus casos límite, incluidos los que ya los pusieron en un aprieto, con las respuestas que usted espera.

Una medición en cada cambio

Prompt, modelo, parámetros de recuperación, fragmentación: cambie cualquiera y vea el efecto sobre exactitud, anclaje a las fuentes y comportamiento ante lo que no sabe, antes de publicar.

Costo y latencia junto a la calidad

Porque una respuesta dos por ciento mejor y cuatro veces más cara no es una mejora, y ese equilibrio debería estar a la vista cuando se toma la decisión.

Corre en CI, como cualquier otra prueba

Un pull request que degrada la función de IA falla, igual que uno que rompe una prueba unitaria. Eso es lo que convierte la disciplina en infraestructura.

Trazas legibles

Cuando la puntuación baja hace falta ver qué se recuperó y qué hizo el modelo con eso. Un número sin explicación solo indica que hay que asustarse.

Para quién es

Equipos con una función de IA ya en producción

Funciona, importa, y hoy cada cambio es un salto al vacío.

Equipos por cambiar de modelo o de proveedor

Migrar de modelo sin un conjunto de evaluación es una reescritura sin pruebas. La suite se paga sola en la primera migración.

Equipos con costos de IA en aumento

El costo por request medido en cada cambio convierte una sorpresa trimestral en una decisión de ingeniería.

Equipos que tuvieron una falla pública

Algo salió mal delante de clientes, y la corrección tiene que ser verificable y no prometida.

Qué se lleva

  • Una suite de evaluación construida con sus preguntas y sus casos límite
  • Medición de exactitud, anclaje a las fuentes, comportamiento ante lo desconocido, latencia y costo
  • Integración con CI, para que un retroceso bloquee un merge en lugar de llegar a los usuarios
  • Una medición inicial de dónde están hoy, que suele ser el entregable más incómodo y más útil
  • Una guía breve para que su equipo sume casos a medida que aparezcan fallas nuevas

Preguntas que nos hacen

¿Se puede evaluar un sistema no determinístico?

Sí, de forma estadística y no exacta. No se afirma que una salida sea igual a un texto. Se puntúa un conjunto de casos sobre las dimensiones que importan y se observa el agregado a lo largo de los cambios. El mismo razonamiento vale para cualquier sistema donde el resultado individual es incierto pero la distribución es lo bastante estable como para medirse.

¿Cuántos casos de prueba hacen falta?

Menos de los que los equipos suponen. Entre treinta y cincuenta casos bien elegidos, que cubran su distribución real y sus fallas conocidas, atrapan la mayoría de los retrocesos. Mil casos generados que se parecen entre sí atrapan menos y cuestan más de correr.

¿Funciona con nuestro stack?

La suite se construye alrededor de su frontera de API y no de un framework concreto, así que funciona con lo que sea que llamen: LangChain, LangGraph, APIs directas de proveedores o su propia capa. Tiene que ser así, porque el punto es sobrevivir a que ustedes cambien esa capa.

¿Vale la pena si la función es chica?

De forma proporcional. Una función chica necesita un puñado de casos y un paso de CI, no un programa de trabajo. El costo de no tenerlo aparece la primera vez que cambian de modelo y no pueden decir qué se movió.

Contacto

Empezar por una medición inicial

El primer paso útil es medir dónde están hoy. Suele llevar un par de semanas y es incómodo de forma productiva: la mayoría de los equipos descubre que su función es peor de lo que creía en casos que nunca probó. Cuéntenos qué hace su función de IA y definimos el alcance.

¿Prefiere el correo? Escriba a [email protected]. Respondemos desde una dirección real, y nada de lo que envíe se guarda en otro lado que nuestra casilla.