La distancia que nadie le avisó

  • Responde precioso en la demo y se inventa cosas con total seguridad frente a un cliente.
  • Nadie puede decir si el cambio de prompt de la semana pasada mejoró o empeoró las respuestas.
  • Llega la factura y una sola función cuesta más que el resto de la infraestructura.
  • Cita un documento que no dice lo que la respuesta afirma que dice.
  • La latencia está bien hasta que el modelo se pone lento, y ahí la página entera queda esperando.
  • Funciona con los diez documentos de prueba y se desarma con diez mil.

Qué construimos

Recuperación que efectivamente recupera

Fragmentación ajustada a sus documentos, búsqueda híbrida vectorial y por palabra clave, fusión de rankings, y filtrado por diversidad para que la ventana de contexto no sean cinco copias del mismo párrafo.

Respuestas ancladas en sus fuentes

Respuestas limitadas a la evidencia recuperada, con citas que el usuario puede abrir y verificar. El trabajo del modelo es resumir sus datos, no recordar internet.

Evaluación antes de publicar

Un conjunto fijo de preguntas con resultados esperados, medido en cada cambio, para que cambiar un prompt o un modelo sea una decisión con números y no una corazonada.

Guardrails y caminos de falla

Validación de entrada, esquemas de salida, manejo de negativas, tiempos límite y alternativas, para que un mal día del modelo degrade la función en lugar del producto.

Agentes con correa

Tool calling y salidas estructuradas con pasos acotados, permisos explícitos y registro de auditoría, porque un agente que puede actuar necesita límites sobre qué puede tocar.

Costo y latencia bajo control

Enrutamiento de modelos según la dificultad de la tarea, caché, procesamiento por lotes, presupuestos de tokens y streaming, más seguimiento de costo por función para saber a qué atribuir el gasto.

Proyectos típicos

Asistente de conocimiento interno

Indexar los documentos de la empresa, hacerlos consultables y respondibles con citas, y mantener el índice al día a medida que los documentos cambian. Ingesta idempotente, así reprocesar es seguro.

Rescatar un prototipo que alucina

Medir cuán seguido se equivoca antes de cambiar nada, y después corregir las causas en orden: casi siempre primero la calidad de la recuperación, segundo el anclaje a las fuentes, tercero los guardrails.

Poner evaluación alrededor de una función existente

Construir la suite de regresión que la función nunca tuvo, para que el equipo pueda iterar prompts y modelos sin publicar un retroceso.

Bajar el costo de una función de IA

Perfilar el gasto por request, derivar los casos fáciles a modelos más baratos, cachear lo que se repite, y recortar contexto que nunca justificó sus tokens.

Procesamiento de documentos a escala

Extracción y clasificación sobre grandes volúmenes, con salidas estructuradas, manejo de confianza y una vía de revisión humana para los casos dudosos.

Qué se lleva

  • Un pipeline funcionando en su infraestructura, no un notebook
  • Una suite de evaluación que puede correr en CI, con una línea base que superar
  • Números de costo y latencia por request, y de dónde salen
  • Trazas legibles para cuando una respuesta esté mal, mostrando qué se recuperó y por qué
  • Documentación de lo que el sistema no va a hacer, que importa tanto como lo que sí

Preguntas que nos hacen

¿Necesitamos entrenar un modelo propio?

Casi nunca, y suele ser la respuesta cara a un problema de recuperación. Mejor fragmentación, búsqueda híbrida y anclaje a las fuentes resuelven la mayoría de las quejas de calidad a una fracción del costo. El ajuste fino se gana su lugar para tono, formato o un vocabulario muy específico, y después de que la recuperación ya funcione bien.

¿Cómo se mide si una función de IA es buena?

Con un conjunto fijo de preguntas representativas y resultados esperados, medido automáticamente en cada cambio: exactitud, anclaje a las fuentes, comportamiento ante lo que no sabe, latencia y costo. El número importa menos que el hecho de que se mueva en una dirección que usted puede ver antes que sus usuarios.

¿Qué proveedor de modelos usan?

El que le sirva a la tarea, y mantenemos la integración detrás de una interfaz para que cambiar sea configuración y no una reescritura. El precio y las capacidades de los modelos se mueven lo bastante rápido como para que atar la arquitectura a un solo proveedor sea un riesgo en sí mismo.

¿Nuestros datos se usan para entrenar el modelo de alguien?

No, si la integración está bien configurada, y esa es una decisión de despliegue que tomamos de forma explícita con usted en lugar de heredarla de un valor por defecto. Conviene definirlo antes del primer request, no después.

Contacto

Iniciar una conversación

Cuéntenos qué están construyendo, o qué se está rompiendo. Va a recibir una respuesta directa de un ingeniero, no un libreto de ventas.

¿Prefiere el correo? Escriba a [email protected]. Respondemos desde una dirección real, y nada de lo que envíe se guarda en otro lado que nuestra casilla.