Todas las soluciones

Modelos e ingeniería de IA

Un modelo general sabe de todo, menos de cómo trabaja tu empresa.

Se leyó todo el internet y ninguno de tus tickets. Tomamos un modelo de pesos abiertos, lo entrenamos con el trabajo que tu equipo ya hizo y lo medimos contra el que hoy pagas por token. Cuando gana el nuestro, corre en tu propia infraestructura, cuesta una fracción por petición y los pesos son tuyos.

Ver qué entrenamos
2 semanas
para tener una medición que diga si entrenar vale la pena siquiera
Tus pesos
el modelo entrenado es tuyo, sin nada que lo amarre a nosotros ni a un proveedor
10–40×
la caída típica en costo por petición cuando un modelo pequeño toma un trabajo de alto volumen
ES · EN
un equipo senior en tu mismo horario, en los dos idiomas

Qué entrenamos

Cuatro tipos de trabajo con modelos, y a la mayoría le basta uno.

Partimos de la tarea, no de la técnica. A veces la respuesta honesta es que no necesitas entrenar ningún modelo, y preferimos decirlo antes de que alguien firme algo.

Por dónde solemos empezar

Modelos abiertos afinados

Tomamos un modelo de pesos abiertos, lo seguimos entrenando con el trabajo que tu empresa ya hizo y terminamos con uno que responde y razona como lo hace tu equipo. Corre en tu hardware y los pesos son tuyos.

  • Adaptación de Llama, Qwen, Mistral y los demás
  • LoRA o afinado completo, según lo pida el trabajo
  • Entrenado con tus tickets, contratos y decisiones pasadas
  • Comparado contra el modelo de API que usas hoy
Por dónde solemos empezar

Modelos hechos para una tarea

Casi todo lo que las empresas le piden a un modelo grande es un solo trabajo angosto repetido un millón de veces: clasifica esto, sácame este dato, califica esta llamada. Un modelo pequeño entrenado para eso es más rápido, más barato y mucho más fácil de defender en una auditoría.

  • Clasificadores para turnar, triar y etiquetar
  • Extractores que sacan campos de documentos
  • Rankeadores y recomendadores sobre tu propio catálogo
  • Pronósticos y detección de anomalías con tu historia

Aprendizaje por refuerzo y ajuste por preferencia

Cuando la respuesta correcta es cuestión de criterio y no de etiqueta, entrenamos con el criterio mismo: lo que tus revisores aceptaron, lo que reescribieron y lo que tiraron a la basura.

  • Modelos de recompensa armados con las decisiones de tus revisores
  • Ajuste por preferencia con correcciones reales, no pares sintéticos
  • Políticas para agentes que tienen que actuar, no sólo responder
  • Ciclos de retroalimentación que siguen mejorando después del lanzamiento

Infraestructura de evaluación y despliegue

La parte que decide si algo de lo anterior sobrevive al contacto con producción: un conjunto de pruebas que atrapa regresiones, un registro que dice qué versión está viva y un despliegue que aguanta tu tráfico real.

  • Arneses de evaluación armados con tus propios casos difíciles
  • Cuantización y destilación para caber en tu presupuesto
  • Despliegue en GPU o CPU, con autoescalado o en tus servidores
  • Monitoreo de deriva, costo y calidad

Antes de entrenar nada

Entrenar es lo cuarto que hay que intentar, no lo primero.

Cada escalón de esta lista cuesta más que el de arriba y toma más tiempo cambiar de opinión. Bajamos en orden, y la mayoría de los proyectos se detiene antes de llegar al fondo.

  1. 01

    Un prompt a un modelo de frontera

    Esfuerzo típico: Días

    Un buen prompt contra Claude o GPT con tu contexto pegado adentro. Barato de intentar y barato de abandonar, que es justo por lo que va primero.

    Vale la pena cuando

    La tarea es poco frecuente, muy variada o cambia cada mes.

    No alcanza cuando

    La corres un millón de veces al día y la factura ya lo refleja.

  2. 02

    Búsqueda sobre tu propio contenido

    Esfuerzo típico: Semanas

    El modelo sigue siendo general y le entregas tus documentos al momento de preguntar. Casi todos los problemas de “el modelo no conoce nuestro negocio” en realidad son este problema.

    Vale la pena cuando

    Lo que falta es conocimiento que el modelo nunca tuvo.

    No alcanza cuando

    Lo que falta es comportamiento: formato, tono o criterio que sigue fallando.

  3. 03

    Afinar un modelo abierto

    Esfuerzo típico: 1–2 meses

    Le enseñas al modelo cómo se hace el trabajo mostrándole el trabajo hecho. Aquí cae la mayoría de nuestros proyectos de modelos.

    Vale la pena cuando

    Tienes miles de ejemplos de la tarea bien hecha.

    No alcanza cuando

    Todavía nadie se pone de acuerdo en qué es “bien hecha”.

  4. 04

    Aprendizaje por refuerzo

    Esfuerzo típico: 2–4 meses

    Entrenas con criterio en lugar de etiquetas: lo que se aceptó, lo que se corrigió y lo que se rechazó de tajo.

    Vale la pena cuando

    La calidad es cuestión de preferencia y tienes revisores.

    No alcanza cuando

    Una etiqueta sencilla habría capturado lo mismo.

  5. 05

    Entrenar desde cero

    Esfuerzo típico: Casi nunca

    Un modelo construido desde los cimientos. Para un puñado de tareas angostas y bien definidas es de verdad la respuesta correcta. Para cualquier cosa parecida a un chatbot, casi nunca lo es.

    Vale la pena cuando

    La tarea es angosta, los datos son tuyos y nada preentrenado embona.

    No alcanza cuando

    Quieres un chatbot. Mejor adapta uno.

Cobramos la evaluación que contesta esta pregunta, y la cobramos por separado, para que oír “no necesitas entrenar nada” te cueste dos semanas y no un proyecto.

Dónde se paga solo

Los trabajos que se comen una tarde, todas las tardes.

Ninguno de estos necesita un modelo que escriba poesía. Necesitan uno que le atine a tu trabajo, rápido y lo bastante barato como para correrlo sobre todo lo que entra.

  • Turnado de tickets y correos

    Cada mensaje clasificado por equipo, urgencia e idioma antes de que una persona lo abra, entrenado con diez años de cómo tu equipo los clasificó de verdad.

  • Extracción de documentos

    Facturas, notas de remisión y contratos convertidos en campos que tus sistemas pueden leer, incluidos los escaneados y la nota que alguien escribió al margen.

  • Calidad y detección de defectos

    Un modelo entrenado con tus propias imágenes o con tu historial de sensores, que marca el lote malo en la línea y no en casa del cliente.

  • Pronóstico de demanda y riesgo

    Entrenado con tus ventas, tus temporadas y tus quiebres, y no con una curva genérica que nunca ha visto tu mercado.

  • Calificación de llamadas y conversaciones

    Cada llamada calificada con los criterios que usan tus propios supervisores, para que el coaching cubra todas y no las tres que alguien alcanzó a escuchar.

  • Revisión de cumplimiento y políticas

    Una primera pasada a los documentos contra tus reglas internas, con la cláusula que se brincó señalada, para que tus revisores arranquen de una lista corta.

Cómo lo ingenieríamos

Lo que separa un demo de un modelo con el que puedes operar un negocio.

Un notebook que un día dio buen número no es un entregable. Esto es lo que construimos junto al modelo, y en conjunto suele ser más trabajo que el entrenamiento mismo.

  • Primero la evaluación

    Escribimos el conjunto de pruebas antes de entrenar nada. Si no podemos medir la tarea, tampoco podemos decirte si la mejoramos.

  • Corridas reproducibles

    Cada corrida queda fijada: versión de datos, versión de código, semilla y hardware. Un resultado que nadie puede reproducir es un rumor.

  • Linaje y consentimiento de datos

    Registramos de dónde salió cada ejemplo de entrenamiento y qué tienes permitido hacer con él, antes de que toque una GPU.

  • Versionado y reversa

    Los modelos se versionan como el código. Puedes ver cuál contestó una petición y regresar al anterior en minutos.

  • Presupuesto de costo y latencia

    Desde el arranque se fija una meta de precio por petición y de tiempo de respuesta. Un modelo que no la cumple no está terminado, por buena que se vea la exactitud.

  • Monitoreo de deriva

    Tu negocio cambia y el modelo deja de atinarle en silencio. Vigilamos eso y te avisamos cuándo toca reentrenar.

Cómo trabajamos

De “¿podrá un modelo hacer esto?” a uno en producción.

La primera fase existe para convencerte de no hacerlo. Nos sale más barato a los dos descubrir en dos semanas que una tarea no se puede aprender, que descubrirlo en cuatro meses.

  1. 01Estimado: 2 semanas

    Factibilidad y línea base

    Definimos la tarea con precisión, armamos el conjunto de pruebas y medimos cuánto saca ya un modelo de estante. Ese número es al que todo lo demás tiene que ganarle.

    EntregableUn conjunto de pruebas, una línea base y una recomendación

  2. 02Estimado: 2–4 semanas

    Curación de datos

    Armamos el conjunto de entrenamiento con trabajo que tu equipo ya hizo, lo limpiamos, etiquetamos lo que haga falta y apartamos los casos difíciles para el examen.

    EntregableUn conjunto de entrenamiento y evaluación versionado

  3. 03Estimado: 3–6 semanas

    Entrenamiento

    Corremos los experimentos, comparamos tamaños y técnicas, y nos detenemos en el modelo más pequeño que pase la vara que pusiste.

    EntregablePesos entrenados y las corridas que los produjeron

  4. 04Estimado: 1–2 semanas

    Evaluación y revisión

    Lo calificamos contra la línea base y ponemos sus peores respuestas frente a quienes hacen el trabajo hoy, porque un benchmark nunca atrapa todo.

    EntregableUn reporte de evaluación y un sí o un no

  5. 05Estimado: 2–3 semanas

    Despliegue

    Lo servimos dentro de tu infraestructura, detrás de una API que tus sistemas pueden llamar, con un plan B para los casos en los que no esté seguro.

    EntregableUn modelo servido, con monitoreo y manuales

  6. 06Estimado: Continuo

    Reentrenamiento y operación

    Se acumulan ejemplos nuevos, la calidad se desvía y el modelo se reentrena en un calendario que tu equipo puede correr sin nosotros en la sala.

    EntregableUn pipeline de reentrenamiento y la entrega

Los tiempos de cada etapa son una referencia de proyectos anteriores.

Stack

Con qué entrenamos y desplegamos.

Usamos lo que ya pagas siempre que aguante. Cuando no hay restricción, aquí es donde empezamos.

Modelos base
  • Llama
  • Qwen
  • Mistral
  • Gemma
  • DeBERTa
Entrenamiento
  • PyTorch
  • Hugging Face
  • LoRA / PEFT
  • TRL
  • Axolotl
  • Unsloth
ML clásico
  • scikit-learn
  • XGBoost
  • LightGBM
  • Prophet
Evaluación
  • Arneses propios
  • Weights & Biases
  • MLflow
  • Ragas
Despliegue
  • vLLM
  • TGI
  • ONNX Runtime
  • Triton
  • llama.cpp
Infraestructura
  • AWS
  • GCP
  • Modal
  • Docker
  • Terraform
  • Kubernetes

Cómo trabajamos contigo

Tres maneras de entrar, según qué tan seguro estés.

La mayoría empieza por arriba y decide después, con un número en la mano en lugar de una corazonada.

01

Estudio de factibilidad

Dos o tres semanas, precio cerrado, para contestar una sola pregunta: ¿puede un modelo hacer esto lo bastante bien como para valer la pena, y cuánto costaría operarlo?

Ideal para

Equipos con una tarea en mente y ninguna idea de si se puede aprender.

Incluye

  • Una tarea definida con precisión y su conjunto de pruebas
  • Una línea base con modelos de estante
  • Una proyección de costo y latencia
  • Una recomendación por escrito, incluido “no construyas esto”
02

Construcción del modelo

De punta a punta: datos, entrenamiento, evaluación y un modelo servido que tus sistemas pueden llamar, con tu equipo en la sala durante todo el camino.

Ideal para

Una tarea que pasó factibilidad y trae presupuesto detrás.

Incluye

  • Curación y etiquetado de datos
  • Entrenamiento y seguimiento de experimentos
  • Evaluación contra tu línea base
  • Despliegue dentro de tu infraestructura
  • Pesos, código y manuales entregados
03

Operación de modelos

Una iguala mensual para la parte que nadie planea: el modelo está vivo, el mundo se movió y algo necesita reentrenarse.

Ideal para

Equipos con modelos en producción y sin un ingeniero de ML de planta.

Incluye

  • Reentrenamiento y evaluación calendarizados
  • Monitoreo de deriva y de costo
  • Actualizaciones de despliegue conforme mejoran los modelos base
  • Un ingeniero que conoce tus modelos, disponible

Tu modelo

Eres dueño de los pesos, no de un permiso para usarlos.

Todo lo que entrenamos corre en tus cuentas, sobre modelos base cuyas licencias te dejan quedarte con lo que sale. Cuando termina el proyecto te quedas con los pesos, los datos de entrenamiento y el código que produjo ambos, y no tienes ninguna razón técnica para volver a llamarnos.

  • Entrenamiento y despliegue en tus propias cuentas de nube
  • Modelos base de pesos abiertos con licencias de uso comercial
  • Tus datos nunca entrenan nada fuera de tu proyecto
  • Entrega completa: pesos, conjuntos de datos, pipelines y manuales

Preguntas

Lo que las empresas nos preguntan primero.

¿Cómo sabemos si de verdad necesitamos un modelo propio?

Seguido no lo necesitas, y el estudio de factibilidad es como lo comprobamos en cualquier dirección. Si con un prompt y tus propios documentos llegas al 90% del valor, esa es la respuesta que te vamos a dar, y averiguarlo cuesta dos semanas en lugar de un proyecto.

¿Cuántos datos necesitamos?

Para un clasificador o un extractor, unos cuantos cientos de buenos ejemplos suelen bastar para ganarle a un modelo general. Para afinar un modelo de lenguaje que razone como tu equipo, unos miles. La calidad importa mucho más que la cantidad, y “tenemos diez años de tickets” suele ser mejor punto de partida de lo que la gente cree.

¿Y si nuestros datos son un desorden?

Lo son. Los de todos lo son. Limpiar y etiquetar es una fase real con semanas reales encima, y por eso aparece en el plan de arriba en vez de esconderse dentro del entrenamiento. Lo único que no podemos arreglar son datos que nunca registraron lo que quieres predecir.

¿Cuánto cuesta esto, y cuánto cuesta operarlo?

El estudio de factibilidad es precio cerrado y una fracción pequeña de una construcción. Una construcción completa depende de la tarea, y el entrenamiento rara vez es lo caro: los datos y la evaluación normalmente lo son. Operarlo es el número más fácil, porque un modelo pequeño en tu propio hardware suele costar mucho menos por petición que una llamada a una API, y te lo proyectamos antes de que te comprometas.

¿Por qué no usar Claude o GPT para todo?

Para muchas cosas sí deberías, y también construimos esos sistemas. Entrenar se gana su lugar cuando el volumen hace que el precio por token duela, cuando la latencia importa, cuando los datos no pueden salir de tu edificio, o cuando la tarea es lo bastante angosta como para que un modelo pequeño le gane a uno grande. Si nada de eso aplica, te mandamos a una API y te ahorramos el proyecto.

¿Necesitamos comprar GPUs?

Para entrenar, no. Las rentamos las semanas que hagan falta y te pasamos el costo tal cual. Para operar depende del modelo: muchos modelos de tarea corren bien en los CPU que ya tienes, y los que sí piden GPU normalmente piden menos de la que la gente supone.

Cuéntanos ese trabajo que tu equipo hace mil veces al mes.

Descríbenos una decisión repetitiva que alguien de tu equipo toma todo el día. Te decimos si un modelo podría aprenderla, qué implicaría averiguarlo en serio y cuánto costaría operarla una vez que funcione.

La primera plática no tiene costo. Si con un prompt se resuelve, te lo decimos en lugar de venderte un entrenamiento.

info@upsky.org