Todas las soluciones

Sistemas de IA y agentes

Un chatbot contesta preguntas. Un agente termina el trabajo.

Casi todas las empresas compraron una ventana de chat y descubrieron que en realidad no podía hacer nada. Nosotros construimos sistemas que se hacen cargo de una tarea completa: leen la solicitud, consultan tus sistemas, deciden, ejecutan y se detienen ante una persona cuando lo que está en juego lo amerita. Corriendo sobre el mejor modelo frontera para cada paso y medidos contra casos de tu propio negocio mucho antes de que lleguen a un cliente.

Ver qué construimos
6–10 semanas
de la primera conversación a un agente haciendo trabajo real en producción
15–30 h
a la semana, por agente, una vez que atiende los casos para los que se construyó
Cada versión
pasa por evaluaciones hechas con tus propios casos, así la calidad es un número y no una sensación
ES · EN
un equipo senior en tu mismo horario, en los dos idiomas

Señales

Necesitas un sistema, no otra suscripción, cuando…

Todas son el mismo hueco: un modelo que sabe hablar del trabajo, sentado fuera de los sistemas donde el trabajo pasa.

  1. 01

    Compraron una herramienta de IA, todos la probaron una semana y el trabajo siguió igual.

  2. 02

    Las respuestas son buenas hasta que alguien pregunta por tus precios, tu política o el pedido del martes pasado.

  3. 03

    La parte útil del trabajo vive en cuatro sistemas y la ventana de chat no ve ninguno.

  4. 04

    Una persona todavía tiene que copiar la respuesta del modelo a algún lado para que algo pase.

  5. 05

    Nadie te puede decir si acierta más este mes que el mes pasado.

  6. 06

    Funciona precioso en el demo y nadie confía en ponerlo frente a un cliente real.

Qué construimos

Cuatro tipos de sistema de IA, y casi toda empresa termina con dos.

Comparten la misma columna vertebral —tus datos, tus herramientas, evaluados antes de liberarse— y se diferencian en a quién sirven y en cuánto se les confía hacer solos.

Donde suele estar el dinero

Agentes autónomos

Sistemas que se hacen cargo de una tarea de principio a fin. Planean, llaman a tus herramientas, resuelven los casos que se salen del camino feliz y escalan los que nunca deberían ser automáticos.

  • Planeación de varios pasos con uso real de herramientas
  • Escriben en tus sistemas, no solo hablan de ellos
  • Aprobación humana en los pasos que tú elijas
  • Cada corrida trazada, costeada y repetible
Donde suele estar el dinero

Copilotos para tu equipo

Un asistente dentro de la herramienta que tu equipo ya tiene abierta, que conoce tus cuentas, tus políticas y tu historial. Redacta, consulta, resume y prepara, y una persona sigue dando enviar.

  • Dentro de Slack, tu CRM, tu mesa de ayuda o tu app
  • Aterrizado en tus documentos y registros
  • Redacta y prepara, la persona decide
  • Toma el estilo de la casa de tu trabajo anterior

Sistemas de conocimiento

Búsqueda que de verdad encuentra. Tus contratos, tickets, wikis y PDFs convertidos en algo que un modelo puede responder, con citas a la fuente para poder verificar cada respuesta.

  • Busca en todos los rincones donde se esconde el conocimiento
  • Responde con citas, no con suposiciones seguras de sí mismas
  • Respeta los permisos de cada usuario

Funciones de IA en tu producto

La parte inteligente de lo que vendes: el asistente dentro de tu app, el resumen automático, la búsqueda que entiende la pregunta. Construida a tus presupuestos de latencia, costo y confiabilidad.

  • Diseñada junto con tu equipo de producto
  • Presupuestos de streaming, latencia y costo
  • Sale detrás de flags y con analítica de uso

Agentes a la medida

Hechos para el trabajo que tu equipo sí hace.

No vendemos un bot de soporte y le llamamos plataforma. Cada agente se acota a un solo trabajo de tu negocio, con las herramientas que ese trabajo necesita y los controles que ese trabajo merece.

  • Agente de ventas

    Investiga la cuenta antes de la llamada, redacta la propuesta a partir de los tratos que cerraron y mantiene el CRM al día sin que un vendedor toque un campo.

  • Agente de soporte

    Resuelve de principio a fin los tickets que siguen una política y entrega los que no, con el historial ya resumido.

  • Agente de finanzas

    Persigue documentos, cruza facturas contra órdenes de compra, marca lo que no cuadra y deja las excepciones listas para que una persona decida.

  • Agente de operaciones

    Vigila la cola, detecta el pedido que está por incumplir su fecha y hace algo al respecto antes de que a alguien se le ocurra abrir un tablero.

  • Agente de investigación

    Lee el mercado, los reportes y los movimientos de la competencia que alguien resolvía en doce pestañas un viernes por la tarde.

  • Agente de ingeniería

    Clasifica issues, reproduce el bug, abre el pull request de los arreglos aburridos y deja los interesantes a tus ingenieros.

La capa de modelos

El mejor modelo para cada trabajo, y otro distinto el trimestre que entra.

Los modelos frontera se rebasan entre ellos cada pocos meses. Los comparamos con tus casos, mandamos cada paso al que gane esa prueba y mantenemos el sistema poco acoplado, para que cambiarlo sea un ajuste de configuración y no una reescritura.

  • Planeación y juicio difícilModelo frontera de puntaDonde equivocarse sale caro, pagamos por el mejor razonamiento disponible y no escatimamos.
  • Redacción y resumenFrontera de gama mediaIndistinguible en revisión a ciegas para este tipo de trabajo, a una fracción del costo por llamada.
  • Clasificación y ruteoModelo chico y rápidoMucho volumen y un trabajo acotado, donde los milisegundos y los centavos importan más que la brillantez.
  • Extracción de documentosModelo abierto afinadoCuando el formato ya es estable, un modelo chico entrenado le gana al prompting en precisión y en precio.
  • Todo lo que no puede salirPesos abiertos, tus servidoresHay datos que no van a una API, así que ese paso corre dentro de tu propia infraestructura.

No somos revendedores de ningún proveedor de modelos y no cobramos comisiones. Esta tabla se reescribe cada vez que un modelo nuevo le gana al actual en tus evaluaciones, lo cual en los últimos dos años ha pasado cada pocos meses.

Dónde vive

Un agente que nadie abre es un agente que nadie usa.

El sistema va a donde el trabajo ya sucede. Sin una pestaña nueva que recordar, sin un portal al que entrar y sin un programa de gestión del cambio para que alguien se anime a probarlo.

  • Slack y Teams

    Se le menciona en el canal donde ya se está discutiendo el trabajo.

  • Correo

    Lee lo que llega y responde, redacta o escala desde el mismo hilo.

  • Tu CRM y mesa de ayuda

    Dentro de HubSpot, Salesforce, Zendesk o Intercom, como parte del registro.

  • Tu propio producto

    Un asistente, una búsqueda más lista o un panel lateral que tus clientes usan.

  • WhatsApp y SMS

    Donde de verdad se hace buena parte del negocio en Latinoamérica.

  • El navegador

    Para ese sistema interno de 2011 que no tiene API y no se va a ir.

  • Voz

    Llamadas contestadas, calificadas y resumidas en el registro antes de que alguien conteste.

  • API y webhooks

    Llamado por tus propios servicios cuando el agente es un paso dentro de algo más grande.

Confiabilidad

Lo que separa a un agente confiable de un demo que impresionó una vez.

Cualquiera consigue una buena respuesta al tercer intento en una junta. La ingeniería está en que la corrida número cien sea tan buena como la primera, y en enterarse el día que deja de serlo.

  • Evaluaciones con tus casos

    Un conjunto de pruebas con ejemplos reales y respuestas correctas conocidas. Nada se libera si no puntúa mejor que lo que reemplaza, y ese puntaje está en un tablero que puedes abrir.

  • Límites y negativas

    Lo que nunca debe hacer, decir ni tocar, aplicado fuera del prompt, porque un prompt es una petición y no una restricción.

  • Humano en el circuito por diseño

    Tú pones los umbrales donde una persona autoriza. Todo lo irreversible, todo lo que pasa de un monto y todo lo que va a un cliente puede detenerse para revisión.

  • Trazas que se pueden leer

    Cada corrida queda grabada con sus pasos, llamadas a herramientas, entradas y costo, para que una respuesta equivocada sea algo que abres y explicas en vez de algo que se discute.

  • Fronteras de datos y permisos

    El agente ve lo que la persona por la que actúa tiene permitido ver. Retención, residencia y qué nunca sale de tu red se deciden desde el principio.

  • Presupuestos de costo y latencia

    Topes de costo por corrida, caché y un modelo más chico donde convenga, para que la cuenta no crezca hasta volverse una sorpresa.

Cómo trabajamos

Compruébalo con tus casos antes de que alguien construya la parte bonita.

La forma típica de fracasar en esto es construir seis meses algo que nadie midió. Nosotros ponemos la medición al principio, así que para la tercera semana ya sabes si funciona.

  1. 01Estimado: Semana 1

    Acotar un trabajo

    Escogemos una sola tarea con dueño claro, volumen real y una respuesta correcta que podamos acordar. Ni plataforma ni estrategia: un trabajo que te cuesta horas cada semana.

    EntregableUn trabajo acotado con una respuesta correcta definida

  2. 02Estimado: Semana 1–2

    Armar las evaluaciones

    Juntamos casos reales de tu historial junto con el resultado que daría un buen empleado. Eso se vuelve aquello contra lo que se califica cada versión, y es tuyo pase lo que pase después.

    EntregableUn conjunto de evaluaciones y una línea base medida

  3. 03Estimado: Semana 2–4

    Prototipar contra ellas

    Un sistema funcionando conectado a tus herramientas reales y calificado con las evaluaciones, con el ruteo de modelos y la búsqueda afinados hasta pasar la barra. Aquí es donde descubrimos que un trabajo necesita otro enfoque, lo cual es muchísimo más barato descubrir ahora.

    EntregableUn prototipo calificado y una decisión de seguir o no

  4. 04Estimado: Semana 4–7

    Piloto junto a tu equipo

    Corre sobre trabajo real con una persona revisando cada caso, para que veas dónde se equivoca antes de que pueda costar algo. La tasa de revisión baja solo cuando los números se lo ganan.

    EntregableUn piloto en vivo con métricas de revisión

  5. 05Estimado: Semana 7+

    Producción e iteración

    Despliegue completo con monitoreo, control de costos y alertas. Los casos nuevos siguen sumándose a las evaluaciones, así el sistema mejora de forma medible en vez de irse desviando en silencio.

    EntregableDespliegue en producción, monitoreo y una cadencia de ajuste

Los tiempos de esta página son estimados de proyectos anteriores, no una cotización. Los tuyos dependen de cuántos sistemas tenga que tocar el agente, de qué tan limpios estén los registros y de qué tan rápido se toman las decisiones de tu lado.

Herramientas

Con qué lo construimos.

Los proveedores de modelos son intercambiables a propósito. Todo lo demás se elige porque es estable, inspeccionable y algo que el siguiente ingeniero que lo toque va a reconocer.

Modelos
  • Anthropic Claude
  • OpenAI
  • Google Gemini
  • Modelos de pesos abiertos
  • On-premise y local
Frameworks de agentes
  • Claude Agent SDK
  • Vercel AI SDK
  • LangGraph
  • Model Context Protocol
  • Orquestación a la medida
Recuperación
  • pgvector
  • Pinecone
  • Elasticsearch
  • Búsqueda híbrida
  • Rerankers
Evaluación
  • Braintrust
  • LangSmith
  • Arneses de evaluación propios
  • Herramientas de revisión humana
Integración
  • Slack
  • WhatsApp Business
  • HubSpot
  • Salesforce
  • Zendesk
  • Webhooks
Dónde corre
  • Tu nube
  • AWS
  • Google Cloud
  • Vercel
  • Docker

Modalidades

Tres formas de entrar, según qué tan seguro estés.

El mismo equipo y los mismos estándares en las tres. La diferencia es cuánto te comprometes antes de que existan los números.

01

Prueba de valor

Un trabajo, acotado y medido. Precio cerrado, unas cuantas semanas y un número al final que dice si conviene seguir.

Ideal para

Un primer sistema de IA, un consejo que quiere evidencia, o una idea que lleva dos trimestres discutiéndose.

Incluye

  • Un trabajo acotado junto con tu equipo
  • Evaluaciones armadas con tus casos
  • Un prototipo funcionando sobre tus herramientas reales
  • Una decisión de seguir o no, con los números detrás
02

Construcción del agente

El sistema completo: despliegue en producción, integraciones, límites, monitoreo y la entrega que le permite a tu propio equipo operarlo.

Ideal para

Un caso ya comprobado, o un trabajo tan evidentemente doloroso que no hay que convencer a nadie.

Incluye

  • Sistema en producción sobre tu infraestructura
  • Integraciones con las herramientas que usa tu equipo
  • Evaluaciones, trazas y control de costos
  • Documentación y capacitación del equipo
03

Operación y mejora

Lo mantenemos funcionando conforme cambian los modelos, crecen los volúmenes y aparecen los casos raros: monitoreo, reajuste y capacidades nuevas con cadencia.

Ideal para

Sistemas ya en producción, donde lo que de verdad dolería es que la calidad se desvíe en silencio.

Incluye

  • Monitoreo y respuesta a incidentes
  • Recomparación conforme salen modelos nuevos
  • Evaluaciones que crecen con casos reales
  • Una ruta de capacidades nuevas

Sin amarres

El sistema es tuyo, y también lo que comprueba que funciona.

El código, los prompts, el índice de búsqueda, las trazas y sobre todo las evaluaciones viven en tus cuentas. Ese conjunto de evaluaciones es el activo de verdad: es lo que permite que cualquiera, incluido un equipo que no seamos nosotros, mejore el sistema sin adivinar.

  • Código, prompts y configuración en tus repositorios
  • Las evaluaciones y cada traza son tuyas y se quedan contigo
  • Ningún proveedor de modelos soldado a la arquitectura
  • Documentado lo suficiente para que otro equipo lo retome

Pruebas

Mira lo que hemos construido.

Productos que operamos nosotros mismos y sistemas que construimos para clientes, con las decisiones detrás de cada uno.

Ver nuestro trabajo

Preguntas

Lo primero que nos preguntan las empresas.

¿En qué es distinto del chatbot que ya tenemos?

Tu chatbot sabe leer y escribir texto. Un agente además consulta tus sistemas, ejecuta acciones dentro de ellos y sabe cuándo detenerse a preguntarle a una persona. La diferencia se nota en si algo cambia sin que un humano copie la respuesta a otro lado.

¿Es lo mismo que la automatización de procesos?

Se traslapan, y la respuesta honesta es que preferiríamos venderte la opción más barata. Si un proceso es predecible y con forma de regla, automatízalo: se construye más rápido, cuesta menos operarlo y nunca te sorprende. Los agentes se ganan su costo donde la entrada viene sucia o el paso de verdad necesita criterio, y casi todo buen sistema es mayormente automatización con un agente en los dos lugares que lo requieren.

¿Mejor entrenamos nuestro propio modelo?

Normalmente después, no primero. Arranca con un modelo frontera para averiguar si el trabajo siquiera es posible, y luego entrena un modelo más chico para los pasos de mucho volumen, cuando el formato ya es estable y el costo ya es real. Hacerlo al revés es pagar por entrenar algo antes de que alguien sepa cómo se ve lo bueno.

¿Qué evita que se invente cosas?

Tres cosas, en ese orden: aterrizarlo en tus registros reales para que exista una respuesta correcta disponible, evaluaciones que atrapan una regresión antes de liberar, y un punto de control humano en todo lo irreversible. También te vamos a decir cuándo un trabajo no es buen candidato porque equivocarse con seguridad ahí es inaceptable, y eso no lo arregla ninguna cantidad de ingeniería.

¿Nuestros datos se van a un proveedor de modelos?

Solo donde tú lo permitas, y nunca para entrenamiento. Usamos términos empresariales que excluyen el entrenamiento por default, y todo lo que no puede salir de tu red corre sobre modelos de pesos abiertos dentro de tu propia infraestructura. Qué datos caen en cada categoría se decide contigo en la primera semana, por escrito.

¿Cuánto cuesta operarlo?

El costo por corrida se diseña, no se descubre después. Mandamos los pasos baratos a modelos chicos, cacheamos lo que se repite y ponemos un techo al gasto por corrida. En la mayoría de los sistemas el costo de operación queda muy por debajo del costo en sueldos del trabajo que absorbe, y te mostramos ese número antes de que te comprometas a nada.

¿Qué pasa con la gente que hoy hace ese trabajo?

En los sistemas que hemos construido, el patrón es que el equipo deja de hacer los dos tercios tediosos y empieza a atender las excepciones, que es justo la parte que los necesitaba. Donde un puesto sí cambia lo ponemos en el reporte, porque sale mal cuando la gente lo descubre antes de que se lo digas.

¿Qué pasa cuando se equivoca?

A veces se va a equivocar. La pregunta de diseño nunca es si alguna vez falla, sino qué pasa cuando falla. Una respuesta equivocada dentro de un paso de revisión cuesta un clic; una respuesta equivocada dentro de una acción irreversible cuesta un cliente. Ponemos los puntos de control donde vive la segunda, y las trazas te dejan ver exactamente qué hizo.

Dinos el trabajo que ojalá hiciera alguien más.

Descríbenos la tarea que tu equipo hace más seguido y disfruta menos. Te regresamos si un agente puede hacerse cargo, en qué tendría que acertar y cuál es la forma más barata de saberlo con certeza.

La primera conversación es gratis. Si la respuesta honesta es que un script lo resuelve, eso es lo que vas a escuchar.

info@upsky.org