Upsky Research

Explorando lo próximo que podrá hacer la IA.

Evaluamos y comparamos modelos, los ajustamos, construimos los nuestros y publicamos lo que aprendemos.

Áreas de investigación

Cómo descubrimos lo que los modelos realmente pueden hacer.

01

Benchmarks

Medimos modelos en tareas que reflejan trabajo real: razonamiento, código, extracción y uso de herramientas, no solo en los benchmarks de moda.

  • Razonamiento
  • Código
  • Uso de herramientas
  • Latencia y costo
02

Evals

Diseñamos suites de evaluación para productos y dominios específicos, para saber si un cambio realmente mejoró un sistema.

  • Suites de evaluación
  • LLM-as-judge
  • Pruebas de regresión
  • Revisión humana
03

Fine-tuning

Adaptamos modelos abiertos a tareas específicas y medimos cuándo el fine-tuning supera al prompting, a la recuperación de información o simplemente a un modelo más grande.

  • LoRA
  • SFT
  • Ajuste por preferencias
  • Destilación
04

Comparación de modelos

Ponemos modelos lado a lado con las mismas tareas, prompts y presupuestos, para que elegir uno sea una decisión respaldada por datos.

  • Calidad
  • Costo
  • Velocidad
  • Abiertos vs. cerrados
05

Modelos propios

Estamos construyendo nuestros propios modelos de lenguaje para entender todo el proceso, desde los datos y el entrenamiento hasta la inferencia y el despliegue.

En desarrollo

  • Modelos de lenguaje
  • Datos
  • Entrenamiento
  • Inferencia

Publicaciones

Lo que publicaremos.

Upsky Research apenas comienza. A medida que terminen los experimentos, sus métodos, datos y resultados aparecerán aquí.

Primeras publicaciones en preparación

  1. 01

    Reportes de investigación

    Análisis extensos de experimentos, con metodología, resultados y lo que haríamos diferente.

  2. 02

    Leaderboards

    Resultados de benchmarks que actualizamos conforme se lanzan nuevos modelos.

  3. 03

    Suites de evaluación

    Datasets y entornos de prueba, compartidos siempre que sea posible para que los resultados puedan reproducirse.

  4. 04

    Notas de modelos

    Documentación de los modelos que construimos: datos, entrenamiento, limitaciones y uso previsto.

  5. 05

    Noticias y análisis

    Comentarios breves sobre nuevos modelos, papers y lanzamientos, y lo que cambian para quienes construyen software.

Cómo trabajamos

Investigación que se sostiene fuera del laboratorio.

  • Mostrar el método

    Los resultados incluyen el contexto necesario para entenderlos: prompts, configuración y criterios de evaluación.

  • Probar trabajo real

    Preferimos tareas tomadas de productos reales sobre acertijos que solo existen en los benchmarks.

  • Comparar con justicia

    Mismas entradas, mismo presupuesto y la misma evaluación para cada modelo que probamos.

  • Llevarlo a la práctica

    Lo que aprendemos se incorpora directamente a los productos y sistemas que construimos.

Sigue la investigación.

Escríbenos para recibir nuevos reportes, benchmarks y análisis cuando se publiquen.

¿Tienes un modelo, un dataset o una pregunta que quieras que probemos? Queremos escucharla.

Recibir novedades info@upsky.org