Benchmarks
Medimos modelos en tareas que reflejan trabajo real: razonamiento, código, extracción y uso de herramientas, no solo en los benchmarks de moda.
Upsky Research
Evaluamos y comparamos modelos, los ajustamos, construimos los nuestros y publicamos lo que aprendemos.
Áreas de investigación
Medimos modelos en tareas que reflejan trabajo real: razonamiento, código, extracción y uso de herramientas, no solo en los benchmarks de moda.
Diseñamos suites de evaluación para productos y dominios específicos, para saber si un cambio realmente mejoró un sistema.
Adaptamos modelos abiertos a tareas específicas y medimos cuándo el fine-tuning supera al prompting, a la recuperación de información o simplemente a un modelo más grande.
Ponemos modelos lado a lado con las mismas tareas, prompts y presupuestos, para que elegir uno sea una decisión respaldada por datos.
Estamos construyendo nuestros propios modelos de lenguaje para entender todo el proceso, desde los datos y el entrenamiento hasta la inferencia y el despliegue.
En desarrollo
Publicaciones
Upsky Research apenas comienza. A medida que terminen los experimentos, sus métodos, datos y resultados aparecerán aquí.
Primeras publicaciones en preparación
Análisis extensos de experimentos, con metodología, resultados y lo que haríamos diferente.
Resultados de benchmarks que actualizamos conforme se lanzan nuevos modelos.
Datasets y entornos de prueba, compartidos siempre que sea posible para que los resultados puedan reproducirse.
Documentación de los modelos que construimos: datos, entrenamiento, limitaciones y uso previsto.
Comentarios breves sobre nuevos modelos, papers y lanzamientos, y lo que cambian para quienes construyen software.
Cómo trabajamos
Los resultados incluyen el contexto necesario para entenderlos: prompts, configuración y criterios de evaluación.
Preferimos tareas tomadas de productos reales sobre acertijos que solo existen en los benchmarks.
Mismas entradas, mismo presupuesto y la misma evaluación para cada modelo que probamos.
Lo que aprendemos se incorpora directamente a los productos y sistemas que construimos.
Escríbenos para recibir nuevos reportes, benchmarks y análisis cuando se publiquen.
¿Tienes un modelo, un dataset o una pregunta que quieras que probemos? Queremos escucharla.