Andromeda Lab

Laboratorio de modelos de lenguaje pequeños
conectando…

Modelos entrenados

Agrupados por proyecto. Toca una fila para ver su detalle abajo.
Avance
–
Exactitud en validación
–
Respuesta completa exacta
Pérdida de validación
–
Menor es mejor
Velocidad
–
tokens procesados por segundo
Memoria máxima
–
usada durante el entrenamiento

Pérdida (loss)

entrenamientovalidación
Qué tan sorprendido está el modelo con la respuesta correcta (escala logarítmica). Si la de entrenamiento baja pero la de validación sube, el modelo está memorizando (sobreajuste).

Exactitud en validación

% de ejemplos no vistos con la respuesta completa exacta
Se mide cada ~¼ de época con ejemplos que el modelo no usa para aprender. Las líneas verticales marcan el fin de cada época (una pasada completa por los datos).

Comparar entrenamientos

Exactitud de validación por época de los últimos entrenamientos del mismo proyecto, para ver si un cambio (más datos, otro modelo, otros parámetros) realmente mejora. Se comparan hasta 3.

Tasa de aprendizaje (learning rate)

Tamaño de cada ajuste de los pesos
Warmup: empieza casi en 0 y sube, para no romper lo que el modelo ya sabe. Luego baja en curva coseno: pasos grandes al principio y afinado fino al final.

Resultados en el conjunto de prueba

Ejemplos que el modelo nunca vio. Aquí se mide la precisión real.
Exactitud principal
–
Exactitud secundaria
–
Calibración (ECE)
–
0 = su confianza es exacta
Ejemplos evaluados
–

F1 por clase

Equilibrio entre precisión y recall, de peor a mejor
Precisión: de lo que el modelo dijo que era de una clase, cuánto lo era. Recall: de todo lo que realmente era de esa clase, cuánto detectó. F1 combina ambos. Pasa el mouse para ver los tres.

¿Cuándo decide solo y cuándo escala?

Si el modelo solo decide cuando su confianza es ≥ umbral
Como la confianza está calibrada, subir el umbral cambia volumen por precisión: el resto se escala a un modelo grande o a una persona.

Todas las evaluaciones del proyecto

Cómo entrenamos estos modelos

1 · DatosEjemplos con la respuesta correcta

Ejemplos de entrada con su respuesta correcta, limpios y separados en entrenamiento, validación y prueba.

2 · EtiquetasQué debe responder

El catálogo de respuestas posibles que el modelo debe aprender.

3 · Modelo baseQwen3 en 4 bits

Un modelo que ya sabe lenguaje. Sus pesos se congelan: no se tocan. Cuantizado a 4 bits para ocupar poca memoria.

4 · LoRASolo se entrena un "parche"

En cada capa se agregan dos matrices pequeñas A y B: W' = W + (α/r)·B·A. Solo ellas aprenden: ~10 M de parámetros, en vez de cientos de millones.

5 · Cada pasoPredecir, medir el error, ajustar

El modelo lee un lote de ejemplos, predice la respuesta, se calcula la pérdida solo sobre la respuesta, y el optimizador AdamW ajusta A y B un poquito en la dirección que reduce el error.

6 · EvaluarPuntuar cada opción

No se deja al modelo escribir libremente: se puntúa cada opción y se obtiene su probabilidad (idea tomada de Lev). Así siempre responde una etiqueta válida, con una confianza para decidir o escalar.

Glosario rápido
Época: una pasada completa por todos los ejemplos de entrenamiento. · Paso: una actualización de pesos con un lote de ejemplos. · Lote (batch): cuántos ejemplos se procesan juntos por paso. · Rango (r): tamaño del parche LoRA. · α/r (scale): cuánto pesa el parche frente al modelo original. · Dropout: apaga conexiones al azar para no memorizar. · Gradient checkpointing: no guarda resultados intermedios y los recalcula; usa menos memoria y va un poco más lento. · Sobreajuste: el modelo memoriza el entrenamiento y empeora con ejemplos nuevos.

Consola del entrenamiento

…
Ver los puntos de control como tabla