Journal de forge toutes les expériences du labo
Essayer le modèle

MESURES

Ce que le labo a réellement mesuré.

Chaque ligne est un entraînement qui a tourné sur la carte. Rien n'est estimé, rien n'est extrapolé. Les résultats sont groupés par budget de calcul, parce que deux modèles qui n'ont pas lu la même quantité de texte ne se comparent pas : le plus gourmand gagne presque toujours, et ça ne dit rien de son architecture.

Chargement des mesures…

Comment lire ce tableau

bits / caractère
Le seul chiffre comparable d'un modèle à l'autre : combien d'information il lui faut, en moyenne, pour deviner le caractère suivant. Plus bas est meilleur. En dessous de 0,005 d'écart, c'est du bruit.
perte val
L'erreur brute sur du texte jamais vu, telle que l'entraînement l'affiche. Elle ne se compare pas entre deux découpages : une perte par token BPE vaut environ 3,8 fois une perte par caractère. C'est pour ça que la colonne de gauche existe.
découpage
Caractère (un identifiant = une lettre) ou BPE (un identifiant = un morceau de mot). Le BPE fait tenir presque quatre fois plus de texte dans la même fenêtre.
l / h / e
Couches, têtes d'attention, dimensions. La largeur (e) est l'axe qui rapporte le plus.
bl
La mémoire : combien d'unités en arrière le modèle regarde.