MESURES
Ce que le labo a réellement mesuré.
Chaque ligne est un entraînement qui a tourné sur la carte. Rien n'est estimé, rien n'est extrapolé. Les résultats sont groupés par budget de calcul, parce que deux modèles qui n'ont pas lu la même quantité de texte ne se comparent pas : le plus gourmand gagne presque toujours, et ça ne dit rien de son architecture.
Chargement des mesures…
Comment lire ce tableau
- bits / caractère
- Le seul chiffre comparable d'un modèle à l'autre : combien d'information il lui faut, en moyenne, pour deviner le caractère suivant. Plus bas est meilleur. En dessous de 0,005 d'écart, c'est du bruit.
- perte val
- L'erreur brute sur du texte jamais vu, telle que l'entraînement l'affiche. Elle ne se compare pas entre deux découpages : une perte par token BPE vaut environ 3,8 fois une perte par caractère. C'est pour ça que la colonne de gauche existe.
- découpage
- Caractère (un identifiant = une lettre) ou BPE (un identifiant = un morceau de mot). Le BPE fait tenir presque quatre fois plus de texte dans la même fenêtre.
- l / h / e
- Couches, têtes d'attention, dimensions. La largeur (e) est l'axe qui rapporte le plus.
- bl
- La mémoire : combien d'unités en arrière le modèle regarde.