Une partie de la technique a été reproduite (pour 30$) :
https://github.com/Jiayi-Pan/TinyZero
En gros, pour entrainer ChatGPT, des millions de questions/réponses furent écrites par des petites mains.
Là ils entrainent leur modèle en le récompensant s'il respecte 2 conditions :
1)à condition que le code qu'il génère est validé automatiquement par un compilateur
2)à condition qu'il génère du texte expliquant ce qu'il fait (sorte de monologue intérieur)

Comme pour un élève : donne la solution mais explique-moi étape par étape.
Donc pareil pour la reproduction, ils lui donnent 4 chiffres et lui demandent de les manipuler pour trouver un résultat, comme dans "des chiffres et des lettres" :
https://github.com/Jiayi-Pan/TinyZero

Et ils vérifient le calcul automatiquement facilement.
Le fait de penser "étape par étape" était déjà connu, ça a améliorait les perfs car ça donnait davantage de contexte pour trouver la réponse (même si ce contexte est généré par le LLM).
Une des nouveautés c'est le Reinforcement Learning, autrement dit la validation automatique des résultats et don automatique d'une récompense si c'est bon.
Je crois qu'il y a aussi des nouveautés d'architecture mais je suis pas assez calé là dessus pour comprendre.