Les connaissances qui disparaissent pendant l’affinage peuvent rester intactes dans un modèle de langage et réapparaître plus tard, rapporte une nouvelle étude mécaniste.

Vedant Palit, Florent Draye, Nicolas Zucchet, Zhijing Jin et Bernhard Schölkopf ont étudié l’« oubli apparent » : une baisse du rappel qui ressemble à un effacement des connaissances, mais reflète plutôt une incapacité temporaire à y accéder. Leur prépublication combine une mémoire associative minimale, un petit Transformer et des interventions sur un modèle de langage préentraîné.

Pourquoi c’est important

Un développeur qui actualise un modèle avec de nouvelles données d’entreprise peut voir sa précision sur d’anciens faits s’effondrer et conclure que la mise à jour les a détruits. Si l’échec concerne l’accès, réentraîner ou restaurer un ancien point de contrôle gaspille des informations encore présentes. La question utile devient non seulement l’ampleur de la baisse des performances, mais aussi le fait que les anciennes représentations se soient déplacées ensemble ou aient été endommagées individuellement.

Les auteurs ont observé un schéma en trois étapes pendant l’entraînement sur de nouveaux faits. Le rappel des anciens faits s’effondrait d’abord, se rétablissait alors même que l’entraînement continuait uniquement sur le nouveau contenu, puis déclinait à nouveau. Une seule théorie d’écrasement permanent ne peut expliquer le rétablissement intermédiaire.

Leur mémoire minimale reproduisait cette courbe avec trois ingrédients : des anciennes clés partageant une structure, de nouvelles valeurs concentrées dans une région et une normalisation dans le réseau. L’affinage poussait initialement les anciennes représentations dans une direction commune. Ce décalage perturbait la lecture, mais préservait l’organisation relative qui encodait l’identité de chaque fait.

Une fois les nouveaux faits appris, la normalisation supprimait une grande partie du décalage commun et les anciennes réponses redevenaient accessibles. Pendant ce temps, des changements plus petits propres à chaque fait s’accumulaient. Ces changements modifiaient les relations entre les souvenirs et finissaient par produire une perte durable.

Une direction distingue la dissimulation de l’érosion

L’article teste le mécanisme plutôt que de s’arrêter à la courbe. Dans un Transformer entraîné sur des données synthétiques, soustraire le décalage partagé éliminait l’effondrement temporaire. Dans un modèle de langage préentraîné, retirer une direction de chaque mise à jour des poids pendant l’affinage restaurait les anciens faits, selon les auteurs.

Cette intervention renforce l’explication au-delà d’une description de scores de benchmark changeants. Elle identifie un composant de faible dimension associé à une perte réversible et le distingue de changements plus lents et distribués qui endommagent des souvenirs individuels.

La distinction porte sur l’état du modèle, pas sur la mémoire humaine. Des connaissances « cachées » signifient ici qu’un prompt d’évaluation ne récupère plus la réponse attendue alors que la géométrie qui la soutenait reste mesurable. Cela n’implique pas que le modèle se souvienne consciemment ou puisse récupérer le fait sans intervention.

Les expériences utilisent aussi des faits et des conditions d’entraînement délibérément contrôlés. L’affinage réel mélange formats, objectifs et concepts qui se chevauchent, et un modèle en production peut échouer pour des raisons extérieures à ce mécanisme : prompt inadapté, décodage modifié, entraînement de sécurité ou nouvelle politique de réponse. Détecter un décalage commun des représentations ne peut donc pas, à lui seul, certifier qu’une capacité perdue est récupérable.

L’étude a également montré

Le caractère surtout temporaire ou permanent de l’oubli dépendait des nouvelles données : les anciens souvenirs qui se déplaçaient ensemble conservaient leur géométrie relative, tandis que les mises à jour qui les éloignaient produisaient une érosion destructrice. La normalisation aidait à expliquer le rebond en réduisant le déplacement commun après stabilisation du nouvel apprentissage. Le modèle minimal prédisait un comportement qualitatif ensuite testé dans les expériences sur des Transformers.

La prépublication a été soumise le 6 octobre 2026 et n’a pas encore été évaluée par les pairs. Sa valeur pratique est une hypothèse diagnostique : avant de traiter toute régression après affinage comme des connaissances effacées, examiner si les représentations partagent une direction supprimable et si un rétablissement survient pendant la poursuite de l’entraînement.

Vérification

AffirmationLabelSource primaireVérification indépendante
Le rappel des anciens faits s’effondrait, se rétablissait pendant la poursuite de l’entraînement sur de nouveaux faits, puis s’érodaitSELON LA SOCIÉTÉarxiv.orgaucune
Une mémoire associative minimale reproduisait le schéma avec des clés partagées, des valeurs concentrées et une normalisationSELON LA SOCIÉTÉarxiv.orgaucune
L’affinage déplaçait les anciennes représentations dans une direction commune tout en préservant leur géométrie relativeSELON LA SOCIÉTÉarxiv.orgaucune
Retirer la direction commune éliminait l’effondrement temporaire dans un petit TransformerSELON LA SOCIÉTÉarxiv.orgaucune
Retirer une direction des mises à jour des poids restaurait les anciens faits dans un modèle de langage préentraînéSELON LA SOCIÉTÉarxiv.orgaucune
L’article a été soumis le 6 octobre 2026VÉRIFIÉarxiv.orgaucune