Un étudiant de 22 ans a refait l'expérience d'Ebbinghaus, et la courbe de l'oubli a tenu

La courbe de l'oubli a le statut d'un ornement de manuel : un tracé qui plonge puis s'aplatit, attribué à un Allemand du dix neuvième siècle qui aurait travaillé sur un seul sujet, lui même. La lecture implicite est qu'un résultat pareil appartient à l'histoire des idées plus qu'à la science vérifiable.
Deux détails renforcent le soupçon. Hermann Ebbinghaus est bien à la fois l'expérimentateur et l'unique sujet. Et le premier état de son travail, daté de 1880, n'est pas une publication : c'est le manuscrit qu'il dépose pour son habilitation, l'Urmanuskript, resté inédit et publié en allemand seulement en 1983, chez Passavia Universitätsverlag à Passau. Le livre, Über das Gedächtnis, paraît à Leipzig chez Duncker en 1885. La traduction anglaise, Memory: A Contribution to Experimental Psychology, arrive en 1913, signée Henry A. Ruger et Clara E. Bussenius pour le Teachers College de Columbia.
Fin 2011, un chercheur de l'université d'Amsterdam et son étudiant ont fait la chose qui tranche le mieux un débat de ce type. Ils ont refait l'expérience.
Ce qu'Ebbinghaus a mesuré, exactement
Le texte de 1913 donne le protocole sans ambiguïté. Les investigations sur l'oubli tombent dans l'année 1879-1880 et comprennent 163 doubles essais. Chaque double essai consiste à apprendre huit séries de 13 syllabes, soit 104 syllabes, puis à les réapprendre après un délai fixé. L'apprentissage se poursuit jusqu'à deux récitations sans faute consécutives. Trente huit de ces doubles essais, passés entre 11 h et midi, ne comportaient que six séries.
Le matériel est le dispositif de contrôle qui rend la mesure possible : environ 2 300 syllabes sans signification, construites en plaçant une voyelle ou une diphtongue entre deux consonnes, mélangées puis tirées au hasard. Ebbinghaus a bien essayé d'autres matériaux, mais ses raisons de les écarter ne sont pas celles qu'on lui prête. Les séries de chiffres, écrit il, se sont révélées impraticables parce que leurs éléments de base étaient trop peu nombreux et trop vite épuisés. Quant aux chants du Don Juan de Byron, qu'il a appris par cœur, ils ne lui ont pas donné une dispersion des mesures plus large que les syllabes. Ce qu'il revendique pour son matériel n'est donc pas l'absence de variabilité, c'est l'homogénéité, la réserve inépuisable de combinaisons neuves et la possibilité de faire varier proprement la longueur.
Les sept intervalles sont énoncés page 66 : environ un tiers d'heure, une heure, neuf heures, un jour, deux jours, six jours, trente et un jours. Les valeurs effectivement mesurées s'écartent un peu de ces étiquettes, le tableau final portant 0,33 heure, 1 heure, 8,8 heures, puis 24, 48, 6 fois 24 et 31 fois 24 heures. La mesure n'est pas un score de rappel mais l'économie de travail au réapprentissage, exprimée en pourcentage du temps du premier apprentissage, temps de récitation déduit. Le tableau donne 58,2 puis 44,2, 35,8, 33,7, 27,8, 25,4 et 21,1 pour cent, avec des erreurs probables de la moyenne de 1 sur les trois premiers points, puis 1,2, 1,4, 1,3 et 0,8. Le nombre d'essais par point n'est pas constant : 12, 16, 12, 26, 26, 26, et 45 pour le point à trente et un jours. Ebbinghaus corrige aussi ses temps selon l'heure de la séance, les valeurs de fin de matinée étant réduites d'environ 5 pour cent et celles de 18 h à 20 h d'environ 12 pour cent, pourcentages qu'il estime sur d'autres séries et détaille dans son texte. Murre et Dros, qui lisent le manuscrit de 1880, donnent 13 pour cent pour la correction du soir. Ils rappellent aussi qu'il avait vingt neuf ans.
Amsterdam, hiver 2011
Jaap Murre et Joeri Dros soumettent leur réplication à PLOS ONE le 22 novembre 2014. Elle est acceptée le 25 janvier 2015 et paraît le 6 juillet 2015 sous la référence PLoS ONE 10(7) : e0120644. Le second auteur, J. Dros, 22 ans, est l'unique sujet. Comme chez Ebbinghaus, le sujet est aussi un auteur, à cette différence que le protocole est ici tenu par un tiers. L'expérience est examinée et approuvée par la commission de contrôle du département de psychologie de l'université d'Amsterdam, dossier 2014-BC-3879.
La phase d'entraînement court du 8 au 29 novembre 2011 : 14 listes apprises puis réapprises après vingt minutes, suivies de 19 listes apprises sans réapprentissage, pour absorber l'effet de familiarisation. La phase expérimentale court du 1er décembre 2011 au 13 février 2012, que les auteurs comptent pour 75 jours. Soixante neuf listes y sont apprises et réapprises, dix par intervalle sauf neuf pour l'intervalle de neuf heures. Le total de collecte tient en environ 70 heures.
Le matériel reprend la structure d'origine : 70 listes de 104 syllabes, huit rangées de 13. Les syllabes sont de type consonne voyelle consonne, construites sur la phonotactique du néerlandais, avec retrait de celles qui portaient trop de sens, un filtrage qu'Ebbinghaus n'appliquait pas. Les rangées sont récitées à 150 battements par minute, cadence reprise d'Ebbinghaus, une répétition durant 5,2 secondes en moyenne, avec quinze secondes de pause entre deux rangées. Le critère d'arrêt change : une récitation correcte plutôt que deux, le choix qu'Ebbinghaus lui même avait adopté dans sa seconde campagne, en 1883-1884, jugeant que la première méthode ne remplissait qu'incomplètement son office. Ce n'est pas le seul écart, et les auteurs les énumèrent : dix listes par intervalle au lieu de 12 à 45, aucune heure de séance fixe là où Ebbinghaus testait ses quatre intervalles les plus longs à trois moments de la journée, un rythme de récitation en iambes plutôt qu'à trois temps, et un calendrier d'apprentissage dont on ignore, chez Ebbinghaus, à quoi il ressemblait au delà de neuf heures. Un contrôle vérifie que le tirage n'a pas biaisé la répartition : le nombre moyen de répétitions au premier apprentissage ne diffère pas significativement selon l'intervalle, F(6, 69) = 0,691, p = 0,658. Les données brutes sont déposées sur l'Open Science Framework, à osf.io/6kfrp.
Les quatre courbes
La comparaison ne porte pas sur deux courbes mais sur quatre. Elle inclut une réplication antérieure, celle de Heller, Mack et Seitz, publiée en 1991 dans la Zeitschrift für Psychologie, volume 199, pages 3 à 18, avec deux sujets dont les données sont reprises séparément. Les scores d'économie mis côte à côte donnent, pour Ebbinghaus : 0,582, 0,442, 0,358, 0,337, 0,278, 0,254, 0,211. Pour Mack : 0,544, 0,432, 0,285, 0,316, 0,365, 0,309, 0,258. Pour Seitz : 0,442, 0,325, 0,270, 0,270, 0,286, 0,205, 0,201. Pour Dros : 0,472, 0,373, 0,276, 0,317, 0,230, 0,168, 0,041.
Le jugement des auteurs est explicite : compte tenu des différences individuelles attendues, ils trouvent la ressemblance des quatre graphiques remarquable. Plus de cent trente ans séparent la première série de la dernière, la langue du matériel n'est pas la même, et une fois les courbes normalisées sur leur premier point, les tracés se recouvrent largement.
Le seul écart franc est le point de Dros à trente et un jours : 0,041 contre 0,211 pour Ebbinghaus. Les auteurs ne le masquent pas, mais ils ne le tranchent pas non plus. Ils écrivent qu'ils ne peuvent que spéculer, et posent trois pistes. Ce sujet oublie peut être davantage à long terme. Les listes de l'intervalle long ont toutes été apprises au tout début de la période, faute de temps disponible, donc en apprentissage massé là où les autres intervalles étaient étalés. Et le temps d'apprentissage a dérivé vers le haut tout au long des 75 jours, de 2,67 secondes par jour et par liste, une régression linéaire expliquant 56,18 pour cent de la variance. Corrigé de cette dérive, le score à trente et un jours remonte à 0,137, ce qui reste bien sous les trois autres. Une quatrième hypothèse, le nombre de listes intercalées entre apprentissage et réapprentissage, est testée et écartée : elle ne rend compte que d'environ 8,4 pour cent de la variance.
Le point à vingt quatre heures
La réplication ne fait pas que confirmer. Elle revient sur un point qu'Ebbinghaus avait vu et n'avait pas su classer.
Sur sa propre courbe, l'économie passe de 35,8 pour cent à 8,8 heures à 33,7 pour cent à vingt quatre heures. La chute s'interrompt presque. Ebbinghaus s'en explique longuement. Il chiffre la baisse à 2,5 points sur la tranche de 9 à 24 heures et à 6,1 points sur celle de 24 à 48 heures (son propre tableau donne plutôt 2,1 et 5,9), et juge non crédible qu'on perde environ le triple sur la seconde. Surtout, il envisage explicitement le sommeil comme cause et l'écarte : même en supposant que la nuit ralentisse nettement l'effacement, la forme obtenue ne lui paraît pas tenir. Il conclut qu'une des trois valeurs doit être affectée par le hasard, suppose que le 33,7 est trop élevé de un à deux points, puis se ravise, parce que des observations qu'il présente ensuite le confirment, et se déclare dans le doute.
Ces observations viennent de la campagne de 1883-1884 : sept essais de neuf séries de 12 syllabes, réapprises après vingt quatre heures, donnent 33,4 pour cent. Contre 33,7. Ebbinghaus souligne lui même que les deux chiffres proviennent de périodes éloignées et de recherches très différentes, ce qui rend l'accord d'autant plus notable. Le point tient. Murre et Dros lisent cette suite comme une méfiance assez forte pour justifier un contre test, ce qu'Ebbinghaus, lui, ne dit pas en ces termes.
En 1924, Jenkins et Dallenbach interprètent l'anomalie comme un effet du sommeil, et c'est ce qui les pousse à monter leur étude sur l'oubli pendant le sommeil et pendant la veille, parue dans l'American Journal of Psychology. Murre et Dros formalisent l'intuition : ils ajoutent à la fonction puissance un terme de rehaussement constant, appliqué aux seuls intervalles d'un jour et plus. Sur les quatre jeux de données, la variance expliquée moyenne passe de 98,7 à 99,1 pour cent, la somme des écarts au carré de 0,00932 à 0,00628, le critère d'information d'Akaike de moins 22 à moins 23,6. L'amplitude du ressaut vaut 0,030 chez Ebbinghaus et 0,131 chez Mack.
Les auteurs restent prudents, et il faut les suivre. Ils qualifient eux mêmes ces résultats de mitigés, et disent qu'un écart d'AIC de 1,6 en moyenne peut tout au plus s'appeler une tendance vers une différence qui compterait, avec de grandes différences entre sujets. Les données de Dros ne montrent aucun ressaut, leurs ajustements étant probablement tirés par ce point très bas à trente et un jours. Et attribuer le ressaut au sommeil demanderait, écrivent ils, d'autres expériences. La conclusion publiée dit exactement cela : la courbe a bien été répliquée, elle n'est pas parfaitement lisse, et elle montre très probablement un saut vers le haut à partir du point de vingt quatre heures.
Pourquoi la version décorative a tenu
Le calendrier est presque insolent. La réplication paraît le 6 juillet 2015. Moins de deux mois plus tard, le 28 août, Science publie le rapport de l'Open Science Collaboration, référence 349(6251) : aac4716. Sur 100 études de psychologie rejouées, expérimentales et corrélationnelles, parues en 2008 dans trois revues, 97 pour cent des originales affichaient un résultat statistiquement significatif, contre 36 pour cent des réplications, et les effets répliqués faisaient la moitié de l'amplitude des effets d'origine.
Le rapprochement est tentant et il demande une précaution, parce que les deux épreuves ne mesurent pas la même chose. L'Open Science Collaboration juge une reproduction principalement à la significativité statistique d'un effet, là où Murre et Dros comparent la forme d'une courbe descriptive, point par point, sans test d'hypothèse central. Une mesure de 1880 obtenue par un homme seul sur lui même ne passe donc pas le même examen que les cent études de 2008. Elle en passe un autre, et elle le passe.
Reste que Murre et Dros portent au crédit d'Ebbinghaus, dans leur remarque finale, une liste de pratiques que la psychologie a mis un siècle à rendre standard : matériel de stimulation contrôlé, contrebalancement des effets d'heure de la journée, protection contre l'arrêt optionnel, analyse statistique des données et modélisation. Le contrebalancement mérite une nuance. Ebbinghaus a bien testé ses quatre intervalles les plus longs à trois moments de la journée, mais pour les intervalles courts il a corrigé après coup, avec des pourcentages estimés sur d'autres séries. Heller et ses coauteurs, eux, ont pu fixer leurs horaires, n'ont trouvé aucun effet d'heure de la journée et n'ont appliqué aucune correction.
Reste aussi à expliquer pourquoi la courbe est demeurée un décor. Une réplication existait depuis 1991, celle de Heller, Mack et Seitz. Elle était en allemand, sans résumé anglais, absente du web au moment où Murre et Dros écrivent, et jamais citée dans une revue internationale anglophone. La preuve était disponible et invisible. Ebbinghaus lui même invitait à la prudence : cet énoncé et la formule sur laquelle il repose, écrit il, n'ont d'autre valeur que celle d'un résumé de résultats obtenus une seule fois et dans les circonstances décrites, et il ne peut dire, à ce stade, si d'autres circonstances ou d'autres individus leur donneraient d'autres constantes. Il aura fallu 70 heures de syllabes sans queue ni tête, un hiver néerlandais et cent trente et un ans pour commencer à lui répondre. Trois sujets de plus ne font pas une population, mais ils font mieux qu'une légende de manuel.
