On a décidé de faire disparaître notre tuteur IA pendant les quiz. Voici pourquoi ce n'est pas une question de triche.

Quand nous expliquons que le tuteur IA de PimenkoAI se retire automatiquement dans les Tests, les Devoirs et les Ateliers, la réaction est presque toujours la même : « logique, sinon les apprenants trichent ». C’est vrai, et les chiffres le confirment. Une enquête Wiley menée auprès de plus de 2 900 étudiants et enseignants nord-américains montre que 86 % des enseignants estiment la triche plus probable en ligne qu’en présentiel, et que 46 % des étudiants reconnaissent que l’IA facilite la triche.

Sauf que ce n’est pas la raison pour laquelle nous avons pris cette décision. Ou plutôt : c’est la moins importante des deux.

La vraie raison est cognitive. Un quiz n’est pas seulement un instrument de mesure, c’est un acte d’apprentissage à part entière. Une IA qui aide pendant un quiz ne fausse pas seulement la note. Elle supprime le mécanisme qui fait qu’un quiz construit de la mémoire. Et le plus gênant, c’est que ni l’apprenant ni le formateur ne peuvent s’en apercevoir sur le moment.


L’idée reçue : « masquer l’IA pendant un quiz, c’est une question de triche »

Cette lecture n’est pas fausse, elle est incomplète. Et elle conduit à des décisions de conception médiocres.

Si le problème se réduit à la triche, alors la solution logique consiste à surveiller : détection de plagiat, proctoring, verrouillage du navigateur, analyse comportementale. Tout un marché s’est construit là-dessus. Le raisonnement sous-jacent est que l’apprenant est un fraudeur potentiel qu’il faut contenir.

Ce cadrage pose deux problèmes. Il instaure une relation de défiance avec les apprenants, ce qui est rarement productif en formation professionnelle. Et surtout, il rate l’essentiel : même un apprenant parfaitement honnête, qui utilise une IA pendant un quiz avec les meilleures intentions du monde pour « mieux comprendre », se prive d’un bénéfice cognitif majeur.

La question n’est pas « est-ce que l’apprenant triche ? ». Elle est « est-ce qu’on lui retire l’effort qui construit sa mémoire ? ».


Ce qu’est vraiment un quiz : l’effet de test

L’effet de test (testing effect, ou pratique de récupération) est l’un des phénomènes les mieux établis de la psychologie cognitive. Son principe : le simple fait de récupérer une information en mémoire renforce cette mémoire davantage que de relire la même information.

Autrement dit, se tester n’est pas seulement une façon de vérifier ce qu’on sait. C’est une façon d’apprendre, et une façon plus efficace que la relecture.

L’expérience de référence a été publiée par Henry Roediger et Jeffrey Karpicke en 2006 dans Psychological Science. Des étudiants lisent un texte, puis sont répartis en deux conditions : les uns le relisent, les autres passent un test de rappel libre. Tous repassent un test final, après des délais différents.

Les résultats à une semaine :

Condition Rappel à 1 semaine
Groupe testé 56 %
Groupe relecture 42 %

Dans une seconde expérience, l’écart se creuse encore : les étudiants ayant étudié une fois puis passé trois tests rappellent 61 % du contenu à une semaine, contre 40 % pour ceux qui ont relu le texte quatre fois de suite.

Un détail mérite d’être souligné, parce qu’il change la façon de concevoir un quiz : dans l’expérience de Roediger et Karpicke, les étudiants testés ne recevaient aucun feedback. Aucune correction, aucune bonne réponse affichée. Le seul fait de chercher en mémoire suffisait à produire le bénéfice.

Cette observation a été confirmée à grande échelle. La méta-analyse de Yang et ses collègues, publiée en 2021 dans Psychological Bulletin, agrège 573 tailles d’effet issues de 222 études, portant sur près de 48 500 étudiants en classe réelle. L’effet global du quiz sur la réussite est de g = 0,499, ce qui, rapporté à la moyenne des interventions éducatives (autour de 0,40), constitue un effet notable. Et le détail qui compte pour notre sujet : l’effet mesuré est de g = 0,63 avec feedback, contre g = 0,60 sans feedback. La différence est marginale.

Le bénéfice ne vient pas de l’information reçue. Il vient de l’effort de récupération.

Cette même méta-analyse établit une hiérarchie utile : le test (0,499) fait mieux que la relecture (0,330), qui fait elle-même mieux que les stratégies élaboratives comme la carte conceptuelle (0,095). L’effet tient à tous les niveaux scolaires, dans 18 catégories de matières, et pas seulement sur les connaissances factuelles : il vaut aussi pour la compréhension conceptuelle et le transfert.


Le piège du bénéfice différé

Voici le point qui rend cette question réellement contre-intuitive, et qui explique pourquoi le problème passe inaperçu dans la plupart des dispositifs.

Reprenons l’expérience de 2006. À une semaine, le groupe testé l’emporte largement. Mais que se passe-t-il si on administre le test final cinq minutes après l’apprentissage ?

Délai Groupe testé Groupe relecture
5 minutes 75 % 81 %
2 jours 68 % 54 %
1 semaine 56 % 42 %

À cinq minutes, la relecture gagne. Les courbes se croisent entre le cinquième jour de l’expérience et le deuxième jour.

Ce croisement est l’un des résultats les plus importants des sciences de l’apprentissage, et l’un des moins intégrés dans la conception de dispositifs de formation. Il signifie que la performance immédiate et l’apprentissage durable sont deux grandeurs différentes, qui peuvent évoluer en sens inverse.

Appliqué à un quiz avec assistance IA, le mécanisme devient limpide. L’apprenant qui bénéficie d’une aide pendant le quiz obtient une bonne note. Il a l’impression d’avoir bien travaillé, et cette impression est sincère : sur le moment, il maîtrise effectivement le contenu, puisqu’il vient de le traiter. Le formateur, de son côté, voit des résultats corrects et en conclut que la séquence fonctionne.

Deux semaines plus tard, en situation réelle, la connaissance n’est pas là. Personne ne fait le lien avec le quiz.

C’est la définition même d’un dommage invisible. Il ne produit aucun signal d’alerte au moment où il se produit, et l’indicateur que tout le monde regarde — la note — évolue dans le mauvais sens, c’est-à-dire à la hausse.


Ce que ça implique pour une IA dans un LMS

Un tuteur IA disponible pendant un quiz intervient exactement au moment où l’apprenant devrait fournir l’effort de récupération. Il court-circuite le mécanisme.

Le phénomène ne se limite pas au cas où l’apprenant demande explicitement la réponse. Même une IA qui « aide à réfléchir », qui reformule la question, qui donne un indice contextuel, réduit la charge de récupération. Or c’est précisément cette charge qui produit le bénéfice mnésique. Une aide bien intentionnée reste une aide, et l’effort évité n’est pas l’effort fourni.

Ce constat rejoint ce que montre la recherche récente sur l’IA en éducation. L’étude de Bastani et ses collègues, publiée en 2025 dans les Proceedings of the National Academy of Sciences, a suivi près d’un millier de lycéens en mathématiques. Les élèves ayant eu accès à un assistant IA sans garde-fous pédagogiques ont obtenu 17 % de moins à l’examen final, passé sans IA, que le groupe qui n’y avait jamais eu accès. Pendant les exercices d’entraînement, avec l’IA disponible, ils performaient pourtant nettement mieux.

Le même schéma, encore : performance immédiate en hausse, apprentissage durable en baisse.

Une recherche publiée début septembre 2026 par David Strömberg, Victor Lei et Yanhui Wu donne à ce phénomène une ampleur inédite. Les auteurs ont exploité 30 mois de relevés administratifs portant sur 26 811 collégiens et lycéens d’un district de Chine centrale, en comparant les élèves selon leur date d’adoption d’un outil d’IA générative. Six mois après l’adoption :

Indicateur Évolution
Temps passé par devoir 64 min → 45 min
Note aux devoirs +18 %
Note aux examens sur table −20 %

Aux examens d’entrée au lycée, la perte atteint 24 % de la moyenne de référence, et 18 % aux examens d’entrée à l’université. Le résultat le plus dérangeant pour notre sujet est ailleurs. Chez les élèves qui n’utilisent pas l’IA, une bonne note de devoir annonce une bonne note d’examen, comme on s’y attend. Chez les utilisateurs, la relation s’inverse : plus la note de devoir progresse vite, plus le résultat à l’examen se dégrade. Les auteurs en tirent une recommandation directe, une hausse rapide des notes de travaux devient un signal d’alerte plutôt qu’un motif de satisfaction.

Deux nuances rendent ce travail encore plus utile. D’abord, la pénalité s’installe progressivement : elle est faible au départ et n’atteint son ampleur maximale qu’au bout de six mois pour les examens mensuels, et de deux ans pour les examens d’entrée. Les auteurs en concluent que les études courtes sous-estiment probablement le coût réel. Ensuite, un élève utilisateur sur cinq échappe complètement à la pénalité : ceux qui continuent à consacrer autant de temps à leurs devoirs qu’avant obtiennent les mêmes résultats que les non-utilisateurs. La variable déterminante n’est pas l’accès à l’outil, c’est l’effort conservé.

Ce travail est un document de travail du CEPR, pas encore évalué par les pairs. Sa convergence avec les résultats expérimentaux de Bastani, obtenus par une méthode entièrement différente, lui donne néanmoins un poids considérable.


Le contre-argument honnête : et les quiz formatifs ?

Il existe une objection sérieuse à tout ce qui précède, et l’ignorer affaiblirait le raisonnement.

Tous les quiz ne sont pas des évaluations. Beaucoup sont des exercices d’entraînement à faible enjeu, conçus précisément pour que l’apprenant se trompe, découvre où il en est, et ajuste. Dans ce cas, une aide contextuelle peut avoir du sens.

La nuance qui compte est celle du moment. Trois configurations sont défendables :

L’aide avant le quiz. Réviser avec un tuteur IA en amont, pour préparer le passage, ne pose aucun problème. L’effort de récupération reste intact au moment du quiz.

Le feedback après soumission. Une fois la réponse validée, une explication détaillée sur l’erreur commise est utile, et le bénéfice de la récupération est déjà acquis. C’est probablement le meilleur endroit pour une IA dans un dispositif d’évaluation.

L’aide pendant un quiz explicitement formatif, sans enjeu de note, avec des tentatives illimitées. Ici, le formateur peut légitimement décider que l’accompagnement prime sur la récupération pure. Ce doit rester son choix, pas un comportement par défaut.

Ce qui n’est pas défendable, c’est une IA disponible par défaut dans toutes les évaluations, sans que le formateur ait eu à en décider.


Notre choix de conception

Le tuteur de PimenkoAI est masqué par défaut dans les activités Test, Devoir et Atelier. Il reste disponible dans les espaces d’apprentissage : Forum, Glossaire, contenus H5P, pages de cours.

Nous n’avons rien inventé. Ce comportement découle de résultats scientifiques établis depuis vingt ans, que nous nous sommes contentés de prendre au sérieux au moment de définir le comportement par défaut du produit.

Deux précisions sur ce choix.

Il est paramétrable. Un formateur qui utilise le module Test pour de l’entraînement à faible enjeu peut réactiver l’assistant sur cette activité. Nous ne prétendons pas connaître son dispositif mieux que lui. Ce que nous affirmons, c’est que le réglage sûr doit être celui par défaut, et que la réactivation doit être une décision consciente.

Il est par activité, pas global. Un cours peut parfaitement combiner des quiz d’entraînement avec assistance et des évaluations sans assistance. C’est même souvent la bonne configuration.

Un dernier mot sur la façon dont ce genre de décision se prend. Un comportement par défaut n’est jamais neutre : la grande majorité des utilisateurs ne modifient pas les réglages livrés. Choisir ce qui est activé à l’installation, c’est décider à la place de la plupart des gens. Autant que cette décision s’appuie sur des données.


Voir comment le comportement du tuteur se configure par activité →


Références