Quand une note décide de l'avenir d'une école, d'un élève ou d'un enseignant, la question de savoir qui, ou quoi, la attribue cesse d'être technique. Au Texas, elle est devenue explosive. Selon The 74, média américain spécialisé en éducation, le nombre de demandes de nouvelle correction des examens STAAR a presque triplé par rapport à l'an dernier. Ce sont surtout les réponses écrites aux épreuves de lecture qui sont contestées, dont des milliers ont d'abord été notées par un ordinateur.
Ce qui s'est passé
Le STAAR (State of Texas Assessments of Academic Readiness) est l'examen standardisé que passent chaque année les élèves texans, de la 3e à la 12e année selon les matières. Il sert de base à de nombreuses décisions : évaluation des écoles et des districts, interventions auprès des établissements en difficulté, information des parents sur le niveau de leur enfant.
À la fin de 2023, la Texas Education Agency (TEA), l'organisme qui supervise l'éducation publique de l'État, a commencé à utiliser un moteur de notation automatisé pour corriger les questions à développement, c'est-à-dire celles où l'élève rédige sa réponse plutôt que de cocher une case. Le motif est connu : l'examen avait été remanié pour comporter davantage de questions ouvertes, ce qui multipliait la quantité de copies à lire, avec les coûts et les délais que cela suppose lorsqu'on recrute des correcteurs humains.
L'automne dernier, des écoles ont constaté ce qu'elles jugeaient être des anomalies, notamment des notes de zéro attribuées à des réponses qui leur paraissaient satisfaisantes. Elles ont alors recouru à la procédure prévue pour demander une nouvelle correction. Ce recours existe depuis longtemps, mais son utilisation a changé d'échelle : d'après The 74, les demandes ont presque triplé en un an. Le simple volume en dit long. Les établissements ne contestent plus quelques cas isolés, ils vérifient systématiquement les résultats qui les inquiètent.
Pourquoi le recours à la révision est un baromètre
Une demande de révision n'est pas anodine. Elle suppose du temps, des ressources et, dans certains systèmes, des frais. Quand elle se multiplie, c'est le signe d'un doute profond sur la fiabilité du processus initial. Il faut toutefois rester prudent : un nombre élevé de demandes ne prouve pas à lui seul que la machine se trompe plus souvent qu'un correcteur humain. Il peut aussi refléter une plus grande vigilance des écoles, une meilleure connaissance de la procédure, ou le fait que des enjeux importants, comme la cote attribuée à un établissement, poussent à tout contester.
Ce que les chiffres indiquent, en revanche, c'est un problème de confiance. Or un examen national n'a de valeur que si ses résultats sont jugés crédibles par ceux qui en subissent les conséquences. Si les enseignants, les directions et les familles soupçonnent que la notation est opaque ou erratique, la légitimité de l'ensemble du dispositif s'érode.
Comment fonctionne la notation automatisée, et ce qu'elle ne sait pas faire
Les systèmes de notation automatique des textes ne sont pas nouveaux. Aux États-Unis, plusieurs États y recourent depuis des années pour des épreuves d'écriture, et la recherche sur le sujet remonte à plusieurs décennies. Le principe général consiste à entraîner un modèle à partir d'un grand nombre de copies déjà notées par des humains, puis à lui faire prédire la note qu'un correcteur aurait attribuée à une nouvelle copie.
Cette approche a des forces réelles : rapidité, coût réduit, constance dans l'application d'une grille. Elle a aussi des limites bien documentées. Le modèle apprend des régularités statistiques, pas le sens. Il peut mal évaluer une réponse originale, atypique ou formulée dans un registre éloigné de ceux sur lesquels il a été entraîné. Les élèves qui écrivent dans une langue seconde, ou dont le style s'écarte de la norme scolaire, sont souvent cités parmi les cas à risque. Le moteur peut aussi être sensible à des éléments de surface, comme la longueur ou le vocabulaire, plutôt qu'à la justesse du raisonnement.
C'est pourquoi les organismes qui adoptent ces outils prévoient en général un contrôle humain : lecture d'un échantillon de copies, double correction des cas limites, vérification de l'accord entre la machine et les correcteurs. La question qui se pose au Texas porte précisément sur l'ampleur et l'efficacité de ces garde-fous, et sur la transparence avec laquelle ils sont communiqués aux écoles.
Un débat qui dépasse le Texas
L'affaire texane illustre une tension que connaissent de nombreux systèmes éducatifs : la pression pour évaluer davantage et plus vite, avec des moyens limités, se heurte à l'exigence d'équité et de lisibilité des notes. L'intelligence artificielle, présentée comme une solution à ce dilemme, déplace le problème sans le résoudre. Elle réduit le coût de la correction, mais elle crée un besoin de justification, car il devient plus difficile d'expliquer à une famille pourquoi la copie de son enfant a reçu telle note.
Le même questionnement traverse l'enseignement supérieur. Le Higher Education Policy Institute (HEPI), un groupe de réflexion britannique, a publié une réflexion de la chargée de cours Manesha Peiris, de l'Université Queen Mary de Londres, sur l'inconduite universitaire à l'ère de l'IA générative. Le sujet est différent, puisqu'il s'agit ici de fraude plutôt que de correction, mais la préoccupation de fond est voisine : à mesure que les outils automatisés s'installent dans l'évaluation, que ce soit du côté de ceux qui produisent les travaux ou du côté de ceux qui les jugent, les institutions doivent redéfinir ce qu'elles garantissent et comment elles le prouvent.
Cette diffusion rapide de l'IA dans les salles de classe se constate aussi ailleurs. Selon le média nigérian Edugist, la plateforme Canva Education revendique environ 460 000 utilisateurs éducatifs inscrits au Kenya, dont 51 000 actifs chaque mois, tandis que l'entreprise élargit ses fonctions d'intelligence artificielle auprès des écoles. Ces chiffres, avancés par un responsable de l'entreprise, relèvent du discours commercial et appellent la prudence. Ils témoignent néanmoins d'un mouvement général : l'IA entre dans l'éducation à grande vitesse, souvent plus vite que les règles destinées à l'encadrer.
Ce qui est en jeu pour les élèves et les écoles
Pour un élève, une note erronée peut avoir des conséquences concrètes : placement dans un programme de soutien qui n'est pas nécessaire, ou absence d'aide là où elle serait utile. Pour une école, les résultats agrégés pèsent sur sa réputation et, dans le système américain, sur les mesures de reddition de comptes qui s'y rattachent. Une correction systématiquement trop sévère, même d'un faible écart, peut suffire à faire basculer un établissement dans une catégorie défavorable.
C'est ce qui explique l'empressement des écoles texanes à demander des révisions. Chaque demande est une façon de rétablir un contrôle humain là où la machine a eu le dernier mot. Mais ce recours a ses propres limites : il repose sur l'initiative des établissements, donc sur leurs ressources et leur capacité à repérer les anomalies. Les écoles les mieux outillées contestent, les autres subissent. Le risque d'une inégalité de traitement s'ajoute alors au risque d'erreur.
Ce qu'il faut surveiller
Plusieurs questions restent ouvertes et détermineront la suite du dossier. D'abord, la proportion de révisions qui aboutissent à une modification de la note : c'est le meilleur indicateur de la fiabilité réelle du moteur. Si une part importante des demandes se traduit par un relèvement, le doute se renforcera. Si, au contraire, la plupart des notes initiales sont confirmées, l'agence pourra faire valoir que la vigilance accrue des écoles a produit plus de demandes sans que la qualité de la correction soit en cause.
Ensuite, la transparence. Les écoles et les familles réclament habituellement de pouvoir comprendre comment une note a été attribuée, ce qu'un modèle statistique peine à offrir de manière intelligible. La publication de données sur la concordance entre notation automatique et correction humaine serait un pas utile.
Enfin, l'arbitrage entre coût et confiance. L'automatisation séduit parce qu'elle fait économiser du temps et de l'argent. Mais si elle oblige à multiplier les révisions manuelles, une partie de ces gains s'évapore, et la crédibilité de l'examen en pâtit. C'est le calcul que devront refaire les autorités texanes, et que d'autres systèmes, qui envisagent de confier à des algorithmes une part de leurs corrections, auraient intérêt à observer de près.
Le cas du STAAR rappelle une évidence que le discours technologique tend à faire oublier : en matière d'évaluation, la rapidité compte moins que la confiance. Une note n'est utile que si ceux qui la reçoivent acceptent qu'elle dise quelque chose de juste.
