Technologie

Affaire Orélien : l'IA générative plonge l'édition française dans l'ère du soupçon

Accusé d'avoir été écrit en grande partie par une IA, le roman phare de la rentrée secoue maisons d'édition et jurys. En l'absence de preuve fiable, le doute devient le vrai problème.

Affaire Orélien : l'IA générative plonge l'édition française dans l'ère du soupçon

La rentrée littéraire française devait se jouer, comme chaque automne, sur les premières sélections des grands prix. Elle se joue désormais aussi sur une question que le milieu repoussait depuis l'arrivée de ChatGPT à la fin de 2022 : qui, de l'auteur ou de la machine, a vraiment écrit le livre ? Selon une enquête du Figaro, la dénonciation d'un « usage massif » de l'intelligence artificielle dans l'écriture du roman événement de la saison, que le quotidien désigne comme l'« affaire Thélyson Orélien », a « ouvert la boîte de Pandore ». Les maisons d'édition et les jurys s'interrogent désormais publiquement sur l'attitude à adopter.

Un roman, une accusation, une Académie qui trace une ligne

Le même jour, Le Nouvelliste a rapporté que le roman « C'était ça ou mourir » relançait le débat sur l'éthique littéraire et que l'Académie Goncourt entendait envoyer « un message clair aux auteurs » : elle « ne cautionne d'aucune façon la création de textes générés par l'intelligence artificielle ». Les deux articles, parus simultanément et portant sur la même controverse, désignent selon toute vraisemblance le même livre. Précisons toutefois que les extraits disponibles au moment d'écrire ces lignes ne permettent pas de reconstituer dans le détail la nature exacte des passages mis en cause, ni l'ampleur réelle de l'usage allégué. Il s'agit, à ce stade, d'une accusation, et non d'un fait établi.

C'est précisément là que réside le cœur du dossier. Dans les affaires de ce type, les reproches reposent généralement sur un faisceau d'indices : une prose jugée lisse et uniforme, des tournures récurrentes typiques des grands modèles de langage, des incohérences de détail, parfois le verdict d'un logiciel de détection. Aucun de ces éléments, pris isolément, ne constitue une preuve. Et c'est bien ce qui rend la position des jurys si délicate.

Des détecteurs qui ne tiennent pas leurs promesses

Plusieurs outils prétendent repérer les textes produits par une IA : GPTZero, Originality.ai, Copyleaks, Pangram ou le module intégré à Turnitin, très répandu dans les universités. Leur principe est semblable. Ils mesurent la « perplexité » d'un texte, c'est-à-dire son degré de prévisibilité pour un modèle de langage, ainsi que sa « variabilité » (burstiness), soit l'alternance de phrases courtes et longues, simples et complexes. Un texte trop prévisible et trop régulier est jugé suspect.

Les limites de cette méthode sont documentées depuis longtemps. En juillet 2023, OpenAI a retiré son propre classificateur de textes pour cause de précision insuffisante : l'outil ne repérait qu'environ un quart des textes générés par IA et signalait à tort près d'un texte humain sur dix. La même année, des chercheurs de l'Université Stanford ont montré que plusieurs détecteurs classaient comme artificielle une majorité de rédactions rédigées par des personnes dont l'anglais n'est pas la langue maternelle, parce que leur style, plus contraint, paraît plus « prévisible ». D'autres travaux universitaires ont démontré qu'une simple reformulation, humaine ou automatique, suffit à tromper la plupart de ces outils.

Pour la littérature, le problème est aggravé par plusieurs facteurs. La plupart des détecteurs ont été entraînés d'abord sur l'anglais. Un roman passe par plusieurs mains, celles de l'éditeur, du correcteur, parfois d'un réviseur, qui ont justement pour mission d'harmoniser le texte. Enfin, certains styles d'écriture volontairement dépouillés ressemblent, statistiquement, à ce que produit une machine.

Le tatouage numérique (watermarking) est parfois présenté comme la solution. Google a publié en 2024 dans la revue Nature les principes de SynthID Text, qui insère une signature statistique invisible dans les textes générés par ses modèles. Mais ce procédé ne fonctionne que si le fournisseur de l'IA l'active, il s'affaiblit lorsque le texte est retravaillé, et il ne dit rien des textes produits par des modèles concurrents ou libres. Autrement dit, il n'existe aujourd'hui aucun test capable d'établir, avec la rigueur exigée pour priver un auteur d'un prix, qu'un roman a été écrit par une machine.

Assistance ou rédaction : où tracer la frontière ?

La deuxième difficulté est conceptuelle. Entre le correcteur orthographique et la génération de chapitres entiers, les usages forment un continuum : recherche documentaire, remue-méninges, reformulation d'une phrase bancale, traduction d'une citation, suggestion de dialogues, puis rédaction de passages repris tels quels.

Certains acteurs ont déjà tenté de formaliser cette distinction. Depuis septembre 2023, la plateforme d'autoédition d'Amazon, Kindle Direct Publishing, exige que les auteurs déclarent les contenus « générés » par IA (textes, images ou traductions produits par l'outil, même retouchés ensuite), mais pas les contenus simplement « assistés », lorsque l'auteur a créé le texte et utilisé l'IA pour le peaufiner. Le critère retenu est celui de l'origine du texte, et non celui de l'outil employé.

Le précédent japonais est éclairant. En janvier 2024, la romancière Rie Kudan a reçu le prestigieux prix Akutagawa, puis a déclaré qu'environ 5 % de son roman, qui met d'ailleurs en scène une IA, provenait mot pour mot de ChatGPT. Le jury n'a pas retiré la récompense. L'usage était transparent, limité et intégré au propos de l'œuvre. La transparence a désamorcé ce qu'une révélation a posteriori aurait transformé en scandale.

Les pistes sur la table

Face à ce flou, trois grandes options se dessinent dans l'édition et chez les jurys.

La déclaration obligatoire. Les auteurs attesteraient, au moment du dépôt d'un manuscrit ou de l'inscription à un prix, de l'usage éventuel d'outils d'IA et de leur nature. C'est la voie la plus simple à mettre en œuvre, mais elle repose entièrement sur la bonne foi du déclarant.

Les clauses contractuelles. Les contrats d'édition comportent déjà une clause de garantie par laquelle l'auteur certifie être le créateur original de son œuvre. Le droit d'auteur français protège les « œuvres de l'esprit » portant l'empreinte de la personnalité de leur auteur, une notion qui suppose une création humaine. Aux États-Unis, le Copyright Office refuse d'enregistrer les contenus produits par une machine sans apport humain suffisant, une position confirmée par les tribunaux. Un texte massivement généré pourrait donc fragiliser les droits mêmes que l'éditeur exploite. Des clauses spécifiques à l'IA, avec obligation d'information et sanctions en cas de fausse déclaration, sont une suite logique.

L'exclusion des prix. La position affichée par l'Académie Goncourt va dans ce sens, du moins sur le plan des principes. Encore faut-il définir ce que l'on exclut, et comment on le prouve. Un règlement qui bannit « les textes générés par IA » sans en préciser les contours risque d'être inapplicable ou, pire, appliqué sur la foi de simples soupçons.

L'ère du soupçon, soixante-dix ans après Sarraute

Le Figaro parle d'une « ère du soupçon généralisé ». La formule fait écho, involontairement ou non, à l'essai de Nathalie Sarraute paru en 1956, où le soupçon portait sur le personnage de roman. Il porte aujourd'hui sur l'auteur lui-même.

C'est le véritable basculement. Puisqu'on ne peut prouver ni l'usage de l'IA ni son absence, chaque style trop fluide, chaque auteur trop prolifique, chaque premier roman trop maîtrisé peut devenir suspect. La charge de la preuve tend à s'inverser : ce n'est plus à l'accusateur de démontrer la fraude, c'est à l'écrivain de démontrer son innocence. Certains conservent désormais leurs brouillons successifs, l'historique des versions de leurs fichiers, voire des captures de leur processus d'écriture. La traçabilité devient une compétence d'auteur.

Le risque est double. D'un côté, des fraudes réelles peuvent passer entre les mailles du filet. De l'autre, des réputations peuvent être ruinées par des accusations impossibles à réfuter, comme l'ont vécu de nombreux étudiants faussement signalés par des détecteurs. Le débat dépasse d'ailleurs largement les cercles littéraires : l'IA s'est invitée dans la précampagne présidentielle française, même si, comme l'a relevé Le Monde, le « grand débat » organisé sur ce thème à Marseille n'a attiré qu'un seul candidat.

Pour les jurys, la question n'est donc plus seulement de savoir s'il faut bannir l'IA, mais comment gouverner un milieu où le doute ne peut plus être levé. La réponse passera sans doute moins par la technologie que par des règles claires, une transparence exigée en amont et une présomption de bonne foi maintenue tant que la preuve fait défaut. Faute de quoi, c'est la confiance entre auteurs, éditeurs, jurys et lecteurs, fondement même du prix littéraire, qui s'effritera.