Dans un article récent dans L'AtlantiqueJohn Paul Rollert décrit la méfiance qui règne dans les campus universitaires en soulignant le rôle émergent du professeur en tant que juge. Les professeurs, dit-il, deviennent juge, jury et bourreau. Mais il ne demande jamais ce que valent les preuves sur la base desquelles nous agissons.
En tant que collègue professeur d’éthique, je n’ai pas encore complètement accédé au rôle de bourreau. Mes vieilles habitudes ont la vie dure. Pour la note finale de mon cours d'éthique en ligne il y a deux semestres, je n'ai pas pu résister à l'attrait de mon vieil ami, la dissertation finale. J'ai essayé de m'adresser directement à l'éléphant dans la pièce et j'ai posé la question suivante à mes étudiants : « ChatGPT (ou d'autres modèles d'IA) devrait-il être utilisé pour résoudre des dilemmes éthiques dans le monde réel ? Pourquoi ou pourquoi pas ? Utilisez au moins deux théories de ce cours (ainsi que des exemples et du matériel de cours) pour étayer votre réponse. » J'étais tellement fier de ma question que je l'ai même postée sur Instagram.
J'ai donné des instructions détaillées sur la façon dont ce devoir devait être soumis via Google Docs, où je pouvais facilement vérifier les historiques de versions pour de gros morceaux de matériel (généré par l'IA) collés. J'ai vaqué à mes occupations et j'ai attendu les soumissions. Lorsque je me suis assis pour noter ce lot de devoirs : un, deux, trois, les 10 premiers essais étaient tous composés de nombreux paragraphes simplement collés dans Google Docs. Le tout avec des phrases d’ouverture similaires et étrangement familières – qui, d’une manière ou d’une autre, ressemblaient simultanément à du langage qui s’agitait dans une boîte de conserve, mais aussi étrangement à un étudiant de deuxième année écrivant dans un cours d’introduction à l’éthique. Les essais avaient tout ce qu’il fallait et ils empestaient étrangement la reproduction mécanique – ce qui était d’autant plus ironique en réponse à une question explicite sur l’IA et l’éthique.
J'ai immédiatement écrit aux trois sections, offrant aux étudiants une chance de s'autocorriger : « Si votre papier apparaît directement coupé-collé, vous avez 48 heures pour rédiger une clause de non-responsabilité de 300 mots ou une explication de ce qui a motivé ce choix de votre part. Je leur ai rappelé que le fait de prendre des connaissances acquises et de les mettre en mots est en soi un acte créatif. Il s’agit littéralement du traitement cérébral et de la compréhension des connaissances acquises. Mais même s'ils ne se souciaient pas de tout cela, j'ai fait appel à la décence fondamentale de mes élèves : donnez-moi au moins le plaisir de répondre aux paroles d'un véritable humain.
J'ai reçu six réponses. C'était ce à quoi on s'attendait : quelques défenses mal argumentées de l'IA elle-même, prétendant que c'est inévitable, alors vous feriez mieux de vous y mettre, professeur. Celle qui a dit à quel point elle détestait ça, pense que c'est mauvais pour l'humanité, mais elle avait trop de travail à faire et c'était tout simplement trop facile. Et puis il y a eu une réponse qui était également clairement générée par l’IA.
Pendant des années, j'ai eu une ligne dans mon programme sur le plagiat. Je raconterais une petite blague sur l'ironie du plagiat dans un cours d'éthique et j'aurais de légers rires. Personne ne rit maintenant.
J'ai siégé à des comités facultaires pour l'intégrité académique, j'ai été conférencier principal lors d'un symposium sur l'honnêteté intellectuelle, j'ai fait partie du conseil d'honneur en tant qu'étudiant en deuxième année d'université et j'enseigne l'introduction à l'éthique depuis plus de 15 ans, à des centaines d'étudiants dans toutes sortes de disciplines et de toutes sortes d'horizons. Ces actions ne se sont pas produites parce que je m'en fiche, mais plutôt parce que je suis beaucoup trop profondément, trop moralement investi. Mais plus encore, je suis démoralisé. Perdre courage, corrompre la morale, perdre la foi – démoraliser.
Au semestre dernier, j'avais appris quelques choses. Je n'arrivais toujours pas à abandonner le devoir de rédaction finale, mais j'ai entendu parler d'une nouvelle plate-forme de détection d'IA appelée Pangram. Je savais que ces outils étaient controversés. Même si certaines études avaient signalé que les détecteurs d'IA étaient extrêmement défectueux, Pangram n'était pas inclus dans ces études et proclamait une précision de détection extrêmement élevée. Je voulais croire que c'était vrai. J’ai donc payé un abonnement et parcouru chaque essai. Tout étudiant dont la dissertation était signalée comme étant générée à 60 % par l'IA ou plus a reçu un e-mail de ma part. En termes très neutres, je leur ai dit que leur essai avait été signalé comme généré par l'IA, qu'ils auraient la possibilité de le réécrire, mais sinon, acceptez un C (qu'est-ce que l'écriture par l'IA, à part une solide moyenne ?).
Cette fois, les étudiants ont répondu avec passion : « Je n’ai pas utilisé l’IA ! » «J'ai travaillé très dur sur ce devoir et je l'ai écrit moi-même!» Je me suis senti très mal et j'ai immédiatement commencé à rechercher l'efficacité de Pangram. Je fais confiance à Pangram, mais il y a une assez grande partie de moi qui fait toujours confiance – et veut toujours faire confiance – à mes étudiants. C'est peut-être une autre vieille habitude qui aura la vie dure. J'ai dû admettre que pour chacun de ces essais qui sonnaient exactement comme les écrits de deuxième année, je ne pouvais vraiment pas savoir s'ils avaient été rédigés par les étudiants dont les noms figuraient sur le devoir. Et c'est cette méconnaissance qui est le problème.
En fin de compte, presque tous les étudiants signalés par Pangram ont reçu un C. L'ont-ils obtenu ? Dans mon insu, j'ai partagé la différence et j'ai opté pour une note moyenne. Certains d’entre eux méritaient un F. Et certains d’entre eux ont peut-être écrit chaque mot eux-mêmes et auraient pu légitimement mériter un A.
En fin de compte, un détecteur d’IA ne fait pas de rapport sur un élève en particulier. Il rapporte ce que pense un autre modèle d’IA de la formulation des mots dans un essai. Transformer cette estimation, un verdict supposé, en une évaluation d’une personne nécessite une inférence épistémologique que peu d’entre nous sont vraiment prêts à faire. J'ai décidé de ne pas utiliser Pangram ce semestre. Non pas parce que je pense que c’est souvent faux, mais parce que je ne le sais pas. Malgré les affirmations d’efficacité de l’entreprise, qui sait vraiment ? Comment savoir comment savoir ?
Ces outils de détection peuvent être globalement crédibles, tandis que chaque accusation individuelle peut nécessiter davantage de certitude. Nous nous trouvons désormais dans un territoire où les critères mêmes de cette certitude ne sont pas clairs. Rollert nous dit que les étudiants sont désormais des criminels et que les professeurs sont juges, jurés, bourreaux – trois rôles que personne n'a jamais accepté de siéger devant un comité de recrutement de professeurs. Je demande quelle devrait être la norme de preuve et ce qui est arrivé à la notion d'innocence jusqu'à preuve du contraire. Ce critère de culpabilité est-il suffisant ?
Mes efforts erronés avec Google Docs et Pangram n'étaient pas vraiment un effort pour attraper les tricheurs. Il s’agissait en fin de compte d’une tentative de mettre fin à une incertitude à laquelle il est peut-être impossible de mettre fin. Que se passe-t-il lorsque des membres du corps professoral – juges, jurés, bourreaux nouvellement nommés – rendent le verdict même si personne n’a dit à quoi ressemble le doute raisonnable ? Je crains que ceux qui pourraient être innocents ne fuient complètement toute l’entreprise.