La vérité est que les professeurs d’université et les bibliothécaires interagissent rarement, peut-être pour débattre de documents de recherche obscurs ou pour fournir aux débutants une introduction à la bibliothèque. Mais désormais, cette collaboration doit s’approfondir au nom de tous ceux qui se soucient du savoir authentique.
En tant que professeur à l’Université de Californie à Irvine, j’ai récemment été choqué d’apprendre que des déchets d’IA avaient piraté nos fonds de bibliothèque soigneusement organisés et coûteux. Le plus choquant était que l’incursion n’était pas marginale. Il est venu du cœur de nos exploitations : Springer Nature. Apparemment, depuis mai 2021, Springer Nature publie des revues de littérature « basées sur l’IA », des textes de longueur de livre que l’éditeur décrit comme incorporant « un mélange de textes écrits par des humains et d’aperçus de la littérature générés par des machines ». Et depuis que la California Digital Library achète la première liste de livres électroniques de Springer pour les campus de l'Université de Californie, ces ouvrages « basés sur l'IA » sont désormais disponibles pour tous les professeurs et étudiants de l'UC.
Les aperçus de la littérature générés automatiquement par Springer Nature sont accompagnés d'une clause de non-responsabilité dans les métadonnées. Ce n’est pas la meilleure pratique scientifique – qui devrait être motivée par l’expertise humaine – mais peut-être pas tragique dans des domaines plus techniques comme Physiologie des muscles squelettiquesoù certains types d’analyse de données non humaines peuvent être particulièrement utiles. Mais sérieusement : un « livre » comme celui-ci coûte 139,99 $ à lui seul, désormais intégré discrètement au CDL ? Un livre tiré uniquement du contenu de Springer Nature, pas des meilleures sources disponibles, et toujours certes expérimental en tant que pratique commerciale d'édition universitaire ?
Une couverture rigide à 159,99 $, Critique et théorie critique : un aperçu généré par la machine« rédigé » par Laxman Jogdand, commence par une sorte de clause de non-responsabilité qui explique que le livre a été généré via une approche de synthèse extractive, puis « soigneusement édité » et introduit par Jogdand. Que les introductions soient elles-mêmes générées par l’IA ou non, elles pourraient tout aussi bien l’être, car elles enchaînent les banalités sur la façon dont, par exemple, « les lectures littéraires ont atteint de nouveaux sommets avec l’avènement d’une approche scientifique » et sur le fait que des auteurs classiques comme Longinus soulignent « la pertinence intemporelle de la pensée littéraire classique dans la compréhension des complexités de la créativité et de l’expression humaines ».
Mais peut-être que lorsque vous extrayez une telle littérature humaniste uniquement à partir de l’enclos des releveurs Springer Nature, c’est le type de pente d’introduction que vous obtenez (une revue approfondie d’un de ces titres est disponible ici). Et je ne peux qu’imaginer à quoi ressemble une telle thésaurisation des ressources du point de vue de petits éditeurs, comme Duke University Press ou Verso, où ils publient de bons livres de théorie critique.
Outre les titres explicitement qualifiés de « générés automatiquement », il existe également le cas de Maîtriser l'apprentissage automatique : des bases à l'avancéeque Springer Nature a retiré seulement après Montre de rétraction a rapporté que le titre contenait plusieurs références à des œuvres qui n'existaient pas. Tout le monde fait des erreurs, et l’édition d’entreprise n’est pas différente ?
Springer Nature, sans aucun doute comme d’autres éditeurs à l’esprit d’affaires à travers le monde, lance des ballons d’essai afin de déterminer ce que les arbitres universitaires du savoir toléreront à la pointe d’un modèle économique. Dans quelle mesure est-ce répandu ? Par exemple, un autre éditeur majeur, Elsevier, semble repousser les limites de la connaissance authentifiée de manière moins agressive, mais ils – comme tous les autres acteurs du monde de l’écriture sérieuse en ce moment – ont du mal à définir où se situe la frontière actuelle. Où leurs questions-réponses demandent, par exemple : « Puis-je utiliser le texte généré par l'IA directement dans mon manuscrit ? la réponse est essentiellement oui. Bien entendu, l'auteur reste responsable du texte généré. Mais en même temps, l’auteur se retrouve partiellement intégré dans son nouveau rôle d’inspecteur du contrôle qualité.
Les professeurs d’université et les bibliothécaires doivent dire non maintenant, collectivement et haut et fort. Notre rôle d’arbitre suprême des connaissances authentifiées est en jeu, et aucune autre institution – y compris l’appareil juridique protégeant la propriété intellectuelle – ne pourrait combler le vide ; cette question du contrôle qualité n'est que partiellement couverte par la loi ou par des institutions fédérales comme les National Institutes of Health, qui sont elles-mêmes liées à ces mêmes entreprises gérant des publications expertes à comité de lecture, comme La Lancette (Elsevier) ou la prestigieuse publication Springer, à juste titre Nature.
Comment en sommes-nous arrivés là ? Du point de vue du secteur de l’édition, bien sûr, plus une maison d’édition peut produire de matériel d’apprentissage automatique et d’IA généré en interne sans auteurs experts pour rémunérer ou sans examen par les universités, meilleur est le résultat net. Au risque de paraître trop dramatique, nous sommes à l’aube d’une bataille mondiale visant à rétablir ce que signifie en premier lieu la connaissance authentifiée. Et il existe aujourd’hui des entités très bien financées et juristes qui tentent de repousser ces limites de manière agressive dans une direction qui s’écarte de l’expertise humaine identifiable tout en adoptant de nouvelles formes de connaissances, ou pseudo-connaissances, définies non pas par l’expertise humaine mais par le pare-feu technique, juridique – et financier – qui sépare les documents publiés des experts humains à leur origine.
À ce rythme, nous vivrons bientôt dans un monde où l’évaluation par les pairs persiste principalement au sommet de la chaîne alimentaire du savoir, tandis que les machines de production de connaissances contrôlées par des entités commerciales détruisent les pratiques humaines réelles de production de connaissances par le bas.
Quelles sont les prochaines étapes ? Premièrement, la radiodiffusion. Les tactiques récentes du secteur de la connaissance suggèrent qu’ils tentent une lente ébullition qui modifie les sensibilités autour de la connaissance sans que personne ne proteste. Et comme Becky Imamoto, responsable des stratégies de collecte à la bibliothèque de l'UC Irvine, et moi-même l'avons découvert en présentant ce matériel à notre comité consultatif sur l'IA à l'échelle du campus, les professeurs ne sont généralement pas au courant de la situation cinq ans plus tard, même s'ils la trouvent choquante lorsqu'ils sont informés.
Deuxièmement, l’action collective. Comme le démontre l’accord historique de libre accès de 2020 entre l’Université de Californie et Springer Nature, lorsqu’elles sont interpellées, nos entreprises du savoir sont en fait désireuses de négocier ces questions fondamentales à grande échelle, plutôt que de laisser le système de connaissances qu’elles aident à gérer s’effondrer de manière plus dramatique.
Troisièmement, nous devrions soutenir de manière sélective les éditeurs qui continuent de respecter les normes les plus élevées, par exemple (d'après mon expérience récente) un autre titan mondial, Cambridge University Press, qui a investi un capital matériel et intellectuel important dans son prochain projet Cambridge History of Rhetoric en cinq volumes, impliquant les efforts d'environ 250 experts reconnus dans le domaine, soutenus par au moins trois cycles d'édition du côté scientifique, plus quatre autres cycles minutieux du côté de la production. (Je suis co-éditeur du tome 5.)
Pour les bibliothécaires, le message est le suivant : les professeurs de recherche universitaires se soucient profondément de vous dans votre rôle de gardiens les plus immédiats de ce qui compte comme connaissance. L'heure est à une nouvelle collaboration dans ce sens alors que les enjeux apparaissent, pour nous deux, profonds. Pour d’autres, le message est de réfléchir sérieusement aux alternatives qui restent si les universités et leurs bibliothèques disparaissent.