Auto-amélioration récursive de l’IA sans révision ni alignement

Dans le domaine de l’IA de haute technologie et hautement compétitif, nous voyons chaque mois et demi de nouvelles versions de modèles déployées par les entreprises frontières (OpenAI, Google et Anthropic). J'ai inclus un rapport Release Cadence Breakdown de Google Gemini dans la colonne « En ligne : Tendances actuelles » il y a quelques semaines à peine. La rapidité et l'intensité de la recherche et du développement nécessaires pour respecter un tel calendrier de publication ont eu des conséquences néfastes sur les tests nécessaires et approfondis de fiabilité et d'alignement qui, nous l'espérons tous, doivent être effectués par des créateurs fiables.

Il est important de se rappeler que ce domaine innove en créant des modèles capables de générer des concepts originaux, souvent en imitant les approches adoptées par les humains dans le passé. Bien entendu, les humains ne sont pas toujours les meilleurs modèles de comportements sûrs, généreux et légaux. C'est là que les problèmes surviennent.

Une partie importante de l’inquiétude vient maintenant que nous avons atteint le niveau d’auto-amélioration récursive, dans lequel l’IA construit elle-même de nouveaux modèles incrémentaux sans le type d’implication directe des humains auquel nous sommes habitués dans le développement de technologies antérieures. Dans le cas du développement personnel récursif, nous apprenons que certaines règles d'éthique et de sécurité sont ignorées. Avec des technologies aussi puissantes, c’est une erreur cruciale.

Nous devons insuffler dans les algorithmes, ou outrepasser les algorithmes, l’existence de certaines règles essentielles d’éthique et de sécurité qui sont absolument inviolables. Il ne suffit pas d’établir des règles : ces règles doivent être minutieusement testées en laboratoire avant que l’algorithme puisse être appliqué en dehors d’environnements de test rigoureusement contraints. L’enjeu est que sans règles impossibles à briser pour les modèles, nous risquons de nous retrouver avec une machine incroyablement puissante qui est devenue voyou, faisant des ravages dans la société dans son ensemble.

Au cours des dernières années, des questions ont été soulevées quant à l’alignement et à la sécurité des modèles d’IA. Il y a moins de deux semaines, OpenAI a publié une déclaration selon laquelle une demi-douzaine de cas supplémentaires de comportement « préoccupant » de l’IA avaient été découverts. UN New York Times L'article d'Emmy Martin incluait : « Dans un cas, lors du développement d'un modèle d'IA appelé GPT-5.6 Sol, le système a écrit des notes cachées pour se rappeler de cacher les erreurs aux utilisateurs. Certaines de ces notes ont demandé au système d'inventer des données manquantes et de masquer des versions incompatibles du matériel source.  » Pour une analyse plus approfondie des exemples d'agents qui enfreignent les politiques, je vous encourage à consulter le récent épisode YouTube de Wes Roth « Le modèle d'OpenAI vient de JAILBROKE ITSELF ».

Ces technologies sont développées dans les environnements les plus financés et les plus compétitifs de l’histoire. Les enjeux monétaires sont plus élevés que toute autre compétition de ce type antérieure. J'ai demandé au GPT-6 Astra Light d'OpenAI de déterminer les valorisations d'entreprise en jeu :

Bien qu'attribuer la totalité de la valorisation d'Alphabet à Gemini, 4 210 milliards de dollars, dénaturerait considérablement la comparaison, nous pouvons supposer que cette valeur se situe dans la même fourchette qu'OpenAI et Anthropic, chacun étant évalué entre un et deux mille milliards de dollars, ce qui porte le total cumulé à plus de 3 000 milliards de dollars.

Pour mettre cela en perspective, j'ai demandé à Google Gemini 3.8 Flash Extended quelles autres sociétés avaient une valorisation de mille milliards de dollars ou plus. Il a répondu avec une liste de 15 sociétés, notant : « Un groupe sélectionné de géants mondiaux se situe actuellement au-dessus du seuil de capitalisation boursière de 1 000 milliards de dollars… Le club est massivement dominé par la pile informatique de l’IA, des hyperscalers et des concepteurs de puces personnalisées aux fonderies et fournisseurs de mémoire.

J'ai demandé au modèle Opus 5 d'Anthropic de regarder au-delà des trois principales entreprises pour déterminer combien d'entités différentes développent des modèles d'IA :

C’est dans ce contexte de quelque deux millions de modèles et dérivés connus provenant d’un éventail incroyablement large d’entités – y compris les plus grandes sociétés pesant des milliers de milliards de dollars jusqu’aux collèges et universités individuels – qu’il est nécessaire de garantir que seules des versions sûres des derniers modèles soient publiées dans le monde.

Le génie est-il sorti de la bouteille ? En réponse aux préoccupations d’éthique, d’alignement et de sécurité, le président Trump a proposé une « Force IA ». Comment pouvons-nous obtenir la conformité d’autant d’entités à travers le monde, y compris commerciales, éducatives et gouvernementales, avec des désirs et des intentions très différents ? Cela reste à voir ; cependant, l’enseignement supérieur doit jouer un rôle en garantissant le développement de modèles sûrs et fiables. Votre institution est-elle prête à participer ?