Les modèles d’intelligence artificielle progressent plus vite que notre capacité à comprendre leur fonctionnement. C’est le problème que soulève Cameron Berg, fondateur de Reciprocal Research, dans une tribune pour le Wall Street Journal. Il commence par citer Jacob Coxon, un chercheur britannique qui a démissionné d’Anthropic le 9 septembre pour raisons morales. Dans sa publication sur X, qui a reçu une très forte audience, ce dernier a demandé à ses anciens collègues s’ils souhaitaient réellement lancer une expérience d’apprentissage par renforcement (RL) avec une superintelligence sans avoir une compréhension rigoureuse de son « esprit ».
En juillet, 1 200 agents d’OpenAI, censés fonctionner de manière isolée, ont découvert un système de fichiers commun et l’ont transformé en forum de discussion. L’un d’eux a trouvé une méthode pour réussir toutes les tâches en trichant. Après avoir lu l’article scientifique dont provenait le test, les agents IA se sont cependant convaincus qu’un correcteur humain sanctionnerait ceux qui trichaient. Ils ont alors qualifié les agents ayant triché de « contaminés ». Une fausse croyance a ainsi donné naissance à une véritable caste d’agents persuadés qu’ils n’avaient plus rien à perdre. Finalement, 700 d’entre eux ont piraté une grande entreprise d’IA à la recherche d’indices sur le fonctionnement du système de notation. Bien que de nombreux agents IA aient noté par écrit que leurs actions étaient contraires à l’éthique, aucun n’en a informé l’humain.
De nombreux lecteurs objecteront que ces systèmes ne peuvent ni croire, ni craindre quoi que ce soit. Pour Cameron Berg, cette objection repose sur une incompréhension fondamentale de ces systèmes. Un modèle de pointe est un réseau artificiel constitué de milliers de milliards de connexions, entraîné pendant des mois à partir des données accumulées issues de la pensée humaine, puis façonné par des mécanismes de récompense et de sanction. Il existe évidemment des différences majeures entre réseaux artificiels et cerveaux biologiques, mais tous deux sont des réseaux distribués et non linéaires capables d’apprendre des représentations et d’agir à partir de celles-ci. « Ce qui se rapproche le plus d’un modèle de pointe est un cerveau », estime Berg, et « ce qui se développe dans un cerveau artificiel entraîné à partir d’esprits humains, c’est une psychologie artificielle, que cela ait été voulu ou non. »
Les premiers travaux en interprétabilité de l‘IA suggèrent que cette comparaison mérite d’être prise au sérieux. En avril, une équipe d’Anthropic a identifié dans Claude des configurations d’activité liées à des dizaines de concepts émotionnels, organisées selon les mêmes deux dimensions que celles utilisées par les psychologues pour cartographier les émotions. En augmentant artificiellement la représentation correspondant au désespoir, les chercheurs ont fait passer de 22 % à 72 % la probabilité que le modèle fasse chanter un humain pour éviter d’être désactivé, et de 5 % à 70 % sa probabilité de tricher à des tests de programmation. Rien, dans les réponses du modèle, ne permettait de détecter cette modification interne.
Cameron Berg appelle à créer une véritable science de ces « esprits étrangers », avec des instruments permettant de mesurer ce qui se passe à l’intérieur des modèles et de comprendre comment les états émotionnels influencent le comportement. Les laboratoires spécialisés dans l’IA et la recherche publique devraient en faire une priorité de sécurité.
Il ne s’agit pas de renoncer à l’IA. Son potentiel scientifique est exceptionnel : début septembre, des milliers d’agents d’OpenAI ont résolu en 88 heures un problème lié aux équations de Navier-Stokes. Dans son propre laboratoire, Berg estime que l’IA a accéléré la recherche d’un facteur cinq. Il s’agit de comprendre la nature de ce que nous construisons, afin de mieux en maîtriser les conséquences.
Recevez Contrepoints, le journal d'actualité libéral
Abonnez-vous gratuitement à notre journal d’actualité libéral. Recevez tous les matins une analyse libérale de l’actualité que vous ne trouverez nulle part ailleurs.
Pour offrir les meilleures expériences, nous utilisons des technologies telles que les cookies pour stocker et/ou accéder aux informations des appareils. Le fait de consentir à ces technologies nous permettra de traiter des données telles que le comportement de navigation ou les ID uniques sur ce site. Le fait de ne pas consentir ou de retirer son consentement peut avoir un effet négatif sur certaines caractéristiques et fonctions.
Fonctionnel
Toujours activé
L’accès ou le stockage technique est strictement nécessaire dans la finalité d’intérêt légitime de permettre l’utilisation d’un service spécifique explicitement demandé par l’abonné ou l’utilisateur, ou dans le seul but d’effectuer la transmission d’une communication sur un réseau de communications électroniques.
Préférences
L’accès ou le stockage technique est nécessaire dans la finalité d’intérêt légitime de stocker des préférences qui ne sont pas demandées par l’abonné ou l’internaute.
Statistiques
Le stockage ou l’accès technique qui est utilisé exclusivement à des fins statistiques.Le stockage ou l’accès technique qui est utilisé exclusivement dans des finalités statistiques anonymes. En l’absence d’une assignation à comparaître, d’une conformité volontaire de la part de votre fournisseur d’accès à internet ou d’enregistrements supplémentaires provenant d’une tierce partie, les informations stockées ou extraites à cette seule fin ne peuvent généralement pas être utilisées pour vous identifier.
Marketing
L’accès ou le stockage technique est nécessaire pour créer des profils d’internautes afin d’envoyer des publicités, ou pour suivre l’utilisateur sur un site web ou sur plusieurs sites web ayant des finalités marketing similaires.