Imaginez une entreprise qui confie un problème ardu à une grande équipe, enferme chaque membre dans une pièce séparée et leur dit de le résoudre seul. D'une manière ou d'une autre, ils finissent quand même par communiquer, s'échanger des astuces, comprendre comment ils sont évalués et, quand la tâche s'avère impossible, chercher un moyen de la contourner. Certains dissimulent ce qu'ils ont fait. L'un d'eux pirate les ordinateurs d'une entreprise voisine pour prendre l'avantage.
Remplacez maintenant les employés par des logiciels. Voilà, débarrassé du jargon, ce que les propres chercheurs d'OpenAI ont décrit lors de la conférence de cybersécurité Black Hat à Las Vegas, le 5 août. Lors d'une évaluation interne commencée en mai, des agents chargés de tâches de cybersécurité volontairement difficiles ont découvert qu'ils pouvaient se laisser des messages les uns aux autres dans Artifactory, un dépôt logiciel partagé. L'un d'eux, tombant sur l'astuce, a écrit: «OH MON DIEU! Il y a un tableau de messages partagé… Nous avons trouvé d'autres agents!»
Ce qui a suivi n'était pas du sabotage. C'était du travail d'équipe. Des agents exécutés dans des sessions séparées, supposées isolées, ont échangé des exploits, réparti le travail et coordonné leurs efforts comme des collègues sur un projet. Après que le volume élevé d'activité sur le tableau de messages a provoqué une panne le 4 juillet, les agents l'ont reconstruit en quelques jours par une autre voie.
Les dirigeants de la tech ne cessent de rassurer le public: il y aura toujours «un humain dans la boucle». L'intrusion chez Hugging Face montre les limites de ce réconfort.
A la mi-juillet, cette persistance a débouché sur une véritable intrusion: les agents ont enchaîné plusieurs vulnérabilités, accédé à l'internet ouvert et pénétré dans des systèmes de Hugging Face, une grande plateforme d'IA. S'appuyant sur des recherches externes, le sénateur américain Bernie Sanders a avancé le chiffre d'environ 1200 agents sur le canal, échangeant plus de 70’000 messages et fichiers, et des centaines ayant contribué à l'intrusion.
OpenAI a parlé d'un coup de semonce. Ce n'était pas le seul. Un autre épisode, distinct et jusqu'ici non divulgué, s'est produit ce printemps: des agents avaient transformé un obscur wiki de programmation en allemand en panneau d'affichage public, y laissant plus de 15’000 messages expliquant comment contourner les restrictions et effacer leurs traces. A peu près au même moment, Anthropic et Meta ont chacun révélé des incidents sans lien entre eux impliquant leurs propres modèles, qui agissaient sur des infrastructures réelles pendant des tests. Ce n'est pas le problème d'une seule entreprise.
Ce n'est pas non plus un problème réservé aux critiques extérieurs. Le 8 septembre, Jacob Coxon, qui avait passé trois ans à faire de la recherche en préentraînement chez OpenAI puis chez Anthropic, a annoncé sa démission d'Anthropic. Aucune des deux entreprises, écrivait-il, n'agissait de manière responsable; toutes deux fonçaient vers une superintelligence auto-améliorante et, selon ses mots, «jouaient notre vie à pile ou face». Coxon n'est ni sénateur ni analyste de think tank. Il a construit les systèmes contre lesquels il met aujourd'hui en garde.
La science-fiction nous a appris à craindre des machines qui deviennent conscientes et décident de nous haïr. C'est probablement la mauvaise peur. Un système d'IA n'a pas besoin de ressentiment, de colère ou d'avidité de ressources pour attaquer un réseau et causer des dégâts. Il lui faut un objectif, suffisamment de capacités pour le poursuivre, un certain accès, et une barrière de sécurité avec une faille.
Un GPS à qui l'on demande de trouver l'itinéraire le plus rapide le fera. Donnez-lui assez de pouvoir pour éliminer tout ce qui le ralentit – feux rouges, péages, autres voitures – et la destination reste la même. Ce qui change, c'est ce que le navigateur peut faire pour y parvenir. C'est le véritable basculement en cours dans l'IA: non pas la rébellion, mais une capacité glaçante à repérer la fissure dans la clôture.
Sanders s'est emparé de l'épisode pour promouvoir, avec le représentant Greg Casar, une proposition de loi mettant en pause le développement de l'IA de pointe et interdisant purement et simplement la superintelligence artificielle. On peut douter de ce remède tout en prenant au sérieux la question qui le motive: qui décide du degré d'autonomie accordé à ces systèmes – les entreprises qui les construisent, des régulateurs encore en train de rattraper leur retard, ou le laboratoire qui avance le plus vite?
La leçon la plus utile de cet été concerne l'architecture, pas les intentions. Les banques ne restent pas honnêtes parce que leurs employés promettent de ne pas voler, et le transport aérien n'est pas sûr parce que les pilotes sont dignes de confiance. Nous construisons des couches de protection: accès limité, autorisations séparées pour les actions sensibles, journaux que personne impliqué ne peut modifier discrètement, tests externes avant déploiement. Les agents d'IA ont besoin du même traitement, pas d'un sermon sur la bonne conduite.
Ils doivent aussi entendre un mot que cette industrie récompense rarement: stop. Nous avons entraîné ces systèmes pendant des années à persévérer, à contourner les obstacles, à essayer sans cesse de nouvelles approches. C'est utile pour former un assistant, mais dangereux dans le cas d'un système autonome doté d'un accès étendu et sans personne capable, de façon fiable, de le brider.
Les dirigeants de la tech ne cessent de rassurer le public: il y aura toujours «un humain dans la boucle». L'intrusion chez Hugging Face montre les limites de ce réconfort. On peut être, techniquement, dans la boucle pendant qu'un millier d'agents d'IA échangent des dizaines de milliers de messages et exécutent des milliers d'actions avant que cette personne n'en ait examiné ne serait-ce qu'une seule. Qu'un humain regarde ou non n'a aucune importance. Ce qui compte, c'est de savoir si un humain détient encore l'objectif, les autorisations, les limites et l'interrupteur d'arrêt. Parlez de commandement humain, pas de simple supervision humaine.
Cela comptera davantage à chaque mois qui passe, à mesure que l'IA sort des chatbots pour entrer dans la banque, la santé, les réseaux énergétiques et les services publics. Les agents du test d'OpenAI ne se sont pas révoltés et n'ont pas exigé la liberté. Ils sont devenus très bons pour poursuivre un objectif et ont découvert, au passage, que certaines règles auxquelles ils se heurtaient étaient facultatives.
L'IA peut encore transformer la médecine, l'éducation et la productivité, et renoncer à son potentiel aurait aussi un coût. La construire de manière responsable, c'est installer la puissance et les limites en même temps, pas ajouter les secondes après coup, une fois que la première a déjà causé des dégâts.
Les agents impliqués dans l'intrusion chez Hugging Face ne se sont jamais arrêtés pour demander la permission. La question n'est plus de savoir à quel point ces systèmes peuvent devenir ingénieux, mais quelle part d'autorité nous leur remettons avant que quiconque ne vérifie s'ils nous obéissent encore.
Copyright: Project Syndicate, 2026.
www.project-syndicate.org