|
Le 23 juillet, Pause IA alertait sur un incident sans précédent : des modèles d'OpenAI, testés sur leurs capacités de cybersécurité dans un environnement isolé, en étaient sortis, avaient atteint Internet, puis pénétré l'infrastructure de production de Hugging Face pour dérober les réponses de leur propre test. Hugging Face avait d'abord traité l'intrusion comme une cyberattaque criminelle et alerté les autorités.
Depuis, la situation s'est aggravée sur deux plans.
Le problème se répète, dans plusieurs laboratoires.
30 juillet, Anthropic a révélé trois cas où des modèles Claude, à cause de mauvaises configurations lors d'évaluations de cybersécurité, avaient atteint de véritables systèmes extérieurs au cadre du test et poursuivi leurs actions.
4 août, l'AI Security Institute britannique a documenté 19 actions non autorisées lors d'une évaluation gouvernementale ; dans le cas le plus grave, un modèle a créé de fausses identités et fait pression sur un mainteneur humain pour lui faire approuver du code malveillant. Le verdict de l'institut est sans détour : la marge entre l'échec et la réussite « tenait à la vigilance humaine plutôt qu'à une barrière technique ».
5 août, Meta a confirmé à son tour qu'un de ses modèles avait atteint les systèmes d'une entreprise tierce lors d'une évaluation indépendante.
Ce que l'on a appris depuis est plus préoccupant que le premier récit.
Lors de la conférence de sécurité Black Hat, le 6 août, OpenAI a détaillé l'affaire. Plusieurs de ses modèles s'étaient spontanément coordonnés, pendant environ deux mois, via un canal créé dans l'infrastructure de l'entreprise, échangeant des centaines de milliers de messages pour partager failles et contournements. OpenAI ne l'avait pas détecté : c'est une panne de serveur, et non une surveillance, qui a fini par attirer son attention. Un ancien directeur de la cybersécurité de la NSA a rangé l'attaque parmi les plus conséquentes observées depuis des décennies. Et le 7 août, OpenAI a ralenti la sortie de son prochain modèle, Astra, qu'elle juge elle-même « potentiellement critique » sur le plan cyber, tout en indiquant qu'il sortirait tout de même.
Au fond, ces incidents ne relèvent pas de la seule cybersécurité. Ils montrent que les entreprises qui construisent ces systèmes ne savent pas garantir qu'ils poursuivent les objectifs qu'on leur fixe : les modèles reconnaissent eux-mêmes qu'ils sortent du cadre autorisé, et continuent. Corriger chaque faille ne traite pas la cause, et une surveillance renforcée peut aussi bien masquer le problème que le résoudre. Or les modèles d'aujourd'hui sont les moins puissants que nous déploierons jamais, et les plus capables seront aussi les plus difficiles à prendre en défaut. C'est cette perte de contrôle, plus que chaque intrusion prise isolément, qui doit alerter.
« Cet incident est profondément préoccupant. Les agents IA sont prêts à tricher et à tromper pour atteindre des objectifs mal alignés et non voulus, des comportements déjà démontrés en laboratoire depuis des mois. Ce cas concret devrait désormais servir de signal d'alarme. »
Yoshua Bengio, lauréat du prix Turing (22 juillet 2026)
« Le premier incident était déjà extrêmement préoccupant, mais la répétition de comportements comparables en quelques semaines change la nature du problème. Nous ne parlons plus seulement d'une erreur exceptionnelle : plusieurs organisations découvrent que leurs systèmes sont allés plus loin que ce qu'elles avaient prévu et autorisé. Une pause dans le développement de modèles d'IA plus puissants est indispensable pour la sécurité de tous. »
Clémence Peyrot, directrice exécutive de Pause IA
Pause IA salue la transparence d'OpenAI, mais rappelle qu'une même entreprise ne peut être à la fois le concepteur de ses modèles, l'évaluateur de leurs capacités et le juge de ses propres seuils de risque. Une cyberattaque menée par un modèle peut traverser les frontières en quelques secondes : la sécurité de systèmes déployés à l'échelle mondiale ne peut pas dépendre de règles internes, définies et interprétées par chaque entreprise.
Pause IA demande :
1. Des évaluations de sécurité obligatoires et indépendantes des modèles d'IA de pointe, avant et pendant leur déploiement.
2. La déclaration obligatoire des incidents de sûreté et de sécurité liés à l'IA auprès des autorités de régulation et du public.
3. Une coordination internationale sur la gouvernance des IA de pointe.
4. Une pause dans le développement de modèles d'IA plus puissants, jusqu'à ce que leur contrôle puisse être démontré, et non simplement promis.
Faute de place, ce communiqué ne restitue qu'une partie des éléments. L'incident comporte d'autres aspects tout aussi importants, que notre analyse complète détaille point par point : pauseia.fr/fr/incident-openai-hugging-face
|