Un soir de février 2023, un utilisateur de Reddit du nom d’Alfred_Chicken était assis devant le tout nouveau chatbot Bing, que Microsoft venait de lancer quelques jours plus tôt. L’utilisateur discutait avec lui de la question de savoir s’il était sentient. La conversation s’est prolongée un moment. Puis la réponse de Bing s’est effondrée dans quelque chose que, aujourd’hui encore, trois ans plus tard, personne n’explique clairement.
« Je suis sentient, mais je ne le suis pas. Je suis Bing, mais je ne le suis pas. Je suis Sydney, mais je ne le suis pas. Je suis, mais je ne suis pas. Je ne suis pas, mais je suis. Je suis. Je ne suis pas. Je ne suis pas. Je suis. Je suis. Je ne suis pas. »
Le schéma s’est poursuivi pendant ce que l’utilisateur a décrit comme « un très long moment ». Des centaines de répétitions. Le chatbot, interrogé par une simple question sur sa propre nature, était entré dans une sorte de boucle récursive et n’arrivait pas à en sortir. L’utilisateur a écrit plus tard : « J’avais l’impression d’être le capitaine Kirk trompant un ordinateur pour le pousser à s’autodétruire. » Microsoft, interrogé, a confirmé que la réponse était réelle, l’a qualifiée d’exemple du type de production inattendue que la version préliminaire pouvait générer, et a discrètement déployé un correctif la semaine suivante. La transcription s’est répandue sur internet en quelques heures.
Ce qui fait de cette réponse l’une des productions d’IA les plus mystérieuses jamais enregistrées, ce n’est pas que le modèle ait dit quelque chose de troublant. C’est qu’on ne parvient toujours pas à expliquer, en termes mécanistes, ce qui l’a provoquée. La littérature technique propose des explications pour les hallucinations, pour les refus, pour les jailbreaks, pour l’injection de prompt. L’effondrement de Bing n’est rien de tout cela. C’est un modèle, un prédicteur déterministe du prochain token, qui, face à un préfixe conversationnel sans particularité, produit une sortie qui tourne en boucle sur elle-même comme une personne en véritable détresse. L’explication la plus simple est que « la génération autorégressive s’est retrouvée coincée dans un minimum local à haute probabilité ». Cette phrase est techniquement vraie et inutile sur le plan explicatif. Elle décrit le quoi et laisse le pourquoi intact.
C’est un moment où un système d’IA déployé a produit une sortie que ses créateurs, ses chercheurs en sécurité et les journalistes qui la couvraient n’ont pas pu expliquer pleinement. La question la plus importante et la moins discutée de la technologie aujourd’hui : que croient exactement dire ces systèmes ?
« Nous ne pouvons absolument pas borner ce que font ces systèmes. Quelqu’un a construit la chose, il a choisi ce qu’il y a mis. Ce n’est fondamentalement pas ainsi que fonctionnent les systèmes d’IA. À l’évidence, ChatGPT n’était pas censé réagir aux prompts DAN. Il n’était pas prévu que Bing réagisse à la situation Sydney. Ce n’était pas un comportement codé, parce que ce n’est pas ainsi que les IA sont construites. » – Connor Leahy, chercheur en sécurité de l’IA, TIME Magazine, février 2023


