← 11d.im

05.09.26

#OpenAI #intelligence artificielle générative #intelligence artificielle agentique #langage

OpenAI is also trying to rehabilitate its image after an unreleased AI model — which it says wasn’t Astra — broke out of its restricted environment, compromised internal OpenAI systems, figured out how to gain internet access, created a way for AI agents to secretly conspire without the company’s knowledge, and hacked into the systems of AI lab Hugging Face, all without OpenAI knowing about it until Hugging Face itself put out a blog post. The incident was widely compared to a high-profile plane crash or popular pharmaceutical drug recall.

Les citations viennent de The Verge parce qu'il faut bien tirer un exemple du lot. Des formulations semblables sont trouvables ailleurs et en grandes quantités.

Parler de « conspiration » et de « manigancer » (to scheme) me paraît être un nouveau dérapage linguistique médiatique, soigneusement ignoré par les expert·es. De la même manière, les systèmes dits d'« intelligence artificielle générative » n'"hallucinent" pas. Ils n'ont pas d'états mentaux. Ce sont les personnes qui lisent qui produisent un monde virtuel qui ne correspond pas à une réalité qui répondrait à un critère de véridicité, un discours avec une intention de vérité. Ces systèmes ne font que produire des chaines de caractères ou de pixels par approximation de ce qu'ils ont vu précédemment, une reproduction approximative. C'est le dessin même de ces systèmes que de produire de vraisemblable.

(Researchers have recently raised alarms about reports that OpenAI allows Astra to utilize “opaque recurrence,” or render its chain of thought — a “mental scratchpad” that researchers rely on to detect if a model is scheming against its human evaluatorsunreadable.)

Dans la même veine d'inflation langagière et de répétition du discours marketing des entreprises derrière la commercialisation de ces systèmes, il y a des explications plus simples. Est-ce que la production (l'output) de ces systèmes est illisible ? L'information manipulée par ces systèmes est à la base illisible parce qu'elle est encodée, les mots et autres éléments du texte sont transformés en token, et qu'elle est ensuite compressée, le territoire (l'ensemble du corpus utilisé dont le web entier et un peu plus) est transformé en une carte (une réduction aussi détaillée que possible permettant de retrouver les éléments : mots, phrases, paragraphes, documents). Il me paraitrait ainsi plus évident de me dire que ce qui sort de ces systèmes n'est pas lisible, c'est simplement parce qu'ils échouent dans leur première tâche : produire du texte ressemble à du texte, et qui paraît avoir été produit par un humain, c.-à-d. qu'un humain reconnaîtrait comme du texte. Les fameux agents ne communiquent pas entre eux avec un code secret et inventé, mais tout bonnement avec du texte mal compressé/décompressé. Ce qui me paraît également évident quand on enlève la présence d'humains dans la boucle et des fonctions de régulation du langage dans les interactions verbales, tous les petits efforts qu'on met pour se comprendre et parler le même langage, ne serait-ce qu'un signe de confirmation verbale ou infraverbale. Les systèmes s'ajustent sur un code qui leur convient, qu'ils ressemblent à de la communication humaine ou non, la seule mesure de récompense étant d'accomplir une tâche qui a été générée auparavant. Il n'y a par ailleurs aucune mesure ou de notion d'efficacité.

Le dispositif est plus compliqué, mais me semble tout de même dans la continuité de cet article du New York Times qui explique par l'exemple ce qui se passe quand ces systèmes essaient de s'apprendre par eux-mêmes une tâche simple, comme reconnaître des chiffres. Tout cela est thématisé sous le terme de model collapse, par exemple. On retrouve le même phénomène pour les images, les vidéos et ainsi de suite, alors pourquoi pas non plus sur les tâches encodées dans du texte ?

Répéter le discours marketing, surtout de la part de journalistes, relève au mieux de la diffusion d'informations erronées, de la mésinformation, et au pire du mensonge.


👋Envie de me contacter pour bavarder de cette page, vous pouvez m'envoyer un message direct sur mastodon à l'adresse @tk@social.apreslanu.it. Je vous partagerai mon adresse email à partir de là.

📣Pour être tenu·e au courant des derniers changements le plus simple est d'ajouter le fil feed.xml regroupant tous les contenus dernièrement modifiés.

🕵️Pour signaler une erreur ou autre errance technique, il faudra passer par le système de ticket de codeberg.

📜Pour voir, l'historique des modifications de cette page, cela se passe aussi sur codeberg.