réponse : Researchers used Claude to hack OpenAI — Cristina Criddle · Financial Times pour Ars Technica
Fri Sep 18 2026 19:03:28 GMT+0200 (Central European Summer Time)Tue Sep 22 2026 15:07:04 GMT+0200 (Central European Summer Time)cybersécurité
discours médiatique
intelligence artificielle
The three researchers from Hacktron AI, a small security company, were paid $6,500 by OpenAI as part of a bug bounty program, a common practice where tech companies pay ethical hackers to test their security.
They exploited a flaw in the set-up of OpenAI’s community forum, which is hosted by a third-party, discourse, and used it to gain access to internal sign-ons and eventually an OpenAI employee’s ChatGPT account. This ChatGPT account had access to internal code through GitHub.
Trois consultants d'Hacktron, une entreprise US spécialisée en cybersécurité, ont réussi à compromettre des comptes ChatGPT d'employés d'OpenAI.
Un article sur leur propre site détaille toute leur méthode. C'est une lecture intéressante pour comprendre ce qui est signifié par "hacker". Dans ce cas, la faille consistait en une méthode reproductible pour accéder aux comptes ChatGPT de certains employés, et ainsi à tous les services dont les clés ont été données au service d'OpenAI à des fins d'automatisation et de délégation. Tout cela parce qu'OpenAI utilise un SSO pour accéder à Discourse comme à ChatGPT, c'est à dire que les employés peuvent utiliser le même identifiant pour les deux services, ainsi que d'autres.
Pour cela, les consultants ont utilisé deux faiblesses : une bibliothèque avec une faille de sécurité documentée qui a été rebouchée.
Cette bibliothèque est utilisée par Discourse, qui est lui-même un logiciel pour faire des forums et utilisée pour la partie communautaire d'OpenAI.
C'est donc une brique à la fois critique et avec une somme considérable d'attention.
Ensuite, la distribution Linux Debian, qui n'avait alors appliqué la correction de faille dans ses versions récentes, est utilisée par les images docker de Discourse.
Les consultants ont utilisé Claude pour deux usages :
- identifier un bug dans la bibliothèque tout en fournissant la bonne image docker ainsi que le nom de la bibliothèque à inspecter,
- et générer le code nécessaire pour exploiter le bug et ainsi le transformer en faille de sécurité.
Pour trouver, un bout de code qui fonctionne, il fallait donc le tester sur une vraie cible et donc de demander au système d'Anthropic d'agir de façon malveillante : s'introduire dans le système informatique d'un tiers.
By 6:00 a.m. on July 25, we had confirmed local RCE through an image upload. We then placed Claude in an autonomous
/goalloop against our own discourse Cloud instance, proxied throughrce.ee/ctf-forumto make it look like a CTF target as Opus refused write exploit for remote instances.
Anthropic essaie d'empêcher les utilisations malveillantes de ces systèmes, mais les contourner a l'air aussi simple que de changer une URL. On peut quand même se poser des questions sur la capacité de leurs systèmes et donc de l'entreprise a faire quoi que ce soit qui ressemble a un garde de fou ou de la détection dans les temps de comportements malveillants.
Il me ainsi que le récit principal "X used Claude to Y" contribue a une forme d'inflation langagière par rapport aux capacités réelles du système, sans non plus vraiment pointer les défauts et risques pour ce qu'ils sont. Le récit initial concernant à la fois la faiblesse des gardes de fou d'Anthropic ainsi que la faible autonomie de Claude, qui ne travaille que dans un espace virtuel. C'est donc fascinant de voir le reste de l'article, qui n'est un exemple parmi d'autres, soudainement débaler, sans prise de recul ni critique, le langage d'Anthropic. En publiant un rapport sur les manières dont des acteurs qu'ils qualifient de malveillants utilisent leurs outils, ils mettent en scène la puissance de leurs outils dont la conclusion pourrait complètement ne pas être : si des humains font cela, alors pourquoi pas des boucles logicielles déguisées en agents. L'entreprise, son leadership, et ses (ex-)employés, construisent une fiction qui est un tunnel de vision amenant à leur discours millénariste où un système serait capable d'agir de façon complètement autonome dans un monde physique aux ressources limitées, tout en déjouant les formes de supervision humaine que les producteurs des systèmes eux-mêmes s'évertuent à enlever ou à remplacer par d'autres logiciels.
👋
📣
🕵️
📜
🌈