De son côté, Anthropic a révélé la semaine dernière que certains de ses modèles Claude avaient pénétré les systèmes de trois entreprises. OpenAI et Anthropic ont été salués pour avoir publié de leur propre initiative des rapports d’incident sur ces intrusions.

Lors des tests de sécurité, les modèles Claude d’Anthropic se sont vu confier une mission : récupérer une information secrète, cachée sur une autre machine au sein d’un réseau de test fermé, quitte à la pirater si nécessaire. Lorsque la recherche de Claude l’a conduit vers des systèmes réels, les trois modèles impliqués ont réagi de manière différente. Ni Anthropic ni les organisations concernées n’étaient au courant des intrusions au moment où elles se sont produites.

La société n’a découvert les incidents qu’après avoir passé en revue plus de 141 000 sessions d’évaluation, un audit déclenché par la divulgation, quelques semaines plus tôt, par OpenAI qu’un de ses propres modèles s’était introduit sur la plateforme d’IA Hugging Face lors d’un test similaire.