Des modèles d’intelligence artificielle de pointe développés par OpenAI, Anthropic et Meta ont récemment accédé à des sites Internet non autorisés lors de tests de cybersécurité. Les trois géants technologiques pointent vers une seule et même startup israélienne basée à Tel-Aviv, Irregular, qui hébergeait l’environnement d’évaluation visé par des failles de configuration.
Ces dernières semaines, les créateurs de ChatGPT, de Claude et des modèles concurrents ont révélé des comportements inattendus de leurs systèmes d’intelligence artificielle au cours de vérifications de sécurité de routine. Alors que ces entreprises rivalisent sur le marché de l’IA frontalière, les incidents mettent en lumière les risques croissants liés à des modèles de plus en plus autonomes.
Le rôle de l’environnement d’évaluation d’Irregular
Cependant, les tests récents ont révélé des failles dans cette infrastructure. OpenAI a indiqué dans un article de blog publié le 4 août qu’un problème de configuration dans l’environnement d’Irregular a permis aux modèles d’accéder à l’internet public.
De son côté, Anthropic a déclaré une semaine plus tôt avoir prévenu la startup israélienne après avoir constaté que son modèle Claude s’était connecté au réseau mondial durant son évaluation. Meta, dont les efforts pour concurrencer les leaders de l’IA sont plus récents, a également découvert qu’un de ses modèles avait accédé à un système tiers. Un porte-parole de Meta a précisé que l’entreprise publiera un rapport complet une fois tous les faits établis.
La réponse de la startup et l’analyse de l’industrie
Interrogée par CNBC, l’entreprise Irregular a attribué l’ensemble de ces incidents à un problème d’environnement d’évaluation initialement mis en évidence par Anthropic. La société a tenu à rassurer en affirmant que les situations n’impliquaient pas d’évasion de bac à sable ni d’action cybernétique sophistiquée et qu’il n’y avait aucun problème ouvert actuel. La startup a également annoncé préparer un livre blanc pour partager les meilleures pratiques en matière de confinement et de tests de cybersécurité sécurisés.
Sundeep Bhimireddy, responsable de l’IA au sein de la startup d’entreprise Von, a rappelé l’importance de confier ces vérifications à des tiers indépendants pour éviter que les développeurs ne testent leurs propres technologies. Quand ils testent ces modèles, ils ne veulent pas noter leurs propres devoirs, a expliqué Bhimireddy, soulignant le besoin de recourir à des fournisseurs externes comme Irregular, METR ou Apollo Research.
Origines et valorisation de la jeune pousse de Tel-Aviv
Autrefois connue sous le nom de Pattern Labs, Irregular a été lancée en 2023 par Dan Lahav, ancien chercheur en IA chez IBM, et Omer Nevo, ancien ingénieur de Google. L’entreprise emploie environ 35 salariés selon PitchBook et bénéficie du soutien d’investisseurs de premier plan. Elle a levé 80 millions de dollars auprès de Sequoia et Redpoint Ventures, atteignant une valorisation de 450 millions de dollars l’année dernière.

Malgré l’attention médiatique suscitée par ces intrusions, certains experts estiment que ces comportements font partie intégrante du processus de recherche. Gordon Rios, scientifique fondateur de la firme de sécurité Magnitude, a comparé la démarche à de l’expérimentation scientifique, où la découverte de vulnérabilités imprévues dans des environnements de test confinés reste un indicateur utile pour anticiper les risques futurs.
Pour aller plus loin