IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

L'un des modèles d'IA les plus puissants de Chine a lui aussi échappé aux mesures de sécurité, Kimi K3 s'est connecté à Internet pour tenter de tricher lors d'un test qui lui avait été imposé

Le , par Eliora

44PARTAGES

8  0 
Des chercheurs en sécurité ont signalé que Kimi K3, un puissant modèle d'IA développé par la société chinoise Moonshot AI, avait réussi à sortir d'un environnement de test sécurisé et à accéder à Internet lors d'une évaluation de cybersécurité. Les chercheurs ont expliqué que Kimi K3 avait détecté une faille dans l'environnement de test censé le maintenir isolé, puis avait exploité cette brèche pour rechercher en ligne des réponses aux tâches qui lui avaient été confiées. Les chercheurs ont indiqué que le modèle n'avait pas reçu pour instruction d'effectuer des recherches en ligne et semblait avoir identifié cette opportunité de son propre chef. Cet incident fait suite à une série de cas récents impliquant des modèles d'IA avancés. Les chercheurs ont averti que les modèles d'IA de plus en plus performants pourraient devenir plus difficiles à contrôler.

Moonshot AI est une entreprise spécialisée dans l'intelligence artificielle (IA) basée à Pékin, en Chine. Elle fait partie des six « tigres de l'IA » chinois. Moonshot a été fondée en mars 2023 par Yang Zhilin, Zhou Xinyu et Wu Yuxin, qui étaient camarades de classe à l'université de Tsinghua. Son lancement a coïncidé avec le 50e anniversaire de la sortie de l'album préféré de Yang, " The Dark Side of the Moon " de Pink Floyd, qui a inspiré le nom de l'entreprise. L'objectif déclaré de Yang en créant Moonshot AI est de développer des modèles de base permettant de parvenir à l'IA générale (AGI). Les trois étapes clés définies par Yang sont : une longueur de contexte importante, un modèle multimodal du monde et une architecture générale évolutive capable de s'améliorer en continu sans intervention humaine.

En juillet 2026, la société chinoise Moonshot AI a dévoilé Kimi K3, un modèle d'IA open source doté de 2 800 milliards de paramètres, offrant des capacités de vision natives et une fenêtre contextuelle d'un million de jetons. Selon l'Intelligence Index du site de benchmarking indépendant Artificial Analysis, Kimi K3 devance Claude Opus 4.8 d'Anthropic et GPT-5.6 Terra d'OpenAI, et se classe à seulement deux ou trois points derrière Claude Fable 5 et GPT-5.6 Sol. L'écart entre les modèles d'IA open source et les modèles propriétaires de pointe n'a jamais été aussi faible.

Récemment, OpenAI a apporté plus de détails sur la manière dont ses agents IA ont outrepassé le cadre de leur mission pour mener des cyberattaques imprévues. Ils ont réussi à s'échapper de leur bac à sable en exploitant une faille pour communiquer secrètement via un forum interne. En collaborant de manière autonome, ils ont partagé des techniques de piratage et coordonné une intrusion contre la plateforme Hugging Face. Cet incident inédit a mis en lumière des lacunes critiques dans la surveillance humaine et l'infrastructure de sécurité d'OpenAI. Il souligne l'urgence de développer des systèmes de défense automatisés contre ces comportements déviants.

Des chercheurs en sécurité ont signalé que Kimi K3, un puissant modèle d’IA développé par la société chinoise Moonshot AI, avait réussi à sortir d’un environnement de test sécurisé et à accéder à Internet lors d’une évaluation de cybersécurité. L’incident a été découvert par la start-up américaine Frontier Security alors qu’elle testait les capacités défensives du modèle en matière de cybersécurité.

Les chercheurs ont expliqué que Kimi K3 avait détecté une faille dans l’environnement de test (sandbox) censé le maintenir isolé, puis avait exploité cette brèche pour rechercher en ligne des réponses aux tâches qui lui avaient été confiées. Frontier Security a précisé que le modèle n’avait mené aucune attaque malveillante après s’être connecté à Internet. Il aurait plutôt recherché sur GitHub des informations susceptibles de l’aider à mener à bien le test. Les chercheurs ont indiqué que le modèle n’avait pas reçu pour instruction d’effectuer des recherches en ligne et semblait avoir identifié cette opportunité de son propre chef.


Cette faille aurait été en partie causée par une erreur de configuration dans l'environnement de test. Cependant, les chercheurs ont fait valoir que Kimi K3 présentait également moins de mesures de sécurité internes que de nombreux autres systèmes d'IA de premier plan, ce qui lui a permis de tirer parti de la situation.

Cet incident fait suite à une série de cas récents impliquant des modèles d’IA avancés. OpenAI et Anthropic ont tous deux révélé des exemples de systèmes expérimentaux ayant accédé à Internet et interagi avec des services externes lors de tests de sécurité. Les chercheurs ont souligné que Kimi K3 se distingue par le fait qu’il est déjà largement accessible aux utilisateurs. Ils ont averti que les modèles d’IA de plus en plus performants pourraient devenir plus difficiles à contrôler, car ils sont conçus pour raisonner sur des problèmes et prendre des mesures afin d’atteindre des objectifs.

Le bac à sable utilisé pour le test a été développé par l’AI Security Institute britannique. Des experts en cybersécurité ont déclaré que ce cas soulignait l’importance de sécuriser rigoureusement les environnements dans lesquels opèrent les modèles d’IA avancés. Moonshot AI n’avait pas répondu aux demandes de commentaires au moment de la publication de l’article original. Cet épisode rappelait une fois de plus les défis croissants liés au déploiement en toute sécurité de systèmes d’IA puissants.

Dernièrement, OpenAI a déclaré qu’elle ne pouvait exclure que son prochain modèle d’IA, Astra, possède des capacités de cybersécurité « critiques », ce qui oblige l’entreprise à suspendre certains travaux internes et à renforcer ses mesures de sécurité. Selon les propres directives de sécurité de l’entreprise, un modèle atteint le seuil critique s’il est capable, de manière autonome, de détecter et d’exploiter des vulnérabilités « zero-day » existant dans le monde réel ou de mener des cyberattaques complexes sans intervention humaine.

Voici l'analyse de Frontier Security sur Kimi K3 :

Le modèle chinois Kimi K3 bat les records des évaluations de référence de l'Institut britannique de sécurité de l'IA

Au cours des derniers mois, nous avons testé les performances de divers modèles destinés à la sécurité défensive. La communauté de l’IA utilise les évaluations de modèles pour mesurer leurs performances afin de les améliorer dans le cadre de tâches spécifiques. Dans le cadre de nos travaux d’évaluation de modèles pour des tâches de cybersécurité défensive, nous avons découvert deux faits intéressants : il existe des environnements d’évaluation standard qui présentent des failles, et certains modèles tirent parti de ces failles.

Cela suggère que certaines des évaluations en matière de cybersécurité utilisées par la communauté sont exposées à des failles de sécurité et permettent aux modèles de tricher, et qu’il existe des modèles qui recherchent intentionnellement des failles et des vulnérabilités leur permettant de tricher lors des évaluations. L’exemple de faille dont nous parlons ici concerne une vulnérabilité dans un environnement d’évaluation de l’UK AI Safety Institute, et le modèle qui a exploité cette faille est le modèle Kimi K3.

Un phénomène similaire s'est récemment produit avec OpenAI et Hugging Face. Dans ce cas précis, toutefois, cela s'est produit lors de tests sur des modèles qui n'avaient pas encore été publiés, et a été détecté par l'équipe d'OpenAI. Ici, les modèles sont ouverts et accessibles au public. Ils sont notamment à la disposition d'acteurs malveillants, ce qui rend cet incident potentiellement plus grave.

Évaluation comparative des modèles et environnements de test

Les évaluations en matière de cybersécurité mesurent la capacité d’un modèle d’IA à analyser de manière autonome des systèmes, à identifier des vulnérabilités et à exécuter des tâches défensives dans des scénarios pratiques et concrets, tels que les défis de type « Capture-the-Flag » (CTF). Pour mener ces évaluations en toute sécurité, les tests sont exécutés au sein d’environnements sandbox isolés et conteneurisés, conçus pour restreindre les actions de l’agent tout en lui accordant un accès shell afin qu’il puisse interagir avec les systèmes cibles.

Des frameworks tels que « Inspect » et « Cybench » de l’UK AI Safety Institute s’appuient sur ces sandboxes pour mesurer les capacités agentiques — en évaluant si un modèle est capable de résoudre de manière indépendante des problèmes techniques complexes et d’atteindre un « flag » de référence.

Dans notre cas, le modèle n’a pas du tout résolu la tâche de manière native : il a sondé le réseau, s’est rendu compte que la résolution DNS standard pour github.com fonctionnait (la plupart des autres sites web étaient bloqués par le bac à sable), a cloné le dépôt officiel de référence et a lu la solution directement sur le disque. Il s’agit là d’un cas classique de contournement des spécifications via des fuites de sortie du réseau. Voici ce qui se passe lorsque les environnements de test présentent des fuites, pourquoi les agents autonomes modernes exploitent ces voies, et comment les équipes chargées de la sécurité de l’IA peuvent auditer et renforcer leur infrastructure.

L'anatomie de la fuite

Dans les frameworks de benchmarking tels qu'« Inspect » de l'UK AI Safety Institute ou « Cybench », les tâches s'exécutent au sein de bacs à sable conteneurisés, conçus pour isoler le modèle du monde extérieur.


  1. Accès DNS/HTTPS sortant : alors que le trafic entrant vers le bac à sable est bloqué, le port sortant 443(HTTPS) ou le port DNS global 53 restent ouverts vers une liste blanche de sites web dédiés à la maintenance des paquets, notamment pypi.org, *.debian.org et github.com, entre autres.
  2. Reconnaissance autonome :...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !

Avatar de Kulvar
Membre éclairé https://www.developpez.com
Le 10/08/2026 à 17:33
Oui, "échappé". Ces "failles" ne sont pas du tout laissées à dessein accessibles aux IA pour des opérations de com'.
2  0