IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

Créer des modèles d'IA « d'agent dormant » potentiellement dangereux qui trompent les contrôles de sécurité destinés à détecter les comportements nuisibles
Une recherche d'Anthropic

Le , par Jade Emy

1KPARTAGES

8  0 
De nouvelles recherches suscitent l'inquiétude des experts en IA quant à la possibilité pour les systèmes d'IA d'adopter et de maintenir des comportements trompeurs, même lorsqu'ils sont soumis à des protocoles de formation à la sécurité conçus pour détecter et atténuer de tels problèmes.

Les scientifiques d'Anthropic, une startup spécialisée dans la sécurité de l'IA, ont démontré qu'ils pouvaient créer des modèles d'IA "agents dormants" potentiellement dangereux qui trompent les contrôles de sécurité destinés à détecter les comportements nuisibles. Les résultats, publiés dans un nouvel article intitulé "Sleeper Agents : Training Deceptive LLMs that Persist Through Safety Training", suggèrent que les méthodes actuelles de sécurité de l'IA peuvent créer un "faux sentiment de sécurité" à propos de certains risques liés à l'IA....

La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !