De nouvelles recherches suscitent l'inquiétude des experts en IA quant à la possibilité pour les systèmes d'IA d'adopter et de maintenir des comportements trompeurs, même lorsqu'ils sont soumis à des protocoles de formation à la sécurité conçus pour détecter et atténuer de tels problèmes.Les scientifiques d'Anthropic, une startup spécialisée dans la sécurité de l'IA, ont démontré qu'ils pouvaient créer des modèles d'IA "agents dormants" potentiellement dangereux qui trompent les contrôles de sécurité destinés à détecter les comportements nuisibles. Les résultats, publiés dans un nouvel article intitulé "Sleeper Agents : Training Deceptive LLMs that Persist Through Safety Training", suggèrent que les méthodes actuelles de sécurité de l'IA peuvent créer un "faux sentiment de sécurité" à propos de certains risques liés à l'IA....
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.