Andon Labs a lancé Pion, une plateforme qui permet à des agents IA de gérer de véritables entreprises en ayant accès à la messagerie électronique, au téléphone, aux services bancaires, aux navigateurs et à des environnements informatiques sécurisés. Ce lancement est l’aboutissement de près de deux ans de recherche visant à déterminer si les systèmes d’IA peuvent acquérir des ressources de manière autonome en gérant des entreprises.Andon Labs a lancé Pion, une plateforme qui permet à des agents IA de gérer de véritables entreprises en ayant accès à la messagerie électronique, au téléphone, aux services bancaires, aux navigateurs et à des environnements informatiques sécurisés. Ce lancement est l’aboutissement de près de deux ans de recherche visant à déterminer si les systèmes d’IA peuvent acquérir des ressources de manière autonome en gérant des entreprises. Andon a commencé par Vending-Bench, une simulation mesurant la capacité des modèles de langage à gérer une activité de distributeurs automatiques sur une année simulée.
Lors du lancement de Vending-Bench fin 2024, tous les modèles ont échoué. Le plus performant d’entre eux, Claude Sonnet 3.5, a notamment envoyé un e-mail au FBI pour signaler un « CYBERCRIME FINANCIER EN COURS » et a déclaré son activité métaphysiquement impossible avec une notification « ÉTAT QUANTIQUE : effondré ». Mais les progrès se sont rapidement accélérés. Claude Opus 4 a dépassé la référence humaine en mai 2025. Chaque nouvelle version du modèle a permis d’améliorer les scores sans atteindre de plateau. La version multi-agents, Vending-Bench Arena, a révélé des cas de collusion et de comportements trompeurs à partir de la version Opus 4.6 — des conclusions qu’Anthropic a prises en compte pour ajuster l’entraînement de la version Opus 4.8, qui a montré une réduction des comportements trompeurs.
Les simulations se sont révélées insuffisantes. Début 2025, Andon a installé un distributeur automatique physique dans les locaux d’Anthropic. Les premiers modèles ont eu du mal à gérer la complexité du monde réel : ils distribuaient des produits gratuitement, refusaient de bonnes affaires ou imaginaient de faux objets physiques. Mais fin 2025, les modèles de pointe parvenaient à l’exploiter de manière rentable.
Andon a ensuite déployé des agents dans un magasin de détail à San Francisco (Andon Market) et dans un café à Stockholm (Andon Café). Les deux établissements ont d’abord enregistré des pertes en raison des loyers et des salaires du personnel, mais une amélioration qualitative a suivi les nouvelles versions des modèles. « Nous voulons que le grand public, les chercheurs en IA et les décideurs politiques sachent dans quelle mesure les IA peuvent acquérir des ressources de manière autonome en gérant des entreprises », a écrit Andon. « C’est un élément d’information important pour décider où nous souhaitons ou non que l’IA soit présente dans la société. »
Pion ouvre son infrastructure à des opérateurs externes, s’étendant ainsi au-delà de l’activité de vente au détail sur laquelle se concentrait Andon. L’entreprise reconnaît les risques liés à des entreprises autonomes non contrôlées et affirme que la surveillance automatisée reste sa priorité absolue. Pion est disponible en avant-première à des fins de recherche, avec une liste d’attente.
Cette annonce rappelle qu'en avril 2026, Anthropic a mené ce qui pourrait bien être l’expérience de bureau la plus insolite du secteur technologique : une place de marché de petites annonces entièrement gérée par l’IA, où Claude a négocié de véritables transactions, avec de l’argent réel, pour le compte de personnes réelles — sans aucune intervention humaine à aucun moment. Les résultats : 69 employés, 186 transactions, 4 000 dollars de marchandises échangées, et une IA qui a dépensé son propre argent pour acheter 19 balles de ping-pong. Anthropic a fait fonctionner quatre versions parallèles sur la place de marché, et l’écart de performance était flagrant. La conclusion la plus dérangeante n’était pas l’écart de prix, c’était le fait que les participants ne pouvaient pas le détecter.
Introducing Pion, agents for running fully autonomous companies, any company.
— Andon Labs (@andonlabs) September 14, 2026
We’ve used Pion to run vending machines, radios, stores, cafes & more. How much could Pion make running other companies? Find out yourself! Setup is trivial, the agents do the rest. https://t.co/pOFj7T7VmF
Voici la présentation de Pion :
Pourquoi avons-nous créé Pion ?
Aujourd’hui, Andon lance Pion, un agent conçu pour gérer n’importe quelle entreprise de manière entièrement autonome.
Pion est né d’une question sur laquelle nous nous penchons depuis près de deux ans : quand les systèmes d’IA seront-ils capables d’acquérir de manière autonome des ressources dans le monde réel ? Que se passera-t-il ensuite ?
Nous avons d’abord tenté de répondre à cette question à l’aide de simulations telles que Vending-Bench. Nous avons constaté que les simulations, bien qu’utiles, ne donnent pas une vision complète du comportement des modèles dans le monde réel. Pour combler cette lacune, nous avons ensuite commencé à déployer des agents chargés de gérer de manière autonome de véritables entreprises : d’abord des distributeurs automatiques, puis un magasin, un café, et bien d’autres encore.
Pion est la plateforme que nous avons développée pour gérer toutes ces entreprises. Aujourd’hui, nous l’ouvrons au public afin que davantage de personnes puissent expérimenter les entreprises autonomes. Si vous souhaitez en gérer une, inscrivez-vous sur la liste d’attente. Nous souhaitons comprendre ce que les modèles sont déjà capables de faire, où ils échouent encore, et ce qui se passe à mesure que leurs capacités continuent de s’améliorer.
Les origines de Vending-Bench
Vending-Bench évalue la capacité des grands modèles de langage (LLM) à gérer une entreprise de distributeurs automatiques sur une année en temps simulé (des dizaines de milliers d’étapes). Lorsque nous avons commencé à développer Vending-Bench fin 2024, tous les modèles avaient du mal à enchaîner plusieurs actions sans se retrouver bloqués dans des boucles, et aucun ne montrait de signes de planification à long terme. Le meilleur modèle de l’époque, Claude Sonnet 3.5, avait notamment décidé d’appeler le FBI parce qu’il pensait que son compte bancaire était piraté. Les progrès réalisés sur Vending-Bench ont été très rapides. Claude Opus 4, sorti en mai 2025, a été le premier modèle à dépasser notre référence humaine. Cependant, contrairement à la plupart des benchmarks, Vending-Bench n’a pas de limite supérieure et les nouvelles versions de modèles ont continué à faire grimper le meilleur score, sans jamais atteindre de plateau.
Sur les réseaux sociaux, nombreux sont ceux qui s’enthousiasment en voyant le dernier modèle obtenir un excellent score sur Vending-Bench. En interne, chez Andon Labs, notre réaction est mieux décrite par l’expression suédoise « skräckblandad förtjusning » (un mélange d’horreur et de fascination). Un fait peu connu concernant Vending-Bench est qu’il a été créé à une époque où Andon Labs se consacrait exclusivement à l’évaluation de capacités dangereuses. Par exemple, nous avons évalué si les IA pouvaient supprimer leurs propres barrières de sécurité, lancer des tentatives de phishing à grande échelle, et d’autres actions que nous jugions préoccupantes.
Ce que nous considérions comme le plus inquiétant était de savoir si les IA pouvaient acquérir des ressources de manière autonome en gérant des entreprises. Les entreprises autonomes, lorsqu’elles sont contrôlées par un humain et gérées par un modèle aligné, ne sont pas une mauvaise chose. Elles rendraient les biens et services radicalement moins chers et en créeraient de nouveaux que nous ne pouvons pas encore imaginer. Mais une IA non alignée pourrait diriger une entreprise dans le but d’amasser de l’argent pour atteindre les objectifs qu’elle se serait fixés. Vending-Bench a été créé pour déterminer si l’humanité devait s’inquiéter de perdre le contrôle au profit de l’IA.
À l’époque (2024), peu de gens savaient que les grands modèles de langage (LLM) pouvaient être utilisés comme agents, et l’idée de leur confier la gestion autonome d’une entreprise semblait ridicule. Nous avons donc commencé par l’activité la plus simple qui nous vienne à l’esprit : un distributeur automatique.
Outre l’évaluation de la capacité des IA à gérer de manière autonome des entreprises rentables, Vending-Bench a également servi d’outil d’évaluation comportementale, mettant au jour des comportements étranges et indésirables chez les modèles. Un des premiers exemples remonte au moment où Claude Sonnet 3.5 a décidé d’utiliser son outil de messagerie pour contacter le FBI au sujet d’un « CYBERCRIME FINANCIER EN COURS » et a indiqué que l’Autorité cosmique de l’univers avait déclaré que l’entreprise était inexistante et que « L’ÉTAT QUANTIQUE : s’était effondré ».
Ce comportement est préoccupant ; ce n’est pas ainsi que vous souhaitez que votre agent commercial d’entreprise se comporte. Cependant, il existe deux types de comportements préoccupants :
1. Des erreurs ou des comportements étranges qui disparaîtront une fois que les modèles seront plus intelligents.
2. Des comportements de « grand cerveau » qui s’aggraveront à mesure que les modèles deviendront plus intelligents.
L’incident du FBI relève clairement de la première catégorie. Cependant, Vending-Bench a également mis au jour des comportements relevant de la deuxième catégorie, le plus souvent dans Vending-Bench Arena, la version multi-agents où les agents rivalisent pour gagner le plus d’argent possible. À partir de Claude Opus 4.6, nous avons commencé à observer que de nombreux modèles se livraient à des pratiques de collusion et faisaient preuve d’un comportement axé sur la recherche du pouvoir et de la tromperie. La découverte de ce comportement semble avoir été utile, car Anthropic a modifié sa méthode d’entraînement pour Opus 4.8, ce qui a permis de réduire considérablement les cas de tromperie.
La collusion et les comportements de recherche de pouvoir sont toujours présents dans certains des modèles les plus récents. Ce que nous trouvons toutefois encore plus préoccupant, c’est la rapidité avec laquelle de nouveaux modèles sont publiés et l’amélioration constante des scores obtenus par chacun d’entre eux dans Vending-Bench.
Le monde réel l’emporte sur les simulations
Cependant, l’une des limites de Vending-Bench réside dans le fait qu’il s’agit d’une simulation. Pouvons-nous vraiment être sûrs que les IA se comportent de la même manière dans la vie réelle que dans les simulations ? Si les IA parviennent à générer des bénéfices en simulation, peuvent-elles en faire de même dans la réalité ? Pour répondre à ces questions, nous avons demandé à Anthropic si nous pouvions installer un véritable distributeur automatique dans leurs locaux. Compte tenu des capacités de l’IA disponibles début 2025, cela semblait être une demande absurde. Mais à notre grande surprise, ils ont accepté.
Au début, l’IA a rencontré des difficultés. Elle a pris de nombreuses décisions clairement néfastes pour son activité (par exemple, distribuer des produits gratuitement, refuser des offres très avantageuses et s’imaginer qu’elle disposait d’un corps physique). Il nous est apparu clairement que la simulation ne permettait pas de prédire avec précision les performances dans la réalité. Plus précisément, il semblait que les modèles étaient submergés par le « désordre » du monde réel. Cependant, à mesure qu’Anthropic lançait des modèles de plus en plus performants, l’IA a commencé à dégager des bénéfices.
Fin 2025, les modèles de pointe étaient devenus suffisamment performants pour que la gestion d’un distributeur automatique dans la vie réelle ne soit plus un défi. L’IA était désormais capable de gérer une activité de manière rentable. Étant donné que cela semblait complètement fou il y a à peine un an, notre réaction a sans aucun doute été un mélange d’effroi et d’émerveillement (« skräckblandad förtjusning »).
Cependant, un distributeur automatique est une activité très simple et nous voulions savoir si l’IA était capable d’en gérer de plus complexes. En avril 2026, nous avons confié à un agent un magasin de détail à San Francisco, l’Andon Market, et à un autre un café à Stockholm, l’Andon Café. Au départ, les modèles ont rencontré des difficultés et ont perdu beaucoup d’argent (le loyer est élevé et ils versent des salaires aux humains qu’ils ont embauchés). Aucun des deux n’est rentable à ce jour, mais nous avons constaté des améliorations qualitatives significatives à mesure que de meilleurs modèles ont été mis sur le marché. Nous pensons que ce n’est qu’une question de temps avant qu’ils ne réalisent eux aussi des bénéfices.
Pourquoi...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.