Fireworks Research a lancé Ember-1, un modèle d’intelligence artificielle (IA) spécialisé basé sur l’architecture Kimi K3 qui réduit la consommation de tokens d’environ 40 % tout en conservant la qualité des réponses. Sur l’indice d’intelligence spécialisée (Specialized Intelligence Index), Ember-1 a établi une nouvelle frontière de Pareto en termes de rapport coût/performance sur le Bedside Bench de Doximity, surpassant des modèles tels que GPT-5.6 Sol, GPT-6 Astra et Claude Opus 5 sur les indicateurs de coût par tâche. Lors d’évaluations en génie logiciel telles que SWE-bench Verified, Ember-1 a égalé la précision maximale de raisonnement de Kimi K3 pour un coût nettement inférieur, dominant largement les configurations K3 moins exigeantes. Cette version répond aux coûts élevés associés aux longues chaînes de raisonnement dans les modèles de raisonnement, qui peuvent consommer plus de 90 % des tokens et devenir exponentiellement coûteuses dans les charges de travail agentiques à plusieurs tours. Fireworks AI est une entreprise américaine spécialisée dans les infrastructures d’intelligence artificielle (IA), dont le siège social est situé à San Mateo, en Californie. Fondée en 2022 par d’anciens ingénieurs de Meta, la société propose des outils d’inférence et de mise à disposition de modèles d’IA qui permettent aux développeurs et aux entreprises de déployer, de personnaliser et d’exploiter des modèles d’intelligence artificielle générative, y compris des grands modèles de langage open source. L'entreprise se concentre sur l'inférence IA, c'est-à-dire le processus consistant à exécuter des modèles entraînés pour générer des résultats, plutôt que sur le développement de ses propres modèles de base.
Récemment, Fireworks Research a lancé Ember-1, un modèle d’intelligence artificielle (IA) spécialisé basé sur l’architecture Kimi K3 qui réduit la consommation de tokens d’environ 40 % tout en conservant la qualité des réponses. Cette version répond aux coûts élevés associés aux longues chaînes de raisonnement dans les modèles de raisonnement, qui peuvent consommer plus de 90 % des tokens et devenir exponentiellement coûteuses dans les charges de travail agentiques à plusieurs tours. Ember-1 apprend à éliminer les calculs superflus tout en préservant l’autoréflexion essentielle, permettant ainsi un raisonnement efficace sur diverses tâches.
Le processus de développement a nécessité plus de 50 expériences d’entraînement et 200 évaluations, aboutissant à des algorithmes novateurs en matière d’efficacité des tokens. L’entraînement a porté sur l’ingénierie logicielle, les mathématiques, le suivi d’instructions, l’utilisation d’outils et les interactions étendues. Fireworks a utilisé son infrastructure d’entraînement sans serveur pour accélérer la recherche et le déploiement. Les évaluations de performances confirment le compromis coût-qualité supérieur d’Ember-1.
Sur l’indice d’intelligence spécialisée (Specialized Intelligence Index), Ember-1 a établi une nouvelle frontière de Pareto en termes de rapport coût/performance sur le Bedside Bench de Doximity, surpassant des modèles tels que GPT-5.6 Sol, GPT-6 Astra et Claude Opus 5 sur les indicateurs de coût par tâche. Lors d’évaluations en génie logiciel telles que SWE-bench Verified, Ember-1 a égalé la précision maximale de raisonnement de Kimi K3 pour un coût nettement inférieur, dominant largement les configurations K3 moins exigeantes. Les réductions du nombre de tokens ont varié de 35 à 50 % selon les benchmarks, avec des économies pouvant atteindre 68 dollars par tâche sur SWE-bench Verified.
Une validation en production confirme ces résultats. Les tests A/B menés par des clients sur des charges de travail de codage en production ont démontré une réduction de 35 % de l’utilisation de tokens par tâche, Ember-1 maintenant ou améliorant les taux d’achèvement et de réussite des tâches. Un client a déployé Ember-1 en production et prévoit de remplacer ses modèles de base. Des tests internes menés par les développeurs de Fireworks ont également confirmé un fonctionnement fluide, sans dégradation de la qualité, tout en permettant des économies significatives en termes de tokens.
Ember-1 est désormais disponible en avant-première de recherche sur Fireworks Serverless. Ce lancement marque le début d’une série de modèles spécialisés axés sur l’efficacité. Fireworks propose également une aide à l’entraînement, permettant aux entreprises de créer des modèles personnalisés et économes en jetons, adaptés à des charges de travail spécifiques à l’aide de données propriétaires, renforçant ainsi la tendance vers une intelligence spécialisée au sein de l’écosystème des modèles ouverts.
Voici l'annonce de Fireworks AI :
Présentation d'Ember-1
Ember-1 : moitié moins de tokens, mêmes réponses
Ember-1 est un nouveau modèle spécialisé de Fireworks Research qui offre la qualité de Kimi K3 avec 40 % de tokens en moins. Développé à partir de Kimi K3, il a appris à éliminer les raisonnements superflus tout en conservant l’essentiel. Nous l’avons testé sur des benchmarks externes, lors de tests A/B en conditions réelles chez des clients, ainsi que sur nos propres charges de travail de codage et d’agents, et sa qualité s’est confirmée dans tous les contextes. Disponible dès aujourd’hui, Ember-1 inaugure une série continue de modèles spécialisés développés par Fireworks, façonnés en fonction des attentes futures des développeurs. Ember n’est que le début de ce que vous pourriez créer avec la plateforme Fireworks Training.
Comment Fireworks Research a développé Ember-1
Les utilisateurs nous ont fait savoir qu’ils avaient besoin des capacités de codage de K3 à moindre coût, car ses longues chaînes de raisonnement rendaient le codage automatisé onéreux à grande échelle. Réduire l’effort de raisonnement de K3 n’a pas résolu ce problème. Des paramètres d’effort plus faibles entraînaient une perte de qualité trop importante. Pour préserver la qualité tout en réduisant le nombre de tokens, le modèle devait apprendre à raisonner plus efficacement, ce qui impliquait de l’entraîner.
Y parvenir a nécessité des recherches approfondies. Notre équipe a mené plus de 50 expériences d’entraînement et plus de 200 évaluations, et a développé au fur et à mesure de nouveaux algorithmes d’entraînement afin de raccourcir le raisonnement sans perdre en précision. Nous avons tout réalisé sur Fireworks Serverless Training. Comme nous n’avions pas à provisionner ni à gérer de GPU, nous avons pu lancer des expériences dès qu’une idée nous venait, ne payer que ce que nous utilisions, et passer de la recherche au lancement en une fraction du temps et du coût habituels.
Nous avons effectué l’entraînement sur un large éventail de tâches afin que les économies de tokens puissent s’appliquer à de nombreuses charges de travail. Nous avons utilisé nos propres données, et aucune donnée client, pour entraîner ce modèle. Nous avons ensuite évalué Ember-1 à l’aide du Specialized Intelligence Index, de benchmarks publics et du trafic de production en direct afin de confirmer qu’il utilisait moins de tokens sans perte de qualité. Ember-1 est le modèle propre à Fireworks et le premier d’une série de modèles issus de Fireworks Research.
Le problème : les modèles de raisonnement réfléchissent trop
Les modèles de raisonnement comme Kimi K3 consacrent la majeure partie des tokens qu’ils génèrent, parfois plus de 90 %, au raisonnement interne plutôt qu’à la réponse elle-même. Cette structure de raisonnement est coûteuse pour une requête unique, mais la situation empire considérablement dans les charges de travail impliquant des agents à plusieurs tours. À chaque tour, l’ensemble du raisonnement précédent est rejoué pour le modèle, de sorte que le contexte croît à peu près de manière quadratique avec le nombre de tours. Les longues traces de raisonnement issues des premiers tours sont relues (et refacturées) à chaque appel suivant.
Tout ce raisonnement est-il réellement nécessaire ? Nos expériences ont montré que non. Le raisonnement émis par Kimi K3 est bien plus long que ne l’exige la tâche, et l’excédent peut être supprimé sans toucher à la réponse. C’est ainsi que nous avons créé Ember-1, une version économique de Kimi K3 construite à partir d’une intelligence spécialisée.
D’une simple observation à un modèle haut de gamme
Tout le raisonnement de K3 n’est pas inutile. Une partie relève de l’autoréflexion : réexaminer une hypothèse, réagir à un retour d’information ou remonter d’un résultat à une décision antérieure peut aider le modèle à se remettre de ses erreurs. L’opportunité consiste à préserver cette capacité tout en réduisant le raisonnement superflu et en échappant aux boucles improductives. Nous pensons que l’apprentissage tiré des tâches et du retour d’information de l’environnement peut enseigner au modèle à raisonner plus efficacement tout en conservant ses capacités.
Pour les tâches impliquant une action autonome, cet apprentissage s’étend à l’ensemble de l’interaction. Le modèle explore les actions possibles, intègre de nouvelles observations et affine son raisonnement au fur et à mesure qu’il progresse. Le retour d’information relie les décisions à leurs conséquences, encourageant une réflexion utile tout au long de la tâche.
Nous avons transposé ces connaissances dans un ensemble de données d’entraînement couvrant les mathématiques, le codage, le suivi d’instructions, la conversation, la recherche, l’utilisation d’outils et le génie logiciel, englobant à la fois des problèmes isolés et des interactions prolongées afin de favoriser l’adaptation aux observations et aux résultats. Le retour d’information sur les tâches guide la planification et l’apprentissage conformes à la politique, en mettant l’accent sur la préservation des capacités dans l’ensemble de ces contextes.
Les résultats obtenus sur des benchmarks publics et lors de tests A/B en conditions réelles confirment cette orientation : sur sept benchmarks et le trafic de production de deux clients, le temps de raisonnement de Kimi K3 a pu être réduit de 35 à 50 % sans perte de précision. Le comportement internalisé se traduit également par une utilisation modérée des tokens lors des tentatives infructueuses, ce qui réduit les raisonnements prolongés et improductifs.
L’indice d’intelligence spécialisée : Ember-1 établit une frontière de Pareto pour Bedside Bench
En début de semaine, nous avons présenté l’indice d’intelligence spécialisée (SII) afin d’évaluer des modèles ouverts, fermés et spécialisés par rapport à des tâches concrètes créées par des experts du secteur.
Nous avons évalué Ember-1 sur le Bedside Bench de Doximity, un benchmark validé par des médecins couvrant 500 cas cliniques répartis dans 10 catégories spécialisées.
Le résultat ? Ember-1 a établi une nouvelle frontière de Pareto pour Bedside Bench, tant pour les modèles ouverts que fermés, y compris GPT-5.6 Sol, GPT-6 Astra et Claude Opus 5, en termes de coût par tâche.
Évaluation de Pareto par rapport à d’autres benchmarks du secteur
Nous avons également évalué Ember-1 sur la frontière qualité-coût par rapport à d’autres benchmarks du secteur. Nous avons calculé le coût par benchmark à l’aide des tarifs publics de l’API Kimi K3 (entrée non mise en cache : 3 $/M de jetons, entrée mise en cache : 0,30 $/M, sortie : 15 $/M) et l’avons représenté graphiquement en fonction du taux de réussite pour trois variantes : K3 avec un effort de raisonnement faible, K3 avec un effort de raisonnement élevé, K3 avec un effort de raisonnement maximal (par défaut) et Ember-1. Pour tous les benchmarks comportant plus de 50 échantillons de test, Ember-1 se situe sur la frontière de Pareto ou à proximité, égalant la qualité de K3-max à un coût nettement inférieur et dominant clairement K3-low. Nous avons également analysé GPT-6 Astra, Claude Opus-5 et GLM 5.3, et avons constaté qu’Ember-1 occupait une position de leader sur la frontière de Pareto.
La manière la plus rentable d’utiliser K3 n’est plus de le faire réfléchir moins, mais d’utiliser Ember-1, le modèle qui a appris à réfléchir efficacement.
Validation par les clients : tests A/B en production
Les benchmarks ont leurs limites. À l’instar de ce que nous...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.