La société Cerebras Systems, spécialisée dans les puces d'intelligence artificielle, a annoncé mardi qu'elle mettait à la disposition des chercheurs et des entreprises des modèles de type ChatGPT en code source libre, afin de favoriser la collaboration.La société Cerebras, basée dans la Silicon Valley, a publié sept modèles, tous entraînés sur son supercalculateur d'intelligence artificielle Andromeda. Il s'agit de modèles linguistiques de 111 millions de paramètres et d'un modèle plus large de 13 milliards de paramètres.
"Il y a un grand mouvement pour fermer ce qui a été ouvert dans l'IA... ce n'est pas surprenant car il y a maintenant beaucoup d'argent dans ce domaine", a déclaré Andrew Feldman, fondateur et PDG de Cerebras. "L'enthousiasme de la communauté, les progrès que nous avons réalisés, sont dus en grande partie à l'ouverture de la communauté."
Les modèles comportant davantage de paramètres sont capables d'exécuter des fonctions génératives plus complexes.
Le chatbot ChatGPT d'OpenAI, lancé à la fin de l'année dernière, dispose par exemple de 175 milliards de paramètres et peut produire de la poésie et de la recherche, ce qui a contribué à susciter un grand intérêt et un financement important pour l'IA au sens large.
Selon M. Cerebras, les modèles les plus petits peuvent être déployés sur des téléphones ou des haut-parleurs intelligents, tandis que les plus grands fonctionnent sur des PC ou des serveurs, bien que les tâches complexes telles que le résumé de passages importants nécessitent des modèles plus grands.
Cependant, Karl Freund, consultant en puces chez Cambrian AI, a déclaré que ce qui est plus grand n'est pas toujours meilleur.
"Des articles intéressants qui ont été publiés montrent qu'un modèle plus petit peut être précis si vous l'entraînez davantage", a déclaré M. Freund. "Il y a donc un compromis entre un modèle plus grand et un modèle mieux formé."
Selon M. Feldman, l'entraînement de son plus grand modèle a pris un peu plus d'une semaine, un travail qui prend généralement plusieurs mois, grâce à l'architecture du système Cerebras, qui comprend une puce de la taille d'une assiette à dîner conçue pour l'entraînement à l'IA.
La plupart des modèles d'IA sont aujourd'hui formés sur les puces de Nvidia Corp, mais de plus en plus de startups comme Cerebras tentent de prendre des parts de ce marché.
Les modèles formés sur les machines de Cerebras peuvent également être utilisés sur les systèmes Nvidia pour une formation plus poussée ou une personnalisation, a déclaré M. Feldman.
Cerebras-GPT : une famille de grands modèles linguistiques ouverts pour favoriser la collaboration...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.