Présentation du modèle Neutrino-1 8B
Le modèle Neutrino-1 8B est un décodeur-transformer à 8,19 milliards de paramètres, stocké dans un format de poids ternaire propriétaire. Ce format permet de réduire la taille des poids de huit fois par rapport au format fp16, ce qui améliore les performances de décodage.
Fonctionnement du modèle
Le modèle Neutrino-1 8B utilise une attention groupée pour stocker le cache KV, ce qui réduit la quantité de mémoire nécessaire pour le décodage. Les poids du modèle sont stockés dans un format ternaire, qui est décodé à l'intérieur des noyaux de matrice, ce qui élimine la nécessité de stocker des poids au format fp16 ou fp32.
Performances et applications
Le modèle Neutrino-1 8B offre des performances de décodage élevées, avec une vitesse de décodage de 24,9 tokens par seconde sur un Apple M5, et de 30,7 tokens par seconde sur un NVIDIA L4. Le modèle est également compatible avec les processeurs CPU et les cartes graphiques, ce qui le rend adaptable à différents environnements de calcul.
Implémentation et licence
Le modèle Neutrino-1 8B est open-source et est distribué sous licence Apache License 2.0, ce qui permet une utilisation commerciale, une modification, un affinage et une redistribution sans restriction. Le modèle est également disponible sur un référentiel public, ce qui facilite son accès et son utilisation.
pip install fermion-research
Le modèle Neutrino-1 8B peut être utilisé pour diverses applications, notamment la génération de texte, la traduction automatique et la réponse à des questions. Sa grande taille et sa complexité le rendent particulièrement adapté aux tâches de traitement du langage naturel qui nécessitent une grande précision et une grande flexibilité.