Présentation du modèle
Le modèle Qwen 3.8 27B, issu de la famille Qwen développée par Alibaba, compte 27 milliards de paramètres. Cerebras l’a intégré à son catalogue de modèles accessibles via API publique, en affichant un débit de 1500 tokens par seconde. Cette vitesse représente le temps moyen de génération d’un token lorsqu’une requête est traitée sur le système de calcul dédié de Cerebras, sans aucune modification de l’architecture du réseau.
Compression et quantisation
Sur les points de stockage, Cerebras applique une quantisation sélective poids‑only. Les poids sont conservés en formats partiels de 16 bits, 8 bits ou 4 bits, conformément aux standards industriels. Les couches jugées sensibles – typiquement les couches d’embedding ou les têtes d’attention – restent en pleine précision (FP16/FP32) et sont déquantisées à la volée lors de l’inférence. Cette approche évite la perte de qualité liée à une quantisation uniforme tout en réduisant l’empreinte mémoire du modèle stocké.
Les activations, les mécanismes d’attention et le cache KV (key‑value) sont maintenus en pleine précision et ne subissent aucune quantisation. Ainsi, les calculs critiques conservent leur dynamique numérique, limitant les dérives de précision qui pourraient affecter la génération de texte.
Cerebras précise qu’aucun modèle pruned n’est disponible via ses points d’accès publics. Les travaux de recherche sur le pruning, notamment la méthode REAP (Router‑weighted Expert Activation Pruning), sont publiés sur Hugging Face mais ne sont pas exposés dans l’API partagée. Cette décision garantit que les utilisateurs accèdent toujours à la version originale, non modifiée du modèle.
Performance et limites
Le débit de 1500 toks/s résulte d’une combinaison de matériel spécialisé (WSE – Wafer‑Scale Engine) et de la stratégie de quantisation décrite ci‑dessus. La réduction de la taille des poids diminue les besoins en bande passante mémoire, ce qui accélère le transfert des paramètres vers les unités de calcul. En revanche, la déquantisation à la volée impose une surcharge CPU/GPU supplémentaire, mais celle‑ci reste marginale comparée aux gains de bande passante.
Le maintien de la pleine précision pour les activations implique une consommation mémoire plus élevée pendant l’inférence, surtout pour les séquences longues où le cache KV s’accumule. Les utilisateurs doivent donc prévoir une capacité RAM suffisante pour éviter les swaps qui dégraderaient le débit.
Enfin, l’absence de modèles pruned signifie que les clients ne bénéficient pas d’une réduction de latence supplémentaire que pourrait offrir un réseau plus compact. La transparence de Cerebras sur l’état de compression permet toutefois de choisir en connaissance de cause entre qualité maximale et contraintes d’infrastructure.