Présentation
Deltafin est un binaire natif, compilé avec cargo build --locked --release, qui charge le modèle complet Kimi K3 (2,8 trillion de paramètres, fenêtre de contexte de 1 M tokens). Le projet s’appuie sur le stockage ARGODRIVE et permet de faire tourner le modèle sur un MacBook Pro Apple Silicon en utilisant quatre SSDs, soit une configuration grand public dont le coût reste inférieur à celui d’une infrastructure de plusieurs dizaines de téraoctets de VRAM.
Architecture et flux de données
Le modèle conserve les 16 experts originaux sans aucune réduction de poids. Le binaire évite la duplication du composant DSpark — seulement 6.635 GiB sont requis sur disque, contre 4.49 GiB en mémoire vive lors de l’inférence. Le mode --stream télécharge initialement 215 GB d’experts, puis les charge à la demande, réduisant l’espace disque requis à 1.7 TB pour le modèle complet. Un cache local sur SSD minimise les accès disque ultérieurs, ce qui explique les gains de débit observés au fil du temps.
Un module optionnel, Qwen, ajoute 4.337 GiB sur disque et fonctionne comme un pré‑décodeur : il génère des hypothèses que K3 valide, ce qui a permis d’obtenir un facteur 2.7 d’accélération sur une séquence de 17 tokens sans altérer les identifiants de sortie.
Performances et optimisation
Les mesures publiées indiquent un débit de 0.2901 token/s (3.447 s/token), soit une amélioration de 1.9 % par rapport à la version précédente. Les relevés antérieurs montrent une progression de 0.0141 token/s (27 juillet 2026) à 0.2847 token/s (2 août 2026), traduisant une hausse de 7 % en moins d’une semaine. Cette évolution résulte principalement de l’optimisation du cache SSD et de la réduction du temps d’accès aux experts grâce à ARGODRIVE.
Le débit reste limité par la bande passante du stockage et la latence du processeur Apple Silicon lorsqu’il doit vérifier chaque token produit par les 16 experts. Aucun raccourci n’est appliqué : chaque token passe par le contrôle strict de K3, ce qui garantit la fidélité du modèle mais impose un coût temporel important.
Limites et perspectives
Malgré les gains, le débit reste inférieur à 1 token/s, ce qui rend l’utilisation en temps réel difficile pour des applications interactives. Le modèle nécessite 1.7 TB d’espace disque pour la version complète, un facteur qui peut exclure certains utilisateurs. De plus, les performances observées dépendent fortement de la capacité du cache SSD à retenir les experts les plus sollicités ; un redémarrage ou une purge du cache entraîne une chute temporaire du débit.
Le projet montre néanmoins que la frontière entre le matériel de consommation et les modèles de plusieurs trillions de paramètres peut être repoussée. Les améliorations futures pourraient passer par une meilleure orchestration du cache, l’utilisation de SSD NVMe plus rapides ou l’intégration de techniques de compression sans perte qui conservent la qualité du modèle tout en réduisant le volume de données à charger.