Présentation du framework
InstinctFlash est un runtime open‑source dédié à la diffusion en temps réel de modèles de robotique. Le projet, publié sous licence AGPL‑3.0, propose une API unique qui fonctionne tant sur les stations de travail équipées de RTX 4090/5090 que sur les cartes embarquées Jetson Thor. La version la plus récente (septembre 2026) ajoute la prise en charge du RTX 5090 et du Jetson Thor, permettant aux développeurs de déployer les mêmes modèles sans modifier le code d’appel.
Architecture et modes d’accélération
Le cœur du système repose sur un inspecteur de checkpoints Python 3.10+ qui identifie la famille du modèle (LingBot‑VA, LingBot‑VLA‑4B, Cosmos3, etc.) et génère automatiquement un fichier instinctflash.json. Chaque famille possède un environnement dédié, isolé et « pinned », afin d’éviter les conflits de dépendances. L’accélération s’appuie sur deux leviers : le passage en précision FP8 et la réduction du nombre d’étapes de génération. Le runtime accepte trois politiques de précision : native (BITEXACT), numeric (permet des variations numériques) et fp8 (force le calcul en FP8). Le choix se fait via le paramètre --fp8 ou precision="fp8" dans le code.
Benchmarks et performances
Les mesures publiées le 15 septembre 2026 montrent des gains de vitesse allant jusqu’à 33,78× sur Jetson Thor pour le modèle LingBot‑VA 5B lorsqu’il fonctionne à 2 V/4 A en FP8 avec un nombre d’étapes réduit. Le tableau suivant résume les accélérations observées :
Modèle | FP8 25V/50A | FP8 2V/4A | Gain max
LingBot‑VA (5B) | 15506.32 ms | 2891.74 ms | 5.36×
LingBot‑VLA‑4B | 2071.29 ms | 459.10 ms | 4.51×
Cosmos3 Edge DROID | 3393.78 ms | 1048.01 ms | 3.24×
pi05 | 408.58 ms | 51.85 ms | 7.88×
GR00T N1.7 | 139.50 ms | 117.30 ms | 1.19×Les gains proviennent à la fois de la réduction de la précision et du raccourcissement du calendrier d’échantillonnage. Aucun impact perceptible sur la qualité de la tâche n’a été détecté lors des tests robotisés, bien que les auteurs n’aient pas publié de métriques d’erreur quantitative.
Utilisation pratique et limites
Le déploiement s’effectue en trois étapes : clonage du dépôt, création d’un environnement virtuel et installation via le script bootstrap_vendor.py. Exemple d’installation pour Jetson Thor :
git clone https://github.com/General-Instinct/InstinctFlash && cd InstinctFlash
python3 -m venv .venv-core
source .venv-core/bin/activate
python -m pip install . uv==0.12.5
python3 scripts/bootstrap_vendor.py install lingbot-va --target jetson_thor \
--python python3.12 --root ~/ifl-lingbot-va-thor --ptxas /usr/local/cuda/bin/ptxasUne fois le modèle chargé, l’appel se résume à deux lignes : from instinctflash import Runtime puis runtime = Runtime.from_pretrained("robbyant/lingbot-va-posttrain-robotwin"). Le framework refuse toute supposition sur les métadonnées du checkpoint ; si le fichier instinctflash.json n’existe pas, il le génère lors du premier lancement. Cette approche garantit la reproductibilité mais impose une contrainte : chaque checkpoint doit contenir les informations de famille, ce qui n’est pas toujours le cas pour des modèles tiers. Enfin, le support matériel reste limité aux GPU NVIDIA listés (RTX 4090/5090, Jetson Thor) et aux versions Python 3.12/3.13, ce qui peut restreindre l’adoption dans des environnements plus hétérogènes.