Présentation de l'événement

Le 3 novembre 2026, Fireworks organise à San Francisco, sur le quai 27, la conférence Forge. L’accès est gratuit mais limité, ce qui indique une volonté de rassembler un public ciblé d’entreprises technologiques. Parmi les intervenants, on retrouve Jensen Huang, PDG de NVIDIA, Michele Catasta, présidente et responsable IA chez Replit, ainsi que Lin Qiao, PDG de Fireworks. Le programme met en avant des ateliers pratiques dédiés à la formation, à l’inférence, au routage et à l’évaluation de modèles d’intelligence artificielle.

Enjeux techniques de la souveraineté de l'IA

Le slogan « stop renting and start owning your intelligence » traduit une transition du modèle SaaS vers le déploiement autonome de modèles. Cette évolution implique la maîtrise de l’infrastructure matérielle (GPU, TPU) et logicielle (frameworks comme PyTorch ou TensorFlow) ainsi que la gestion du cycle de vie complet du modèle : collecte de données, pré‑traitement, entraînement, validation et mise en production. Posséder son IA réduit la dépendance aux fournisseurs de cloud, mais augmente la complexité de la sécurisation des modèles, notamment la protection contre le vol de poids et les attaques par extraction.

Intelligent routing et gestion des tokens

Fireworks propose de « take back control of your token bills with intelligent routing ». Cette affirmation repose sur l’utilisation d’algorithmes de routage dynamique capables de sélectionner, en temps réel, le modèle le plus économique pour chaque requête. Concrètement, le système compare le coût en tokens d’un modèle de grande taille (ex. GPT‑4) à celui d’un modèle plus léger (ex. LLaMA‑2‑7B) tout en respectant les exigences de latence et de précision. Le routage intelligent nécessite une orchestration fine via des API de facturation et des métriques de performance, souvent implémentées avec des solutions de service mesh ou de fonctions serverless.

Perspectives et limites

Les ateliers de Forge permettront d’expérimenter ces concepts, mais plusieurs contraintes subsistent. D’une part, la souveraineté de l’IA impose des dépenses d’investissement initiales élevées (acquisition de GPU, stockage haute‑débit). D’autre part, le routage basé sur les tokens dépend de la disponibilité d’une tarification transparente de la part des fournisseurs de modèles, ce qui n’est pas toujours le cas. Enfin, la sécurité du modèle auto‑hébergé reste un défi majeur, notamment la mise en place de contrôles d’accès granulaire et de monitoring des fuites de données. Malgré ces obstacles, la conférence Forge signale une volonté claire de l’industrie de réduire la dépendance aux services externes et d’optimiser les coûts opérationnels grâce à des architectures de routage intelligentes.