Contexte et enjeux

Blitzy Inc. a levé 200 millions de dollars en mai 2026, portant sa valorisation à 1,4 milliard de dollars. L’objectif déclaré est de faire fonctionner des milliers d’agents de codage en parallèle sur des bases de code d’entreprise. Selon Neeraj Deshmukh, directeur de l’ingénierie, le vrai défi n’est pas la génération de code par l’IA, mais la compréhension du système dans lequel ce code s’insère. Un changement de ligne peut avoir des répercussions en aval, parfois très éloignées, ce qui rend indispensable une visibilité précise sur les dépendances.

Architecture basée sur les graphes de connaissances

Blitzy commence par « reverse‑engineer » l’environnement client afin de créer un graphe dynamique représentant le code. Les nœuds du graphe correspondent aux modules, fichiers, fonctions, objets, classes et variables, tandis que les arêtes modélisent les relations d’appel, d’inclusion ou d’héritage. Ce graphe s’alimente en continu depuis les dépôts GitHub ou GitLab, garantissant une synchronisation immédiate dès qu’un développeur ou un agent modifie le code.

Les agents interrogent le graphe via le langage Cypher de Neo4j. Une requête typique peut ressembler à :

MATCH (f:Function)-[:CALLS]->(c:Class)
WHERE f.name = "processOrder"
RETURN c.name

La stricte sémantique de Cypher agit comme un filtre : une requête mal formée renvoie aucun résultat, évitant ainsi que l’agent ne base ses décisions sur des informations fantômes. Chaque agent ne reçoit que le sous‑graphe strictement nécessaire, limitant le contexte à 200 000‑300 000 tokens (environ 20 000‑30 000 lignes de code). Sur une base de 100 millions de lignes, les agents doivent compacter les résultats, ce qui entraîne une perte d’information potentielle.

Analyse des performances et limites

Grâce à ce ciblage, Blitzy peut planifier des projets entiers plutôt que de les fragmenter en épics ou user stories. Avant le codage, un humain valide un « Agent Action Plan », puis chaque ligne générée est testée immédiatement. L’entreprise cite un score de 84,95 % sur le benchmark SWE‑Bench Pro (juin 2026), indiquant une forte conformité aux spécifications. De plus, des agents de supervision surveillent les actions des agents de génération afin de détecter tout dérive ou hallucination.

Malgré ces avancées, la dépendance à un graphe complet impose des contraintes d’échelle. La construction initiale du graphe peut être coûteuse en temps et en ressources pour des bases de code très volumineuses. De plus, la précision du contexte dépend de la qualité du modèle de graphe : des métadonnées manquantes ou des relations mal définies peuvent conduire à des chemins de recherche incomplets. Enfin, la nécessité d’un humain pour approuver chaque plan d’action limite la pleine autonomie recherchée.