Présentation

Vercel propose une couche d’abstraction qui regroupe plus de 500 modèles d’intelligence artificielle derrière une seule interface de programmation. L’objectif affiché est de simplifier l’intégration en conservant les appels du SDK OpenAI tout en permettant de changer de modèle par un simple paramètre.

Fonctionnement de l’AutoRouter

L’outil AutoRouter analyse trois critères – prix, vitesse d’inférence et qualité – pour sélectionner le modèle le plus adapté à chaque requête. Cette sélection repose probablement sur un tableau de métadonnées où chaque modèle est annoté avec son coût par token, son temps moyen de réponse et une métrique de performance (par ex. score de précision). Le moteur compare ces valeurs en temps réel, ce qui implique une logique de décision à faible latence afin de ne pas ajouter de surcharge perceptible au client.

Le routage dynamique nécessite une mise à jour fréquente des métriques, notamment lorsque les fournisseurs ajustent leurs tarifs ou améliorent leurs modèles. Vercel doit donc maintenir un service de collecte et d’agrégation des données de performance, probablement via des sondes de santé et des logs d’utilisation.

Architecture de la résilience

Le système intègre un failover multi‑provider. En cas d’indisponibilité d’un fournisseur, la requête est redirigée vers un autre sans que le développeur n’intervienne. Cette capacité repose sur un mécanisme de bascule qui conserve l’état de la requête (prompt, paramètres) et le transmet à un fournisseur de secours. Le défi technique réside dans la gestion de la cohérence des réponses : différents modèles peuvent produire des sorties légèrement divergentes, ce qui peut affecter les applications sensibles aux variations de texte.

Le service inclut également une analyse d’usage et une politique de données granulaire. Les métriques d’utilisation (nombre de tokens, temps de latence, coût) sont agrégées pour fournir des tableaux de bord, tandis que les politiques de données permettent de spécifier le niveau de rétention ou de chiffrement des prompts. Ces fonctions exigent un stockage sécurisé et un contrôle d’accès strict, notamment pour respecter les exigences de conformité GDPR.

Implications et limites

La promesse d’une API unique réduit la charge de travail des équipes devops, mais elle introduit une dépendance à la couche d’abstraction de Vercel. Toute modification de l’algorithme de routage ou de la politique de failover peut impacter les performances sans que le client en soit immédiatement conscient. De plus, le manque de visibilité sur les critères exacts de sélection (pondération du prix vs. vitesse) limite la capacité à optimiser les coûts de façon fine.

Enfin, la prise en charge de plus de 500 modèles implique une surface d’attaque élargie. Chaque fournisseur ajoute ses propres vecteurs de vulnérabilité (ex. fuites de prompts, exécution de code malveillant). Vercel doit donc implémenter des filtres de validation et des sandboxings pour chaque appel, ce qui complexifie l’architecture de sécurité.