Présentation

OpenAI a mis à disposition en version publique la Decisions API. Cette interface, disponible en beta, promet des temps de décision jusqu’à dix fois plus courts que ceux obtenus avec le modèle GPT‑6 Luna via l’ancienne Responses API. Elle accepte à la fois des entrées texte et image et propose trois types de sorties : predicates, choices et scores. Le modèle tarifaire est fixé à 0,10 $ pour chaque million de jetons d’entrée, sans frais additionnels liés à la lecture ou à l’écriture de cache, ni aux jetons de sortie.

Fonctionnement et architecture

Contrairement aux API de génération de texte classiques, la Decisions API ne produit pas de séquence de tokens à décoder. Elle se contente d’évaluer un problème donné et de renvoyer une réponse structurée (par exemple, un booléen ou une probabilité). Cette simplification du flux de travail élimine l’étape de décodage, qui représente souvent le goulet d’étranglement en latence. Le service repose donc sur un modèle d’inférence optimisé pour le calcul de scores plutôt que pour la génération séquentielle, ce qui explique le gain de vitesse annoncé. L’acceptation d’images implique que le modèle intègre un pré‑traitement visuel, probablement via un encodeur multimodal partagé avec les modèles de génération d’OpenAI, mais la sortie reste limitée à des valeurs numériques ou catégorielles.

Analyse des performances et du modèle économique

Le facteur « 10 × plus rapide » se mesure généralement en millisecondes de latence de bout en bout. En pratique, cela signifie que des requêtes qui prenaient auparavant 200 ms avec la Responses API peuvent être traitées en moins de 20 ms, ce qui ouvre la porte à des cas d’usage en temps réel (détection de fraude, recommandation instantanée, contrôle de processus industriels). Le coût de 0,10 $/M tokens d’entrée se compare favorablement aux tarifs habituels de génération, où chaque token de sortie est facturé. En ne facturant que les jetons d’entrée, OpenAI encourage les intégrateurs à envoyer des contextes plus riches sans pénaliser les réponses succinctes. L’absence de frais de cache simplifie la prévision budgétaire, mais supprime également un levier d’optimisation pour les charges de travail répétitives.

Limites et perspectives

La principale contrainte réside dans le type de sortie limité. Les applications nécessitant du texte généré ou des réponses longues devront toujours recourir à la Responses API, ce qui implique une orchestration hybride. De plus, la version beta ne garantit pas la stabilité des SLA ni la disponibilité globale, ce qui peut freiner les déploiements critiques. Enfin, le modèle de tarification basé uniquement sur les jetons d’entrée ne prend pas en compte la complexité algorithmique du calcul de scores, qui peut varier fortement selon la taille du contexte (jusqu’à 1 million de tokens dans d’autres modèles comme Nano Banana 2.1). Les prochains cycles de produit devront probablement introduire des métriques de consommation de calcul pour éviter des coûts cachés.