Présentation du modèle

Databricks a annoncé le 9 septembre 2026 l’extension du modèle Adaptive Instructed‑Retriever, destiné aux agents IA tels que Genie Code, Genie One et Genie Agents. Le modèle atteint une qualité de récupération comparable à plusieurs modèles tiers et open‑source tout en étant deux fois plus rapide que Claude Sonnet 5, GPT‑5.6 Luna et DeepSeek V4‑Flash. Les performances proviennent d’un ensemble de sept benchmarks internes et externes couvrant différents domaines et niveaux de difficulté.

Architecture et mécanismes d'adaptation

Adaptive Instructed‑Retriever s’appuie sur Instructed‑Retriever‑1, publié plus tôt en 2026, qui transporte les instructions utilisateur, les exemples et les schémas de sources à travers le processus de recherche et de génération. Instructed‑Retriever‑1 avait déjà amélioré les performances de plus de 70 % par rapport au RAG traditionnel sur des tests d’entreprise. Le nouveau modèle introduit une logique dynamique du nombre d’étapes de recherche : les développeurs définissent un plafond d’étapes séquentielles, le modèle estime le nombre requis et s’arrête dès que le gain marginal devient négligeable, grâce à une fonction de pénalité appliquée aux étapes supplémentaires.

La formation utilise des environnements de récupération synthétiques et des questions à sauts multiples, réutilisant les données d’Instructed‑Retriever‑1 pour conserver les capacités mono‑étape. Un apprentissage par renforcement en ligne, nommé Clipped Importance Sampling Policy Optimization, optimise une récompense qui valorise les trajectoires de recherche précises et pénalise les étapes inutiles. En variant le coefficient de pénalité, Databricks génère une famille de checkpoints positionnés différemment sur la courbe qualité‑latence.

Performances et évaluations

Sur les sept benchmarks, le modèle a atteint une latence deux fois inférieure à celle de Claude Sonnet 5, GPT‑5.6 Luna et DeepSeek V4‑Flash tout en conservant un score de rappel comparable. Un test interne a montré que le modèle a identifié l’absence de coûts de restructuration dans le compte de résultat 2022 d’une société en deux étapes, contre trois pour Claude Sonnet 5 et quatre pour GPT‑5.6 Luna. Cette réduction du nombre d’étapes se traduit directement en économies de temps de calcul et de coût d’inférence.

Databricks indique que les modèles plus légers, obtenus en augmentant la pénalité, offrent des réponses plus rapides pour des requêtes simples, tandis que les checkpoints à pénalité réduite permettent un approfondissement plus poussé pour des recherches complexes. Les clients peuvent choisir le checkpoint adapté à leurs exigences d’interactivité ou de traitement hors‑ligne.

Limites et perspectives

Les affirmations reposent sur des benchmarks propriétaires et n’ont pas été vérifiées par des tiers ; le nombre de paramètres, le prix et la disponibilité générale du modèle n’ont pas été communiqués. L’entraînement s’est fait sur le Databricks AI Runtime, ce qui implique que la réplication des performances nécessite l’accès à cette infrastructure. Enfin, la dépendance à des environnements de récupération synthétiques peut limiter la généralisation aux données réelles très hétérogènes.