Contexte et problème de récupération agentique

En 2025, les agents LLM ont remplacé les recherches à requête unique par des flux de recherche multi‑tour. Chaque itération déclenche un appel au modèle de pointe, ce qui augmente le temps de réponse (plus de 10 s) et le coût (environ 0,03 $) pour une requête typique avec gpt‑5.6‑sol. Les modèles open‑source, bien que 100 fois moins onéreux, manquent de performances sans ajustement supplémentaire.

Architecture de Castform et rôle de Neon

Castform orchestre l’apprentissage par renforcement (RL) en trois étapes : tâche (ex. répondre à une question), environnement (le moteur de recherche Lakebase Search intégré à Neon, version PostgreSQL) et fonction de récompense (vérification de la pertinence de la réponse). Le pipeline exécute un cycle d’essais‑erreurs : le modèle interroge la base, reçoit un score, puis ajuste ses paramètres pour maximiser la récompense.

Neon fournit deux mécanismes clés. D’une part, le dynamic compute scaling absorbe les pointes d’activité générées par des milliers de rollouts parallèles, chaque rollout pouvant appeler le moteur de recherche plusieurs dizaines de fois. D’autre part, la fonctionnalité de branching crée des états de base de données isolés pour chaque rollout, tandis que les time‑travel queries permettent de reconstruire l’état exact rencontré par l’agent. Ces capacités, combinées à l’autoscaling et au scale‑to‑zero, évitent le provisionnement permanent de ressources et réduisent la latence pendant les pics de charge.

Processus de génération de données d’entraînement

Castform transforme un corpus d’entreprise (documents internes, tickets de support, wikis, etc.) en un jeu de questions‑réponses synthétique. Par exemple, à partir d’une règle de réservation de train, le système génère : question « Quand faut‑il réserver un trajet ferroviaire ? », ground truth « Réserver au moins 14 jours à l’avance et choisir la classe standard ». Cette automatisation élimine le besoin d’étiquetage manuel et fournit les tasks requis pour le RL.

Analyse des performances et limites

Les expériences rapportées montrent que les modèles open‑source post‑entraînés avec Castform atteignent des scores de récupération comparables, voire supérieurs, aux modèles fermés tout en maintenant un coût d’environ 0,0003 $ par requête, soit un facteur 100 de réduction. Cependant, la qualité dépend fortement de la pertinence du reward function et de la couverture du corpus généré ; des fonctions de récompense mal définies peuvent conduire à du « reward hacking », où le modèle optimise le score sans fournir une réponse utile. De plus, l’infrastructure Neon, bien que capable de gérer des charges bursty, nécessite une configuration adéquate des seuils d’autoscaling pour éviter des latences inattendues lors de montées en charge soudaines.