Présentation du benchmark

Kapa a créé le Company Knowledge Bench, un jeu de 1 000 cas d’évaluation issus de données de production (tickets, wikis, messages Slack, code). Chaque cas comprend une requête réelle, un instantané du corpus indexé et une expression booléenne décrivant les fragments (chunks) admissibles. L’objectif est de mesurer la capacité des systèmes de récupération à fournir un ensemble minimal et complet de fragments pertinents.

Méthodologie d’évaluation

Le benchmark repose sur trois critères explicites : complétude (les fragments doivent suffire à répondre à la requête), minimalité (supprimer un fragment rend la réponse incomplète) et préférence de source. Cette dernière privilégie l’autorité (documentation officielle > tutoriel) et la fraîcheur (Slack récent > page Confluence vieille de trois ans). Les cas couvrent des usages variés : développeurs (docs, API, code), équipes commerciales (processus, clients) et support (tickets, articles). Les sept récupérateurs testés sont tous développés par Kapa et utilisent le même pipeline d’ingestion.

Analyse des résultats

Les scores de pertinence (0 = mauvais, 1 = parfait) et le temps moyen par requête sont les suivants :

Hybrid search                0.41  (≈ 2 s)
Hybrid search + rerank      0.50  (≈ 3 s)
Query decomposition         0.56  (≈ 4 s)
Kapa Default                0.61  (≈ 5 s)
Kapa Deep (optimisé)        0.65  (≈ 5 s)
Agent + grep (Luna)         0.54  (≈ 25 s)
Agent + grep (Sol)          0.61  (≈ 25 s)

Le modèle de pointe combiné uniquement à grep atteint le même score que le pipeline par défaut (0.61) mais nécessite cinq fois plus de temps, confirmant le compromis vitesse‑précision. L’implémentation « Kapa Deep », qui intègre une étape de décomposition de requête et un rerank, obtient le meilleur score (0.65) tout en restant dans la même fourchette de latence que les solutions hybrides classiques.

Un biais inhérent subsiste : tous les récupérateurs utilisent les mêmes documents ingérés par Kapa, ce qui favorise les stratégies alignées sur le format interne du produit.

Implications pour les systèmes d’agents

Les résultats montrent que, pour des environnements d’entreprise hétérogènes, une architecture hybride (recherche vectorielle + mots‑clés) enrichie d’une décomposition de requête et d’un rerank offre le meilleur compromis entre pertinence et latence. Les solutions purement basées sur la recherche textuelle brute (grep) restent compétitives en précision mais sont impraticables à grande échelle à cause du temps de réponse. Enfin, le benchmark souligne l’insuffisance des jeux de données publics, qui ne reproduisent ni la diversité des sources ni la complexité syntaxique des requêtes internes, justifiant la création d’un jeu de référence dédié.