Présentation de Zero-Mem

Les agents LLM ont besoin de mémoire pour agir de manière cohérente sur des interactions longues, mais de nombreux systèmes utilisent des appels LLM supplémentaires pour exploiter cette mémoire. La génération d'enregistrements intermédiaires et la médiation de leur récupération ajoutent des coûts de jetons et de temps récurrents, tandis que les détails omis ou fusionnés peuvent obscurcir les preuves originales.

Fonctionnement de Zero-Mem

Zero-Mem introduit des opérations de mémoire sans jetons : aucune étape en dehors de la réponse finale à une question n'invoke un LLM ou consomme des jetons d'entrée ou de sortie LLM ; le calcul de l'encodeur est comptabilisé séparément. Zero-Mem préserve les traces d'interaction originales comme source d'enregistrement. Il organise les traces de deux manières complémentaires. Un graphique entité-contexte expose les connexions entre les interactions, tandis qu'une hiérarchie temporelle préserve la localité conversationnelle et l'état de session.

Avantages et performances de Zero-Mem

Pour chaque requête, Zero-Mem pondère les deux vues, récupère à partir des deux, et suit leur structure pour récupérer les relations de soutien ou le contexte environnant. La calibration déterministe élimine d'abord les preuves contradictoires, puis maintient la réponse du lecteur ancrée dans les traces récupérées. Seul le lecteur de réponse finale invoque un LLM. Sur des benchmarks de questions-réponses à longue mémoire et à long contexte, Zero-Mem atteint des performances compétitives tout en éliminant les appels LLM et la consommation de jetons LLM des opérations de mémoire. Avec le même lecteur de réponse finale et le même budget de contexte, il réduit le coût de temps des opérations de mémoire de 57,6 % par rapport à la référence la plus rapide comparée.

Conclusion et avenir de Zero-Mem

Les résultats montrent que la mémoire structurée des agents n'a pas besoin de générer une représentation intermédiaire du passé. Après examen par les pairs, le code et les détails d'implémentation seront disponibles sur le site web. Les ablations soutiennent la contribution des deux vues et de leur coordination dépendante de la requête.