Contexte et objectif
L’article décrit le lancement d’Apollo, un chatbot alimenté par un grand modèle de langage (LLM) dédié à l’interprétation de documents grecs fragmentés datant de plusieurs millénaires. Le projet vise à rendre accessibles des textes qui, jusqu’à présent, restent incompréhensibles à cause de leur état de détérioration, de l’absence de ponctuation et de la variabilité des orthographes. L’équipe de recherche, basée à l’université de Californie, combine reconnaissance optique de caractères (OCR) adaptée aux papyrus et fine‑tuning d’un LLM sur des corpus classiques grecs afin d’obtenir une compréhension contextuelle.
Architecture technique
Le pipeline se compose de trois modules distincts. Premièrement, un moteur OCR spécialisé, développé à partir de Tesseract mais entraîné sur plus de 10 000 images de papyrus annotées, convertit les images en texte brut. Deuxièmement, le texte brut est pré‑traité : les ligatures sont séparées, les caractères endommagés sont remplacés par des tokens de masquage, et une normalisation Unicode (NFC) est appliquée. Enfin, le texte normalisé alimente le LLM, qui a été initialement pré‑entraîné sur le modèle GPT‑4‑class (175 M de paramètres) puis affiné sur un corpus de 2 M de mots issus de la littérature grecque antique, de commentaires philologiques et de traductions modernes. Le chatbot utilise la technique de récupération augmentée (RAG) : il interroge une base de connaissances contenant des dictionnaires morphologiques et des tables de lemmes afin d’enrichir ses réponses.
Analyse des performances et limites
L’article indique que, sur un jeu de validation de 200 fragments, Apollo atteint un taux de précision de 78 % pour la reconstruction de mots manquants, contre 62 % pour les approches classiques basées uniquement sur l’OCR. Cette amélioration provient principalement de la capacité du LLM à exploiter le contexte sémantique au-delà de la ligne immédiate. Cependant, les auteurs soulignent plusieurs contraintes : la qualité de l’image reste le facteur limitant ; les fragments très dégradés génèrent des tokens de masquage qui peuvent conduire le modèle à « deviner » des mots inexistants. De plus, le modèle hérite des biais du corpus d’entraînement : il privilégie les formes littéraires standardisées et peut négliger les variantes dialectales.
Implications pour la recherche en philologie numérique
En intégrant OCR, normalisation et génération de texte, Apollo propose une approche holistique qui pourrait transformer la manière dont les chercheurs accèdent aux sources primaires. Le système permet d’interroger directement un fragment en langage naturel : l’utilisateur peut demander « Quel est le sens probable de ce passage ? », et le chatbot renvoie une traduction accompagnée d’une justification basée sur les lemmes récupérés. Cette transparence est cruciale pour la validation académique, car chaque suggestion est liée à une entrée de la base de connaissances. Néanmoins, le projet reste en phase pilote ; les auteurs prévoient d’étendre le corpus d’entraînement à des manuscrits en copte et en latin afin d’évaluer la transférabilité du modèle à d’autres langues anciennes.