Présentation du projet

L’auteur a exploité les transcriptions du projet GLOBALISE, qui numérise 4,35 millions de pages manuscrites de la Compagnie des Indes orientales (1600‑1799). En une nuit de douze heures, son laboratoire IA a traité 5,7 millions de passages, soit l’équivalent de plus de 70 années de lecture humaine à raison de deux minutes par page. Le but était de rechercher des faits historiques non répertoriés, tout en conservant la vérifiabilité grâce à la consultation des scans originaux.

Architecture du pipeline d’IA

Le flux commence par un assistant « Deep Research » qui propose treize questions potentielles, classées selon la disponibilité des données et la possibilité de validation. Les sources incluent les archives de la Compagnie, les journaux numérisés de la Bibliothèque nationale néerlandaise et deux siècles de journaux américains. Chaque passage est converti en « empreinte sémantique » afin de permettre une recherche par signification plutôt que par mots clés, indispensable face aux variations orthographiques du XVIIᵉ siècle.

Un modèle de décision rapide, nommé Jev, filtre les 59 000 mentions d’éléphants à un coût de quelques centimes par million de mots, soit environ trois dollars au total. Les passages retenus sont ensuite analysés par le modèle Claude Haiku, qui extrait dates, lieux et entités, puis ouvre le scan original pour confronter la transcription à la source manuscrite. Le processus repose sur une boucle humaine : l’opérateur valide chaque résultat avant de le publier.

Which open historical questions are most likely to be solvable with data that already exists online?

Analyse des résultats découverts

Le pipeline a identifié trois catégories de découvertes : un rapport de chute de météorite de 1620, trois mentions de rhinocéros capturés sur l’île Maurice en 1615, et des éruptions volcaniques non répertoriées autour de 1808. Chaque élément a été corroboré par le document numérisé correspondant, garantissant ainsi la traçabilité. Avant de chercher ces nouveautés, le système a retrouvé des événements connus (le dodo, l’éruption de Laki en 1783 et celle de Tambora en 1815), confirmant la sensibilité du filtre.

Limites et perspectives

La qualité des transcriptions OCR demeure la principale contrainte : les erreurs de reconnaissance et les orthographes variables augmentent le taux de faux positifs, d’où la nécessité du modèle Jev. De plus, le coût reste marginal mais non négligeable lorsqu’on étend le traitement à d’autres corpus de taille comparable. L’approche montre que l’IA peut accélérer la recherche d’anomalies dans des archives massives, à condition de garder un contrôle humain sur la validation finale. Des améliorations futures pourraient inclure des modèles de désambiguïsation linguistique plus robustes et une intégration directe avec les bases de données de catalogues historiques.