Se rendre au contenu

HAIKIDO

Projet de recherche ANR

France ✧ 2026-2030

Porteur


TEKLIA - Christopher Kermorvant

Solène Tarride

Mélodie Boillet 

ANR HAIKIDO | TEKLIA

Objectif du projet 


Développer des méthodes avancées d’IA pour extraire, structurer et analyser des données tabulaires historiques, un format fondamental utilisé tout au long de l’histoire pour organiser et encoder l’information, mais qui reste largement inaccessible à la recherche computationnelle à grande échelle.

Le projet HAIKIDO vise a développer des modèles d'A pour l'extraction et l'analyse des données tabulaires historiques, un format essentiel depuis l'Antiquité mais encore largement inaccessible aux analyses automatisées en raison de sa complexité et de la diversité des sources. 

Les grands modèles de langue (LLM) existants restent inadaptés aux tableaux historiques denses, manquant de précision et nécessitant des ressources de calcul importantes. HAIKIDO propose des modèles spécialisés, intégrant la structure tabulaire à plusieurs niveaux dans les données d'entraînement et les architectures de modèles, pour une extraction fiable et contextualisée. En combinant modèles structurés et approches multimodales, le projet améliore la précision et l'interprétabilité des systèmes d'lA appliqués aux documents historiques. 

Trois ensembles de données sont étudiés, chacun représentant des défis spécifiques : 

  • des tables astronomiques
  • des rapports de bureaux de bienfaisance
  • des résumés de contrats notariés

Ces jeux de données servent à valider les modèles et permettent d'ouvrir de nouvelles perspectives en histoire économique, démographie historique et histoire des sciences, en facilitant l'accès aux données tabulaires à grande échelle.


Les données tabulaires : un format historique difficilement exploitable par l'IA


Une tradition séculaire dans la présentation d'informations structurées 

 Le format tabulaire peut être défini comme une méthode exploitant la bidimensionnalité de la surface d’écriture au moyen d’une structure en grille. Ce format permet de considérer simultanément plusieurs directions de lecture au sein d’une même surface inscrite, affichant ainsi de manière compacte un ensemble de relations entre différentes entités, ainsi que l’organisation structurelle de ces relations. Il facilite en outre l’application systématique de diverses opérations, telles que l’analyse syntaxique, le tri et le filtrage. Ces propriétés sémiotiques du format tabulaire ont été reconnues très tôt dans l’histoire de l’écriture. Par exemple, les plus anciennes traditions documentées d’astronomie mathématique, présentes dans les sources cunéiformes, reposent largement sur des structures tabulaires, tout comme les textes administratifs issus du même contexte culturel [Haubold2019].

Ce type de source est essentiel pour les historiens, car il constitue souvent la principale source d’informations quantitatives sur différents aspects du fonctionnement des sociétés humaines : des tables astronomiques aux livres de comptes, en passant par les relevés de température ou les registres fiscaux. 
 

Une multiplicité de pratiques et d'usages qui complexifie l'exploitation numérique

La conception et le contenu des tableaux varient fortement selon la nature du document, son producteur et ses objectifs, mais également en fonction de facteurs matériels, tels que l’évolution des pratiques au fil du temps, les changements dans les technologies d’écriture (imprimerie, etc.) ou l’évolution du prix des matériaux (par exemple, le papier était un produit de luxe dans certains contextes).

Cette hétérogénéité constitue un défi majeur pour le traitement automatisé. Même pour un seul type de document, la conception et le contenu des tableaux historiques varient considérablement, notamment en ce qui concerne les informations disponibles et les pratiques d’écriture propres à chaque auteur : certains utilisent des abréviations uniques, d’autres ajoutent des annotations, tandis que certains ont largement recours aux ratures ou aux corrections. Ces variations, à l’intérieur des corpus comme entre eux, constituent actuellement un obstacle majeur à la lecture automatisée à grande échelle des documents tabulaires historiques. Notre projet vise à ouvrir l’accès aux documents tabulaires historiques grâce à des modèles d’IA hybrides, permettant une analyse computationnelle à grande échelle tout en préservant l’intégrité structurelle et le sens de la source originale.

Une nouvelle approche pour l'exploitation des données tabulaires anciennes


Etat de l'art de l'exploitation des données tabulaires anciennes par l'intelligence artificielle 

Les progrès récents de l’IA pour la compréhension des documents ont été largement stimulés par l’émergence des LLM multimodaux, capables de transcrire des documents entiers à partir d’images. Cependant, ces modèles présentent des limitations fondamentales pour le traitement des données tabulaires en raison de leur nature intrinsèquement unidimensionnelle [Dong2022].

 Les documents tabulaires historiques nécessitent des modèles capables de préserver et d’interpréter les relations spatiales et structurelles, ce que les architectures actuelles de LLM peinent à réaliser. Les LLM pré-entraînés se concentrent principalement sur la génération séquentielle de texte et sont donc sous-optimaux pour capturer la mise en page complexe et la structure logique des tableaux. Leurs mécanismes d’attention ne modélisent pas explicitement les dépendances hiérarchiques et relationnelles, pourtant essentielles à la représentation des données tabulaires.

Par ailleurs, la plupart des tâches de fine-tuning pour la compréhension des documents mettent l’accent sur le question-réponse visuel plutôt que sur la transcription structurée complète, ce qui entraîne des performances insuffisantes sur les sources tabulaires denses et riches en informations [Badaro2023]. L’ambiguïté dans la représentation des données tabulaires complique encore davantage la tâche, car les tableaux peuvent être encodés de multiples façons selon les choix de mise en forme, rendant la définition de la vérité terrain et l’évaluation intrinsèquement plus complexes.

En outre, le recours au prompting des LLM pour l’extraction de données tabulaires nécessite des descriptions détaillées de la sémantique et de la structure des tableaux, ce qui rend le processus peu fiable et difficile à mettre à l’échelle [Fang2024]. Ces limitations soulignent la nécessité de développer des modèles d’IA spécialisés pour les documents tabulaires.


La recherche portée par HAIKIDO : une approche hybride

HAIKIDO propose un changement de paradigme en s’éloignant des approches fondées sur des LLM génériques pour développer à la place des modèles d’IA spécialisés, adaptés aux documents tabulaires historiques. Cela implique l’intégration de modèles d’apprentissage profond hybrides combinant des LLM avec un raisonnement structuré et des connaissances du domaine, afin de garantir une extraction des données précise et tenant compte du contexte.

Le projet repose sur une représentation multi-niveaux de la structure tabulaire, dans laquelle les mises en page des tableaux seront intégrées à la fois aux données d’entraînement et à l’architecture du modèle, permettant un traitement de l’IA conscient des dimensions spatiales et sémantiques. Cela conduira à des techniques d’IA plus sobres, permettant un traitement à grande échelle, une optimisation de l’efficacité computationnelle et une réduction de l’empreinte environnementale.

HAIKIDO fournit une nouvelle approche et un pipeline d’IA hybrides, permettant une extraction automatisée des données à grande échelle tout en maintenant leur fidélité historique. Le projet créera également des benchmarks et des jeux de données, afin de permettre l’évaluation des techniques développées sur des sources historiques réelles.

Le projet relève les défis scientifiques suivants :

  1. Modéliser et représenter les structures tabulaires au moyen d’approches fondées sur les graphes, les séquences et des approches hybrides ;
  2. Intégrer les connaissances des experts du domaine dans les modèles d’apprentissage profond afin d’améliorer leur interprétabilité et leur précision ;
  3. Garantir la fiabilité et l’interprétabilité des prédictions de l’IA en développant des interfaces utilisateur permettant aux chercheurs d’interagir avec les résultats des modèles et de les valider.

Les données étudiées : trois corpus d'expérimentation 


Tables astronomiques 

Responsable : LTE

Un premier terrain d’expérimentation concerne les tables numériques d’astronomie, qui comptent parmi les premiers exemples de formats tabulaires.

Les sources astronomiques contiennent un vaste corpus de données organisées sous forme de tableaux, dont certaines sont observationnelles (par exemple, les catalogues d’étoiles), mais dont la majorité sont de nature computationnelle. Elles servent d’outils de calcul pour les algorithmes mathématiques utilisés afin de déterminer les positions des objets célestes.

Elles sont le produit de calculs qui, dans la plupart des cas, peuvent être reconstruits à partir des sources historiques [Brummelen2021]. Comme il s’agit de tableaux numériques, la transcription des caractères est considérablement simplifiée, même lorsqu’on travaille sur des sources manuscrites anciennes.

Une autre propriété importante est leur redondance et leur variabilité : certains tableaux ont été copiés à de nombreuses reprises dans des centaines de manuscrits, souvent avec de légères variations tant dans le contenu que dans la mise en page. Cette collection d’objets très similaires mais néanmoins distincts se prête particulièrement bien aux approches d’intelligence artificielle.


Rapports sur l’assistance aux personnes pauvres

Responsable : INED

Un deuxième terrain d’expérimentation est constitué de rapports produits au sein de l’appareil d’État à partir de la fin du XVIIIe et au début du XIXe siècle. Ces rapports sont fréquents et riches en informations, mais également très diversifiés.

Dans le cadre du projet HAIKIDO, nous avons choisi de nous concentrer sur les rapports produits par la principale unité administrative de la France post-révolutionnaire, les préfets, à destination de l’autorité centrale à Paris.

Une série de rapports sur l’assistance aux personnes pauvres (Situation financière des bureaux de bienfaisance…), conservée aux Archives nationales (boîtes F/20/282/2 à F/20/282/8) pour le milieu du XIXe siècle, constituera notre principal terrain d’expérimentation.

L’une des caractéristiques de ces rapports est que leur structure n’est pas fixe : les colonnes sont généralement les mêmes, mais peuvent être présentées dans un ordre différent et varier fortement d’une année à l’autre.

Plus important encore, il existe un rapport par année et par unité (département), mais la forme du rapport varie fortement selon les unités, allant d’un simple résumé comportant quelques chiffres à une forme beaucoup plus détaillée dans laquelle chaque bureau de bienfaisance est décrit.


Rapports sur l’assistance aux personnes pauvres

Responsable : INED

Enfin, un troisième cas d’étude repose sur des tableaux produits par l’administration fiscale française afin de récapituler les transactions matérielles et autres contrats établis devant notaire.

Ces tableaux sont apparus peu après la Révolution française et ont pris de nombreuses formes : tableaux d’acheteurs, tableaux de testaments, tableaux de contrats de mariage, entre autres.

Bien qu’organisés de manière similaire, ces tableaux varient considérablement entre eux et au fil du temps, ce qui a jusqu’à présent limité leur utilisation à grande échelle.

Bibliographie


[Badaro2023] G. Badaro, M. Saeed, and P. Papotti. 2023. Transformers for Tabular Data Representation: A Survey of Models and Applications. Transactions of the Association for Computational Linguistics, 11:227–249. 

[Baena 2024] General Detection-based Text Line Recognition. R. Baena, S. Kalleli, M. Aubry, NeurIPS 2024. 

[Baena 2025] R. Baena, S. Baltaci, F. Somer, M. Husson, M. Aubry, Detecting text in historical astronomical diagrams, subm. 

[Boillet2024] Boillet, M., Tarride, S., Schneider, Y., Abadie, B., Kesztenbaum, L., & Kermorvant, C. (2024). The Socface Project: Large-Scale Collection, Processing, and Analysis of a Century of French Censuses. ICDAR 2024. 

[Brummelen2021] G. V. Brummelen, M. Husson, C. Montelle, 2021. “Tools of the Table Crackers: Using Quantitative Methods to Analyze Historical Numerical Tables” in Editing and analysing astronomical tables: Towards a digital information system for the history of astral sciences, Eds. M. Husson, C. Montelle and B. v. Dalen. Turnhout, Brepols, 19-52. 

[Coquenet2023] D. Coquenet, C. Chatelain and T. Paquet, "DAN: A Segmentation-Free  Document Attention Network for Handwritten Document Recognition," in IEEE Transactions on Pattern Analysis and Machine Intelligence,  2023 

[Deng2024] Deng, N., Sun, Z., He, R., Sikka, A., Chen, Y., Ma, L., Zhang, Y., & Mihalcea, R. (2024). Tables as Texts or Images: Evaluating the Table Reasoning Ability of LLMs and MLLMs. ACL 2024 

[Dong2022] Dong, H., Cheng, Z., He, X., Zhou, M., Zhou, A., Zhou, F., Liu, A., Han, S., & Zhang, D. (2022). Table Pre-training: A Survey on Model Architectures, Pre-training Objectives, and Downstream Tasks. IJCAI 2022. 

[Fang2024] Fang, X., Xu, W., Tan, F. A., Hu, Z., Zhang, J., Qi, Y., Sengamedu, S. H., & Faloutsos, C. (2024). Large Language Models (LLMs) on Tabular Data: Prediction, Generation, and Understanding – A Survey. TMLR, June 2024. 

[Gueslin1998] Gueslin, A. 1998. Gens pauvres. Pauvres gens dans la France du XIXe siècle. Paris: Aubier. 

[Haubold2019] Haubold, Johannes, John Steele, and Kathryn Stevens, eds. Keeping Watch in Babylon, Leiden, The Netherlands: Brill, 25 Apr. 2019. https://doi.org/10.1163/9789004397767 

[Wang2024] Wang, Z., Zhang, H., Li, C.-L., Eisenschlos, J. M., Perot, V., Wang, Z., Miculicich, L., Fujii, Y., Shang, J., Lee, C.-Y., & Pfister, T. (2024). Chain-of-table: Evolving Tables in the Reasoning Chain for Table Understanding. ICLR 2024.