Se rendre au contenu

Notre technologie 

Les projets d'intelligence artificielle menés par TEKLIA reposent sur une chaîne de traitement modulaire, capable d'intégrer les meilleurs modèles d'IA disponibles pour chaque tâche documentaire. Arkindex orchestre ces traitements, garantit leur traçabilité et facilite leur déploiement à grande échelle.

Arkindex : notre plateforme de traitment

TEKLIA s'appuie sur Arkindex, sa plateforme open source de traitement documentaire, pour industrialiser les projets d'IA à grande échelle.

La plateforme Arkindex permet de structurer et d'automatiser le traitement des collections patrimoniales en intégrant un large panel de modèles d'IA, une validation manuelle et la mise en correspondance avec des données existantes.

✧ Conçu pour fonctionner sur des millions de pages

✧ Intègre tous les types de documents (images, PDF, IIIF)

✧ Orchestre les chaînes de traitement avec des modèles indépendants

 ✧ Assure la traçabilité et la reproductibilité du traitement.

Nous pouvons intégrer à Arkindex des algorithmes et des modèles d'IA émergents, ce qui garantit à nos clients un accès permanent aux dernières avancées et leur permet d'améliorer continuellement les performances de traitement de documents. 


Découvrir Arkindex

Votre projet de traitement sur Arkindex

Depuis plus de 10 ans, TEKLIA travaille avec les principaux acteurs du patrimoine culturel​ sur des projets ambitieux de traitement automatisé de corpus patrimoniaux. Nos solutions d’IA sur mesure permettent d’automatiser et d’améliorer l’analyse, l’indexation, la structuration et la recherche au sein de corpus culturels textuels et visuels, des milliers aux millions de documents.

Étape 1

Centralisez vos sources

Nous récupérons vos documents, quel que soit leur format ou leur localisation.

Arkindex organise vos corpus en projets cohérents, prêts pour le traitement industriel.

➙ Importation massive et flexible de PDF, images (JP2, TIFF, JPEG) depuis vos serveurs, disques durs ou via le protocole IIIF

Un corpus de documentation du Musée du Louvre dans Arkindex. 

Étape 2

Révélez le contenu par l'IA

Nos algorithmes lisent tout : imprimé, manuscrit ancien, et même la structure de la page.

Arkindex intègre des modèles génériques ou permet l'entrainement de modèles sur-mesure ("Fine-tuning") 

➙ Application de modèles de Deep Learning performants pour la segmentation (Mise en page), l'HTR (Reconnaissance d'écriture manuscrite) et l'OCR

Détection du texte et des illustrations dans les carnets de fouilles de Bernard Bruyère -> IFAO

Étape 3

Enrichissez les données 

Le logiciel ne fait pas que lire, il comprend. Il identifie les noms, les lieux et les dates pour classer vos documents.

Arkindex interprète le contenu des documents pour créer des métadonnées

➙ Transformation du texte brut en données structurées grâce à la Reconnaissance d'Entités Nommées (NER) et la classification automatique. 


Extraction d'informations dans fiche d'indexation du projet SIMARA -> Archives Nationales

Étape 4

Valorisez et Diffusez

Vos collections deviennent consultables via un moteur de recherche ou prêtes à être publiées en ligne. 


Arkindex permet l'archivage pérenne, l'alimentation de vos bases de données métier ou la publication sur vos portails web.

➙ Export standardisé (XML-ALTO, METS, TEI, JSON, CSV) ou intégration directe via notre API ouverte


Résultats de recherche dans le contenu sur la plateforme HikarIA -> HikarIA

Technologies d'intelligence artificielle pour les archives, les musées et les documents patrimoniaux


TEKLIA fournit une gamme complète de technologies d'intelligence artificielle pour la reconnaissance de documents, optimisées pour extraire des informations à partir de sources historiques et culturelles. 

TEKLIA ne développe pas un modèle unique. Nous ciblons chaque tâche de traitement en choisissant le modèle le plus adapté du marché et en l'implémentant dans notre flux de travail, puis nous les intégrons dans Arkindex afin de construire une chaîne de traitement fiable et adaptée à vos données. Nos traitements combinent OCR, HTR, vision par ordinateur, modèles d'apprentissage profond (Deep Learning), recherche par embeddings et IA générative. 

-> Découvrez notre méthodologie et nos engagements


Reconnaissance automatique de texte (OCR/HTR/ATR)

Convertir des documents numérisés en texte entièrement consultable et modifiable.

Analyse de la mise en page des documents

Segmenter les pages en zones logiques en préservant la hiérarchie visuelle et le contexte.

Reconnaissance de tableaux et de données 

Extraire et convertir des tableaux manuscrits ou dactylographiés vers des formats exploitables. 

Formulaires et entités nommées

Détecter et extraire des noms, dates, organisations, lieux et autres entités importantes dans vos documents. 

Catalogage automatique des collections

Étiqueter, classer et indexer automatiquement les média, pur une intégration dans les archives numériques.

Recherche sémantique et visuelle

Découvrir des images par leurs attributs visuels ou leur sens plutôt que par des mots-clés. 

Identifier la bonne technologie pour votre projet 


Vous souhaitez identifier les traitements les plus adaptés à vos documents ? Nos équipes vous accompagnent dans le choix des modèles d'IA et l'industrialisation de votre projet.

Contactez-nous