Disponible pour un stage de fin d'études NLP / LLM — 6 mois à partir de mars 2027 Me contacter
Projets / Reconnaître des caractères dans des monogrammes de sceaux byzantins

Reconnaître des caractères dans des monogrammes de sceaux byzantins

Un pipeline semi-automatique qui localise puis identifie les lettres grecques enchevêtrées dans les monogrammes, pour constituer une base d'images annotées exploitable par la recherche.

Période
Janv. – juin 2026
Cadre
Mémoire de M1 · projet ANR BHAI
Encadrement
Victoria Eyharabide
Auteurs
Mamadou Diouhé Barry, Ezéchiel Sawadogo
Résultat
18/20, major de promotion
Sceau byzantin en plomb portant un monogramme
Sceau byzantin en plomb : un monogramme superpose plusieurs lettres grecques, qui admettent parfois plusieurs lectures.

Le problème

Les sceaux de plomb byzantins sont une source majeure pour l'histoire de l'Empire : ils identifient leurs propriétaires par des inscriptions, des scènes et des monogrammes. Un monogramme superpose plusieurs lettres en un seul dessin ; le même agencement de traits peut admettre plusieurs lectures. Les déchiffrer demande un expert, alors qu'il existe des dizaines de milliers de sceaux.

L'approche

Séparer les deux difficultés : d'abord localiser chaque caractère dans l'enchevêtrement, ensuite l'identifier. Nous avons annoté le corpus (boîtes polygonales), entraîné les modèles en validation croisée et analysé les confusions classe par classe.

Image du sceau→YOLOv8s détection→Vignettes→ResNet18 classification→Lettres

Résultats

0,778mAP@50 en détection (5 folds)
96,7 %exactitude en classification
0,937F1-macro

Essayer le modèle

Les deux modèles sont accessibles en ligne : on dépose le dessin d'un monogramme et le détecteur encadre et nomme chaque lettre ; on dépose un caractère isolé et ResNet18 l'identifie.

Prolongement : la publication DH2026

Le même corpus a donné lieu à un article présenté à Digital Humanities 2026 (Daejeon, Corée du Sud) : classification de l'état de conservation de 625 sceaux en quatre niveaux (M0–M3) par comparaison d'encodeurs pré-entraînés, DINOv2-Small donnant la meilleure baseline. Voir Publications.

PyTorch · Ultralytics YOLOv8 · torchvision · scikit-learn · Supervisely · Label Studio · Google Colab (GPU T4)