Disponible pour un stage de fin d'études NLP / LLM — 6 mois à partir de mars 2027 Me contacter

Ezéchiel Sawadogo, linguiste-informaticien et ingénieur NLP / TAL en formation

Bienvenue · Welcome · Ne y waoogo · I bisimila · Akwaba · Ẹ káàbọ̀ · Barka da zuwa · Karibu · Boyei malamu · أهلاً وسهلاً

EzéchielN.PROP · prénom‘Dieu fortifie’
SawadogoN.PROP · mooré‘fils de la pluie’
linguiste‑informaticienN · composé, prédicatlangue + code

Je construis des systèmes qui lisent, classent et comprennent le langage : sceaux byzantins, discours de haine en français, imprimés du XVIIe siècle, connaissances muséales. Formé en sciences du langage, je fais du TAL avec les outils de l'apprentissage profond et la rigueur de l'annotation linguistique.

18/20mémoire de M1, major de promotion
DH2026article accepté, Daejeon
96,7 %exactitude, classification de caractères
0,83F1, détection de haine en ligne (CamemBERT)
625sceaux classés par état de conservation (DH2026)

Projets phares

Tous les projets
2025 – 2026 · Mémoire de M1 avec Mamadou Diouhé Barry · Sorbonne Université · projet ANR BHAI

Reconnaître des caractères dans des monogrammes de sceaux byzantins

Le problème. Un monogramme byzantin superpose plusieurs lettres grecques en un seul dessin. Les lire demande un expert ; il existe des dizaines de milliers de sceaux.

Image du sceau→YOLOv8s détection→Vignettes→ResNet18 classification→Lettres
  • Détection : mAP@50 0,778 — 351 images, 49 classes, validation croisée 5 folds
  • Classification : 96,7 % d'exactitude, F1-macro 0,937 — 2 143 vignettes, 26 classes
2026 · Projet personnel · modèle publié sur Hugging Face

Détection de discours haineux en français

Le piège. Le corpus compte 42 660 lignes, mais seulement 7 499 textes distincts : sans déduplication, le test recopie l'entraînement. Après audit des données, perte pondérée et seuil ajusté sur la validation, CamemBERT atteint un F1 de 0,83 sur la classe « haineux ».

2026 · Application web · Projet personnel

DÉLIA — apprendre le TAL en jouant

Une application qui rend la linguistique computationnelle accessible sans prérequis : 7 parcours de la tokenisation aux LLM, un laboratoire interactif et du Python exécuté dans le navigateur. Un dossier est consacré aux langues africaines.

Oct. – déc. 2025 · Sorbonne Université · en binôme

Classification multimodale de catastrophes naturelles

Fusion de données sismiques tabulaires et de signaux audio pour détecter automatiquement séismes et tsunamis. La fusion multimodale dépasse les meilleures approches unimodales (Random Forest : 88,9 % d'exactitude).

Sawadogo E., Barry M. D., Mahanta S. K., Eyharabide V. — Digital Curation and Datafication of Byzantine Seal Monograms: From Annotation to Classification. Digital Humanities 2026, Daejeon, Corée du Sud, 28 juillet 2026.

Je publie Mots & Pouvoir, une publication en français sur la langue, le pouvoir, la philosophie et la pensée africaine. Écrire sur ce que les mots font aux gens nourrit ce que je fais aux mots avec des modèles.

Contact

Je cherche un stage de fin d'études de 6 mois en ingénierie NLP / LLM, à partir de mars 2027, de préférence en R&D. Basé à Paris, mobile.