Tous les projets
Vision par ordinateur (CNN) Data Engineering

Détection Précoce des Troubles de l'Écriture par Vision par Ordinateur

YOLOv8-pose · MediaPipe · Intel RealSense

Ce projet vise à détecter de manière précoce et non-invasive les troubles de l’apprentissage de l’écriture (comme la dysgraphie) grâce à l’analyse vidéo. Le système capture et reconstruit en 3D la trajectoire complète d’un stylo à l’aide de caméras synchronisées. L’innovation majeure réside dans la capacité de l’IA à analyser les mouvements “en l’air” (lorsque le stylo ne touche pas la feuille), une phase cruciale de planification motrice qui est totalement invisible pour les tablettes numériques classiques. Ce pipeline complet ouvre la voie à un dépistage clinique automatisé 100% basé sur la vidéo.

Contexte

Ce projet s’inscrit dans le cadre de la thèse de recherche AVIAREPT, portée par Lauren Sismeiro au sein du laboratoire EuroMov Digital Health in Motion (Univ Montpellier / IMT Mines Alès). Réalisé en binôme avec Rémy Plastre, ce travail constitue notre mission R&D de fin d’études en tant qu’élèves-ingénieurs spécialisés en Intelligence Artificielle.

  • Le Problème : La dysgraphie touche 5 à 10 % des enfants. Les tests cliniques actuels (Test BHK sur papier) ignorent la dynamique temporelle. Les tablettes graphiques (ex: Wacom) captent le mouvement, mais souffrent d’un angle mort critique : la perte de signal dès que le stylo est soulevé à plus de 1 cm.
  • Notre Mission (R&D) : Accompagner techniquement Lauren et construire un dispositif matériel et logiciel non-invasif capable de traquer 100 % des mouvements du stylo dans l’espace 3D pour capturer ces marqueurs cognitifs invisibles.

Données

Pour capturer la vérité terrain et entraîner les modèles, un environnement d’acquisition complexe et synchronisé à 30 FPS a été conçu de zéro :

  • Matériel vidéo : 2 caméras Intel RealSense D435i (RGB + Profondeur) et 1 webcam Sony.
  • Référence 2D : 1 tablette Wacom Intuos Pro (position 2D, coordonnées, pression, inclinaison).
  • Référence 3D : Un système Qualisys Motion Capture (MoCap) à 90 Hz avec marqueurs infrarouges.

Méthodologie

Défi 1 : Le Choix de la Vérité Terrain (MoCap vs. Tablette)

Pour évaluer la précision de notre reconstruction 3D, il nous fallait une vérité terrain fiable. Deux options s’offraient à nous : la tablette graphique (très précise mais limitée à la 2D) ou le système optique MoCap (suivi en 3D via des boules infrarouges, mais nécessitant d’interpoler mathématiquement la position de la pointe du stylo).

  • Synchronisation : Pour comparer ces deux systèmes, nous avons testé trois méthodes de synchronisation temporelle (par détection du premier contact, par corrélation des vélocités/accélérations, et manuellement/visuellement). C’est l’alignement visuel et manuel qui s’est avéré le plus précis.
  • Constat : La précision du système MoCap is nettement inférieure à celle de la tablette pour des mouvements aussi fins et micrométriques que l’écriture. De plus, la tablette n’est pas un plan horizontal parfait en 3D et les échelles de conversion étaient biaisées. La MoCap a donc été écartée comme vérité terrain millimétrique pour l’écriture au contact, mais conservée pour suivre les mouvements amples lorsque le stylo est levé.

Comparaison des tracés Wacom vs MoCap

Défi 2 : Tracking Vidéo 2D et Analyse Posturale

La première étape de la transformation des pixels bruts en coordonnées physiques consistait à isoler le stylo sur les flux vidéo.

  • Tracking du stylo (Voir vidéo en intro) : Entraînement d’un modèle YOLOv8-pose sur mesure pour détecter simultanément deux points clés (la pointe et le sommet du stylo). Ce modèle a été appliqué sur deux angles de vue différents (caméra de face et caméra latérale) en démontrant une grande robustesse face aux occlusions (mains qui cachent le stylo) et aux variations de luminosité.
  • Tracking postural : En parallèle, l’outil MediaPipe a été déployé pour suivre la posture du haut du corps (épaules, coudes, tête) en associant les points clés 2D aux cartes de profondeur des caméras RealSense, permettant d’analyser la posture globale du patient pendant l’écriture.

Défi 3 : La Reconstruction 3D de la Trajectoire

Le dernier verrou consistait à reconstruire la position de la pointe et du sommet du stylo dans l’espace 3D à partir des détections 2D issues des vues de face et latérale. Nous avons exploré deux approches distinctes :

  • Approche Deep Learning (MLP) : Un Perceptron Multicouche (MLP) a été entraîné en prenant en entrée les coordonnées issues des deux plans 2D (face et profil) pour prédire directement les coordonnées sur le plan de la tablette. L’objectif était que le modèle apprenne par lui-même à annuler les effets de distorsion des lentilles des caméras.
  • Approche Géométrique (Triangulation Épipolaire) : Une méthode de vision par ordinateur plus traditionnelle consistant à projeter les coordonnées 2D dans un espace 3D unifié. Cela a nécessité une calibration rigoureuse des paramètres intrinsèques et extrinsèques des caméras à l’aide d’une mire (en s’inspirant des travaux de Bruno Henriquès, doctorant à l’IMT Mines Alès spécialisé sur ce matériel). C’est cette approche robuste qui a été retenue pour la reconstruction finale.

Résultats

  • Tracking YOLOv8-pose : Le modèle atteint un mAP@50 supérieur à 0.93, avec une erreur de localisation médiane de seulement 3.28 pixels, garantissant un suivi fluide malgré les mouvements rapides de la main.
  • Validation du Signal : Les trajectoires reconstruites par vidéo ont été comparées à la tablette Wacom validant la pertinence de l’approche purement visuelle pour l’analyse cinématique.
  • Nous avons soumis un abstract pour une publication auprès du PFIA 2026 / IEEE FG 2026.
Projet suivant Détection Multi-classes & Data Augmentation Ciblée