Prédiction multimodale de la démence avec de grands modèles de langage : attention croisée sur texte, audio et imageMultimodal Dementia Prediction With Large Language Models: Cross-Attention Over Text, Audio, and Image.
Cognition globaleLangage expressifCommunication non verbaleAdulteVieillissement
Non déterminableRobustesse méthodologiquePubMed — neurosciences cognitives developpementalesSourceDOIRéférence disponible
Cette étude propose un cadre de fusion trimodale fondé sur l'attention pour la détection de la maladie d'Alzheimer et l'évaluation de sa sévérité à partir de la tâche de description de l'image « Cookie Theft ». Le modèle intègre des représentations textuelles, audio et visuelles via un mécanisme d'attention croisée bidirectionnelle produisant un plongement m...