Comment les grands modèles de langage répondent-ils aux questions liées au TDAH ? Une étude comparative de ChatGPT, Gemini et DeepSeek.
How do large language models answer ADHD-related questions? A comparative study of ChatGPT, Gemini, and DeepSeek.
L’essentiel
Cette étude compare la précision, la reproductibilité, la qualité, l'utilité et la fiabilité des réponses de ChatGPT (GPT-4o), Gemini et DeepSeek R1 à 22 questions fréquemment posées sur le TDAH, réparties en quatre domaines (connaissances de base, diagnostic, traitement, pronostic). Deux spécialistes en psychiatrie de l'enfant et de l'adolescent ont évalué les réponses. Les trois modèles ont montré une précision élevée (91%, 89%, 87%), avec des différences selon les domaines : ChatGPT a excellé sur le traitement et le pronostic, tandis que Gemini et DeepSeek étaient meilleurs sur les connaissances de base et le diagnostic. ChatGPT a obtenu les meilleurs scores globaux de qualité, d'utilité et de fiabilité. Les résultats suggèrent que les LLM peuvent être des sources d'information complémentaires pour les patients, mais ne remplacent pas un avis médical professionnel.
- ChatGPT a atteint la précision la plus élevée (91 %) sur les questions TDAH, suivi de Gemini (89 %) et DeepSeek (87 %).
- La reproductibilité était la plus élevée pour ChatGPT (89 %), devant Gemini (86 %) et DeepSeek (84 %).
- ChatGPT a surpassé les autres modèles pour les questions liées au traitement et aux résultats à long terme.
Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.
Comprendre l’analyse ↓Analyse du résumé uniquement. Confiance faible dans les informations extraites.
Voir les sources ↓Synthèse détaillée
Synthèse
Cette étude compare la précision, la reproductibilité, la qualité, l'utilité et la fiabilité des réponses de ChatGPT (GPT-4o), Gemini et DeepSeek R1 à 22 questions fréquemment posées sur le TDAH, réparties en quatre domaines (connaissances de base, diagnostic, traitement, pronostic). Deux spécialistes en psychiatrie de l'enfant et de l'adolescent ont évalué les réponses. Les trois modèles ont montré une précision élevée (91%, 89%, 87%), avec des différences selon les domaines : ChatGPT a excellé sur le traitement et le pronostic, tandis que Gemini et DeepSeek étaient meilleurs sur les connaissances de base et le diagnostic. ChatGPT a obtenu les meilleurs scores globaux de qualité, d'utilité et de fiabilité. Les résultats suggèrent que les LLM peuvent être des sources d'information complémentaires pour les patients, mais ne remplacent pas un avis médical professionnel.
Résultats principaux
ChatGPT a atteint la précision la plus élevée (91 %) sur les questions TDAH, suivi de Gemini (89 %) et DeepSeek (87 %). La reproductibilité était la plus élevée pour ChatGPT (89 %), devant Gemini (86 %) et DeepSeek (84 %). ChatGPT a surpassé les autres modèles pour les questions liées au traitement et aux résultats à long terme. Gemini et DeepSeek ont obtenu de meilleures performances sur les connaissances de base et le diagnostic. Des différences significatives existent entre les modèles en termes de qualité, utilité et fiabilité des réponses.
Repères pour la pratique
Les LLM peuvent fournir des informations précises sur le TDAH, mais leurs réponses doivent être interprétées avec prudence et ne doivent pas remplacer une évaluation clinique professionnelle. Les patients et les aidants peuvent utiliser ces modèles comme sources d'information complémentaires, en étant conscients des variations de qualité entre les modèles. Les cliniciens doivent être informés des forces et faiblesses des LLM pour guider les patients vers des ressources fiables.
Limites et précautions
Étude comparative systématique de trois LLMs sur des questions TDAH, avec évaluation par experts, pertinente pour la pratique clinique et l'information patient. L'étude n'a inclus que 22 questions issues de sources numériques publiques, ce qui peut ne pas refléter l'ensemble des préoccupations des patients. L'évaluation a été réalisée par seulement deux spécialistes, ce qui peut introduire un biais. La conception transversale ne permet pas d'évaluer l'évolution des réponses des LLM dans le temps. Les modèles examinés ne représentent pas l'ensemble des LLM disponibles.
Analyse méthodologique
Non déterminable — Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.
Le texte intégral ouvert n’était pas accessible. Cela rend la robustesse non déterminable : l’absence d’information n’est pas interprétée comme une faiblesse de l’étude.
Examiner les critères point par point
Cette analyse automatisée de NeuroWatch se base exclusivement sur le résumé de l'étude. Les auteurs rapportent que ChatGPT (GPT-4o) a obtenu une précision moyenne de 91%, Gemini 89% et DeepSeek R1 87% sur 22 questions fréquemment posées sur le TDAH. La reproductibilité suivait un schéma similaire (89%, 86%, 84%) et des différences significatives ont été observées pour la qualité, l'utilité et la fiabilité évaluées par des experts. Cependant, de nombreux aspects méthodologiques ne sont pas rapportés dans le résumé, notamment le contrôle des facteurs de confusion (difficulté des questions, ordre de présentation) et la validité des mesures. La sélection des questions à partir de sources numériques est décrite sans détails suffisants sur la représentativité. L'étude a utilisé des statistiques descriptives et des analyses non paramétriques pour mesures répétées, ce qui est documenté comme adéquat. Aucune information sur le financement ou les conflits d'intérêts n'est disponible. En raison du manque d'informations, la robustesse de l'étude est jugée indéterminée et la confiance dans l'analyse est faible, nécessitant la lecture du texte intégral pour une évaluation complète. Il est important de noter que les réponses des LLMs ne doivent pas remplacer un avis clinique professionnel.
confounding controlNon déterminable
Aucune information sur le contrôle des facteurs de confusion potentiels (par exemple, difficulté des questions, ordre de présentation).
L’information nécessaire n’est pas rapportée dans la source analysée.measure validityNon déterminable
Aucune information sur la validité des mesures d'évaluation (précision, qualité, utilité, fiabilité) ou sur les propriétés psychométriques des questions.
L’information nécessaire n’est pas rapportée dans la source analysée.population selectionNon déterminable
La sélection des 22 questions comme 'fréquemment posées' à partir de sources numériques est décrite mais sans détails sur le processus de sélection ou la représentativité.
L’information nécessaire n’est pas rapportée dans la source analysée.statistical analysisFavorable
L'étude a utilisé des statistiques descriptives et des analyses non paramétriques pour mesures répétées afin de comparer les performances des modèles.
Un élément méthodologique adéquat est explicitement documenté.Cette analyse est produite automatiquement par une IA à partir des sources indiquées, puis l’appréciation est calculée avec des règles versionnées (scientific_analysis_v2). Elle ne constitue ni une validation par un professionnel ni une recommandation clinique. Consulter la méthodologie.
Classification détaillée
Informations sur l’article
- Publication
- Étude transversale
- Source
- PubMed — neurosciences cognitives developpementales
- Date
- 12 juin 2026
- Langue
- Anglais
- Accès
- abstract only
- Licence
- Non déterminée