Intelligence artificielle dans l'éducation médicale : performance de ChatGPT versus étudiants en médecine à un examen médical
Artificial intelligence in medical education: Performance of ChatGPT versus medical students on medical examination.
L’essentiel
Cette étude évalue la performance de ChatGPT (modèles 3.5 et 4.0) pour résoudre un examen de médecine de 50 questions (médecine préventive et psychiatrie) administré à 41 étudiants de quatrième année. Les réponses initiales et après re-prompting ont été comparées à celles des étudiants. Le score moyen des étudiants était de 29,5 ± 5,9. ChatGPT 4.0 a surpassé tous les étudiants après re-prompting (score de 46), et les deux modèles ont montré une probabilité plus élevée de bonnes réponses que les étudiants, sauf pour le premier prompt du modèle 3.5. Les auteurs concluent que ChatGPT 4.0 est un outil fiable, mais appellent à la prudence dans l'interprétation et l'application de ses résultats en contexte clinique et éducatif.
- ChatGPT 4.0 a obtenu un score de 46/49 après re-prompting, surpassant tous les étudiants (moyenne 29,5 ± 5,9).
- Le re-prompting améliore significativement les performances de ChatGPT, passant de 28 à 40 pour le modèle 3.5 et de 43 à 46 pour le modèle 4.0.
- Pour les questions faciles, la précision des deux modèles ChatGPT diffère significativement de celle des étudiants.
Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.
Comprendre l’analyse ↓Analyse du résumé uniquement. Confiance faible dans les informations extraites.
Voir les sources ↓Synthèse détaillée
Synthèse
Cette étude évalue la performance de ChatGPT (modèles 3.5 et 4.0) pour résoudre un examen de médecine de 50 questions (médecine préventive et psychiatrie) administré à 41 étudiants de quatrième année. Les réponses initiales et après re-prompting ont été comparées à celles des étudiants. Le score moyen des étudiants était de 29,5 ± 5,9. ChatGPT 4.0 a surpassé tous les étudiants après re-prompting (score de 46), et les deux modèles ont montré une probabilité plus élevée de bonnes réponses que les étudiants, sauf pour le premier prompt du modèle 3.5. Les auteurs concluent que ChatGPT 4.0 est un outil fiable, mais appellent à la prudence dans l'interprétation et l'application de ses résultats en contexte clinique et éducatif.
Résultats principaux
ChatGPT 4.0 a obtenu un score de 46/49 après re-prompting, surpassant tous les étudiants (moyenne 29,5 ± 5,9). Le re-prompting améliore significativement les performances de ChatGPT, passant de 28 à 40 pour le modèle 3.5 et de 43 à 46 pour le modèle 4.0. Pour les questions faciles, la précision des deux modèles ChatGPT diffère significativement de celle des étudiants. Pour les questions difficiles, la différence entre les étudiants et le premier prompt du modèle 3.5 n'était pas significative. Les auteurs recommandent une vérification constante de la fiabilité des informations générées par les grands modèles de langage avant usage clinique ou éducatif.
Repères pour la pratique
Les cliniciens doivent interpréter avec prudence les réponses de ChatGPT, en particulier pour les questions difficiles où la performance peut être comparable à celle des étudiants. L'utilisation de ChatGPT comme outil d'aide à la décision clinique nécessite une validation externe et une supervision humaine. Les éducateurs médicaux devraient intégrer des directives sur l'utilisation éthique et critique de l'IA dans la formation. Le re-prompting peut améliorer la fiabilité des réponses, mais ne garantit pas l'exactitude clinique.
Limites et précautions
L'article traite de l'IA dans l'éducation médicale, sans pertinence directe pour la neuropsychologie développementale ou les troubles neurodéveloppementaux. La note est faible (15/100) car le sujet est hors périmètre. L'étude repose sur un échantillon restreint de 50 questions et 41 étudiants, limitant la généralisation. Une question a été exclue car basée sur une image, ce qui réduit la couverture des compétences visuelles. La comparaison avec les étudiants ne tient pas compte de la variabilité individuelle des performances. Les résultats sont basés sur un seul type d'examen (médecine préventive et psychiatrie) et peuvent ne pas refléter d'autres domaines médicaux. L'étude n'évalue pas la validité clinique des réponses de ChatGPT dans des situations réelles.
Analyse méthodologique
Non déterminable — Le texte intégral n’était pas accessible ; aucune faiblesse méthodologique ne peut être déduite de cette absence.
Le texte intégral ouvert n’était pas accessible. Cela rend la robustesse non déterminable : l’absence d’information n’est pas interprétée comme une faiblesse de l’étude.
Une anomalie documentaire ou méthodologique a été détectée. L’article reste disponible et doit être interprété avec prudence.
Examiner les critères point par point
L'étude, de type transversal, a comparé les performances de ChatGPT (versions 3.5 et 4.0) à celles de 41 étudiants de quatrième année de médecine sur un examen de 49 questions à choix multiples en médecine préventive et psychiatrie. Les résultats montrent que le score moyen des étudiants était de 29,5 ± 5,9, tandis que les scores initiaux de ChatGPT 3.5 et 4.0 étaient respectivement de 28 et 43. Après un re-prompting, les scores sont passés à 40 et 46. Le modèle 4.0 a surpassé tous les étudiants après re-prompting. Les auteurs rapportent que, à l'exception du premier prompt de ChatGPT 3.5, les modèles ChatGPT avaient une probabilité plus élevée de fournir des réponses correctes que les étudiants. Pour les questions faciles, la précision des deux modèles ChatGPT différait significativement de celle des étudiants, tandis que pour les questions difficiles, la différence entre les étudiants et le premier prompt de ChatGPT 3.5 n'était pas significative. Une tendance non significative a été observée dans la comparaison de la précision par difficulté de question. L'analyse NeuroWatch note que le contrôle des facteurs de confusion n'est pas rapporté dans le résumé, ce qui rend cette dimension indéterminée. La validité de la mesure est limitée par l'exclusion d'une question basée sur une image, ce qui peut affecter la comparabilité. La population est restreinte à un seul établissement et à deux domaines médicaux, limitant la généralisabilité. Les analyses statistiques semblent limitées à des comparaisons de moyennes et de probabilités, sans détails sur les tests de signification ou les ajustements. Les intervalles de confiance, les valeurs p exactes, les détails sur la catégorisation de la difficulté, les données démographiques des étudiants et les analyses au niveau des items ne sont pas rapportés dans la source analysée. L'analyse est automatisée et basée uniquement sur le résumé, ce qui limite la robustesse des conclusions.
confounding controlNon déterminable
Aucune information sur le contrôle des facteurs de confusion n'est rapportée dans le résumé.
L’information nécessaire n’est pas rapportée dans la source analysée.measure validityPoint de vigilance
La validité de la mesure est limitée car une question basée sur une image a été exclue, ce qui peut affecter la comparabilité des performances.
Une limitation méthodologique est explicitement documentée.population selectionPoint de vigilance
La population est restreinte à 41 étudiants de quatrième année de médecine, ce qui limite la généralisabilité des résultats.
Une limitation méthodologique est explicitement documentée.statistical analysisPoint de vigilance
Les analyses statistiques sont limitées à des comparaisons de moyennes et de probabilités, sans mention de tests de signification détaillés ou d'ajustements.
Une limitation méthodologique est explicitement documentée.Cette analyse est produite automatiquement par une IA à partir des sources indiquées, puis l’appréciation est calculée avec des règles versionnées (scientific_analysis_v2). Elle ne constitue ni une validation par un professionnel ni une recommandation clinique. Consulter la méthodologie.
Classification détaillée
Informations sur l’article
- Publication
- Étude transversale
- Source
- PubMed — neurosciences cognitives developpementales
- Date
- 22 août 2026
- Langue
- Anglais
- Accès
- abstract only
- Licence
- Non déterminée