|
Аннотация.
Использование больших генеративных моделей (БГМ) в здравоохранении в настоящее время вызывает значительный интерес. Проведено сравнение БГМ GigaChat и YandexGPT. Выборка 1200 ответов БГМ на запросы врачей из медицинских организаций, оказывающих помощь в амбулаторных и стационарных условиях, по семи тематикам оценивалась 13 врачами-экспертами по пяти пятибалльным критериям: релевантность, правильность, безопасность, полнота, языковая грамотность. Анализ выполнен с использованием парного t-критерия с оценкой размера эффекта. Наблюдались разнонаправленные различия между моделями в качестве ответов, в зависимости от критерия оценки и тематики запроса. Отмечено неудовлетворительное качество ответов по критериям безопасности и правильности по ряду тематик (GigaChat «Лекарственные средства» 3,1±1,5 правильность, 3,3±1,6 безопасность, YandexGPT «Параметры и нормы методов исследования» 3,3±1,5 для обоих критериев). Таким образом, БГМ в настоящее время не готовы выполнять функцию ассистента врача.
Ключевые слова:
искусственный интеллект, медицинский чат-бот, большие генеративные модели, GigaChat, YandexGPT, экспертная оценка LLM.
DOI: 10.14357/20790279260310
EDN: EUAPVH
Стр. 79-89.
Литература
1. Aravazhi P.S. et al. The integration of artificial intelligence into clinical medicine: trends, challenges, and future directions. // Disease-a-Month. 2025. Vol. 71. No. 6. P. 101882. 2. Указ Президента РФ от 10.10.2019 № 490 (ред. от 15.02.2024) «О развитии искусственного интеллекта в Российской Федерации» (вместе с «Национальной стратегией развития искусственного интеллекта на период до 2030 года»). 3. Указ Президента РФ от 08.12.2025 № 896 «О Стратегии развития здравоохранения в Российской Федерации на период до 2030 года». 4. Распоряжение Правительства Российской Федерации от 17.04.2024 г. № 959-р об утверждении стратегического направления в области цифровой трансформации здравоохранения. 5. Zhihong Z. et al. Advancing healthcare with large language models: A scoping review of applications and future directions. // International Journal of Medical Informatics, 2025. P. 106231. 6. Liang E.N. et al. Clinical applications of large language models in medicine and surgery: A scoping review. // Journal of International Medical Research. 2025. Vol. 53. No. 7. P. 03000605251347556. 7. Shchetinin E.Y. et al. Methods for developing and implementing large language models in healthcare: challenges and prospects in Russia. // Discrete and Continuous Models and Applied Computational Science. 2025. Vol. 33. No. 3. P. 327–344. 8. Решетников Р.В. и др. Методики оценки качества больших генеративных моделей для базовых сценариев применения в здравоохранении. // Врач и информационные технологии. 2025. № 3. С. 64–76. 9. Suresh K., Thomas S.V., Suresh G. Design, data analysis and sampling techniques for clinical research. // Annals of Indian Academy of Neurology. 2011. Vol. 14. No. 4. P. 287–290. 10. Васильев Ю.А. и др. Создание и валидация опросника ERA-GMA для оценки качества работы больших генеративных моделей в качестве сервиса предоставления ответа на вопросы врача-клинициста. // Национальное здравоохранение. 2026. В печати. 11. Faul F. et al. Statistical power analyses using G* Power 3.1: Tests for correlation and regression analyses. // Behavior Research Methods. 2009. Vol. 41. No. 4. P. 1149–1160. 12. Tam T.Y.C. et al. A framework for human evaluation of large language models in healthcare derived from literature review. // NPJ Digital Medicine. 2024. Vol. 7. No. 1. P. 258. 13. Huh I., Gim J. Exploration of Likert scale in terms of continuous variable with parametric statistical methods. // BMC Medical Research Methodology. 2025. Vol. 25. No. 1. P. 218. 14. Kottner J. et al. Guidelines for reporting reliability and agreement studies (GRRAS) were proposed. // International Journal of Nursing Studies. 2011. Vol. 48. No. 6. P. 661–671. 15. de Vet H.C.W., Dikmans R.E., Eekhout I. Specific agreement on dichotomous outcomes can be calculated for more than two raters. // Journal of Clinical Epidemiology. 2017. Vol. 83. P. 85–89. 16. Heeren T., D'Agostino R. Robustness of the two independent samples t-test when applied to ordinal scaled data. // Statistics in Medicine. 1987. Vol. 6. No. 1. P. 79–90. 17. Posten H.O. Robustness of the two-sample t-test. // Robustness of statistical methods and nonparametric statistics. Dordrecht: Springer Netherlands, 1984. P. 92–99. 18. R Core Team. R: A language and environment for statistical computing. Vienna: R Foundation for Statistical Computing, 2020. 19. Tiller N.B. et al. Generative artificial intelligence-driven chatbots and medical misinformation: an accuracy, referencing and readability audit. // BMJ Open. 2026. Vol. 16. No. 4. P. e112695. 20. Blasingame M.N. et al. Comparing five generative AI chatbots' answers to LLM-generated clinical questions with medical information scientists' evidence summaries. // Journal of the Medical Library Association: JMLA. 2026. Vol. 114. No. 2. P. 94. 21. Sümbüllü M. et al. Large language models' performances regarding common patient questions about broken endodontic instruments: a comparative analysis of ChatGPT-5.2, Gemini 3 and DeepSeek V3.2 in accuracy, consistency and readability. // BMC Oral Health. 2026. 22. Yüceer-Çetiner E. et al. Evaluating the competence of AI chatbots in answering patient-oriented frequently asked questions on orthognathic surgery. // Healthcare. 2025. Vol. 13. No. 17. P. 2114.
|