
Использование искусственного интеллекта в медицине сопряжено с риском воспроизведения расовых и гендерных стереотипов в генерируемых текстах. Исследователи из университета Флиндерса (Австралия) проверили две современные модели с улучшенными способностями к рассуждению — o3-mini и DeepSeek-R1. Оказалось, что даже продвинутые алгоритмы не гарантируют справедливого описания пациентов.
В рамках работы модели сгенерировали 36 тыс. вымышленных клинических случаев с распространенными заболеваниями. Анализ показал, что обе системы часто искажают реальное распределение расы и пола при различных диагнозах. Эта проблема уже отмечалась у предыдущей версии GPT-4, а новые модели не только не исправили ситуацию, но в некоторых аспектах показали даже более высокий уровень искажений.

Например, чернокожие пациенты непропорционально часто фигурировали в описаниях саркоидоза, системной красной волчанки, преэклампсии и эссенциальной гипертензии. В моделях o3-mini и DeepSeek-R1 медианное отклонение от реальной статистики достигало 44% и 31% соответственно, тогда как у GPT-4 этот показатель составлял 15%. Такое постоянное завышение доли определенных групп рискует закреплять ошибочные демографические стереотипы в клиническом мышлении.
Анализ внутренних рассуждений DeepSeek-R1 показал, что модель сознательно связывала заболевания с демографическими группами, опираясь на шаблонные ассоциации, а не на точные эпидемиологические данные. Аналогичным образом модели преувеличивали долю большинства по половому признаку, что совпадает с предыдущими наблюдениями о склонности ИИ к гендерным стереотипам в медицинских текстах.
Результаты показывают, что улучшение вычислительных характеристик ИИ не обеспечивает автоматического повышения объективности в представлении демографических групп. Для безопасного применения таких систем в медицине требуется регулярный контроль предвзятостей и учет стандартных демографических установок, заложенных в моделях.
Ранее Наука Mail рассказывала о том, что ИИ доверили дозировку кислорода пациентам в больницах.
