
Мощный инструмент на базе искусственного интеллекта вскрыл одну из самых серьезных проблем в современной науке. Проанализировав миллионы исследовательских работ, ученые обнаружили огромный пласт подозрительных публикаций. Этот аудит ставит под сомнение достоверность значительной части доступной научной литературы.
Специалисты изучили около 2,6 миллиона статей по исследованию рака, которые были выпущены в период с 1999 по 2024 год. Статья с результатами этой проверки недавно была опубликована в журнале The BMJ.
Так называемые «бумажные фабрики» представляют собой теневые компании, которые продают фальшивые или низкокачественные научные исследования. Они производят подобные работы в промышленных масштабах, предлагая авторам готовые тексты с переработанными данными и неестественными формулировками. По словам профессора Барнетта, реальный масштаб проблемы в сфере онкологии оказался гораздо шире, чем кто-либо мог предположить.

Алгоритм поиска фальсификаций
Для выявления мошеннических схем исследователи обучили языковую модель под названием BERT. Эта система была специально настроена на поиск тонких текстовых «отпечатков пальцев», которые регулярно появляются в продуктах фабрик. При тестировании на подтвержденных примерах модель смогла правильно определить подозрительные материалы в 91 проценте случаев.
Глобальный анализ показал, что доля потенциально фальшивых статей резко возросла за последние два десятилетия. Если в начале двухтысячных годов их количество составляло около одного процента, то к 2022 году этот показатель достиг пугающей отметки в 16 процентов. Примечательно, что сомнительные материалы чаще всего встречаются в таких областях, как молекулярная биология рака, а также в исследованиях рака желудка, печени и легких.
Угроза для пациентов
В настоящее время три крупных научных журнала уже начали тестирование этого искусственного интеллекта в рамках своего процесса редакционной проверки. Однако авторы проекта подчеркивают, что помечаемые статьи не должны автоматически считаться мошенническими без проверки живыми экспертами. Главная опасность заключается в том, что сфабрикованные данные могут повлиять на клинические испытания и разработку реальных лекарств, тем самым замедляя прогресс в лечении пациентов.
Ранее нейросеть научили понимать русскоязычные научные статьи.

