
Как сообщила пресс-служба МГУ порталу Наука Mail, ученые международного проекта Codebook/GRECO-BIT в области вычислительной и статистической геномики выяснили, какие участки ДНК распознают малоизученные регуляторные белки человека. Для этого они исследовали 332 белка пятью разными методами — в пробирке и в живых клетках, а потом проверяли модели на данных из других экспериментов, чтобы убедиться в их надежности.

Удалось описать мотивы для 177 белков — для большинства из них такой информации раньше не было. Теперь общее число белков с известной специфичностью превышает 1400. Каталог помогает предсказывать, как мутации влияют на связывание белков с геномом. Проект длится почти восемь лет, в нем провели более 4000 экспериментов. Исследователи уже нашли тысячи случаев, когда замена в ДНК меняет способность белка связываться с геном, и во многих ситуациях этот эффект можно заранее предсказать.
Ценность проведенных опытов не только в покрытии множества малоисследованных факторов транскрипции, но и в их систематичности. Геномные паттерны связывания регуляторного белка могут очень сильно отличаться от связывания с искусственными последовательностями. Эти данные — один из немногих наборов, которые позволяют создавать универсальные модели связывания, в том числе модели искусственного интеллекта, способные к качественному и оцениваемому переносу знаний между разными модальностями.
Прежде чем применять модель связывания, нужно решить, какую именно из множества возможных считать правильной. Для каждого эксперимента разные алгоритмы поиска мотивов строят разные модели, а для белка, специфичность которого никогда не описывали, сверить результат не с чем. Главным критерием становится переносимость: модель, выведенная из одного эксперимента, должна предсказывать данные другого эксперимента, поставленного иным методом.
Модели, построенные десятью разными программами, тестировали на всех остальных экспериментах для того же белка, а результаты сопоставления собрали в открытый каталог Codebook Motif Explorer. Каждый эксперимент дополнительно оценивали не менее трех независимых экспертов из числа членов консорциума. Побочным результатом сравнения стало наблюдение, расходящееся с распространенными ожиданиями: «четкость» мотива, которую формально измеряют его информационным содержанием по Шеннону, не связана с точностью предсказания участков связывания. Многие «нечеткие» модели, в которых ни одна позиция не требует строго определенного нуклеотида, описывали связывание не хуже прочих и воспроизводились сразу на нескольких экспериментальных платформах.
Codebook Motif Explorer — это наглядный пример важности и ценности данной работы. Эта работа ценна не только тем, что закрывает множество пробелов в наших знаниях о специфичности связывания транскрипционных факторов. Полученные данные и результаты уже становятся основой для новых исследований и инструментов.
Анализ мотивов осуществляла большая команда под руководством Ивана Кулаковского (Институт белка РАН) и Всеволода Макеева (Институт общей генетики имени Н. И. Вавилова РАН), а платформу для анализа геномных данных предоставила группа Федора Колпакова (Университет «Сириус»). В работе с российской стороны также участвовали сотрудники Института биохимии и генетики УФИЦ РАН и компании «Биософт».
На российской стороне был выполнен поиск мотивов по первичным данным, их кросс-платформенное сопоставление, создание сервиса для экспертной оценки экспериментов и каталога Codebook Motif Explorer, анализ аллель-специфичного связывания и активности мотивов в тканях и клеточных линиях, а также организация соревнования IBIS Challenge, которое успешно завершилось в 2025. Статья по его результатам готовится к публикации.
Все полученные данные и инструменты выложили в открытый доступ: они пригодятся для новых исследований, разработки методов диагностики и поиска причин наследственных заболеваний.
Ранее Наука Mail рассказывала о том, что в мозге человека обнаружили масштабную «смену клеток» после 50 лет.

