
Самый большой проект без документации
Представьте программный проект, код которого состоит из трех миллиардов букв. В нем нет комментариев и документации, а сам проект находится в продакшене уже очень давно. Спросить, как он устроен, не у кого. При этом копия такого проекта есть у каждого из нас — практически в каждой клетке тела.
Это человеческий геном, записанный алфавитом из четырех букв: A, G, C и T. Из их последовательности собрана инструкция по созданию и работе человеческого организма
В 2003 году человечество научилось получать последовательность этих букв. Сегодня чтение генома уже не выглядит научной фантастикой. Но прочитать последовательность — не значит понять ее смысл.
Проблема прежде всего в масштабе. Если напечатать человеческий геном обычным шрифтом без пробелов, абзацев, заголовков и оглавления, получится около тысячи томов «Войны и мира».

Примерно два процента генома составляют участки, кодирующие белки. Их биология изучила сравнительно хорошо. Остальная часть белки не кодирует. Раньше ее часто называли «мусорной ДНК», однако сегодня понятно, что среди этих последовательностей находятся регуляторные элементы, которые определяют, какой ген, в какой клетке, в какой момент и с какой интенсивностью должен работать. Есть также повторяющиеся, структурные и другие участки, роль многих из которых все еще изучается.
В истории уже были примеры расшифровки неизвестной письменности. Египетские иероглифы удалось прочитать благодаря Розеттскому камню, где один текст был записан на нескольких языках. Для ДНК такого перевода нет: нет словаря или носителя языка, у которого можно уточнить значение.
Мы также не знаем, где в геноме проходят границы осмысленных элементов. Последовательность `ЗАДАЧИ` можно прочитать как слово или как сочетание «за дачи». Верный вариант определяется контекстом и знанием языка. В ДНК пробелов тоже нет, но готового знания ее «слов» у нас значительно меньше.
Как модель учит язык без словаря
Языковые модели умеют извлекать структуру из больших массивов текста без заранее составленного словаря. Во время обучения модель получает простую задачу: предсказать следующий или скрытый фрагмент последовательности. Чтобы хорошо решать ее на больших объемах данных, модель вынуждена формировать внутреннее представление о закономерностях языка — грамматике, связях и контексте.
На этом основана идея геномных языковых моделей. Если ДНК можно рассматривать как текст, то модели можно показать огромное количество геномных последовательностей и попросить ее предсказывать пропущенные или следующие элементы.

Один из примеров — Evo 2. Модель обучалась на последовательностях общей длиной около девяти триллионов нуклеотидов, представляющих более ста тысяч видов, и может учитывать контекст длиной до миллиона символов. Важно не только количество данных. В процессе обучения модель начинает различать биологически значимые структуры: границы генов, регуляторные участки и места связывания белков. Ей не выдавали учебник биологии — эти закономерности она извлекла из самих последовательностей.
Это не означает, что модель «понимает жизнь» так же, как ее понимает биолог. Однако внутри данных она находит устойчивую структуру, которую можно использовать для решения прикладных задач.
Что геномные модели уже умеют
Первое важное направление — оценка последствий мутаций. Замена одной буквы ДНК может быть безобидной, а может нарушить работу белка и привести к заболеванию. Экспериментальная проверка каждого варианта требует огромных ресурсов.
Модель AlphaMissense оценила около 71 миллиона возможных замен, меняющих аминокислоту в белке, и для 89% вариантов дала прогноз «скорее патогенный» или «скорее доброкачественный». До этого клиническая классификация существовала лишь примерно для 0,1% таких вариантов. Здесь принципиально важно не перепутать прогноз с диагнозом: модель не заменяет врача и лабораторную проверку. Она помогает определить, какие варианты нужно исследовать в первую очередь.
Второе направление связано с некодирующей частью генома. Причина заболевания может находиться не внутри гена, а рядом с ним — в участке, управляющем его активностью. Например, мутация способна создать новый регуляторный «выключатель» или «усилитель», из-за которого исправный ген начинает работать слишком сильно. Современные модели пытаются предсказывать, какие гены включатся или выключатся при изменении конкретной последовательности и насколько изменится их активность.

Третье направление — переход от чтения к проектированию. Генеративные модели уже используют для создания новых белков и систем редактирования генома.
Наконец, модели начинают проектировать сами регуляторные последовательности ДНК с заданными свойствами. Исследователь может сформулировать условие — например, добиться определенного уровня активности в конкретном типе клеток, — после чего предложенные последовательности синтезируют и проверяют в живой системе. Результат пока далек от стопроцентной надежности: значительную часть вариантов приходится отбрасывать. Но еще недавно возможность осмысленно генерировать такие последовательности практически отсутствовала.
Модель постепенно превращается из инструмента чтения в инструмент проектирования. Она уже не только анализирует существующий биологический текст, но и предлагает новые варианты этого текста.
Где проходят границы возможностей
Из подобных результатов на первый взгляд можно сделать вывод, что геном практически расшифрован и скоро по образцу слюны можно будет точно предсказать здоровье и будущее конкретного человека. Пока это не так.
Геномные модели хорошо усваивают закономерности, общие для множества живых организмов и сохраненные эволюцией. Но индивидуальные различия между людьми предсказывать гораздо сложнее. Модель может ошибаться даже в направлении эффекта: приведет конкретный вариант к усилению или ослаблению работы гена у конкретного человека.

Кроме того, результат развития организма определяется не только геномом. На него влияют среда, образ жизни, особенности развития и случайные процессы. Даже однояйцевые близнецы с практически идентичной ДНК могут болеть разными заболеваниями. Поэтому обещание полностью «прочитать человека по ДНК» сегодня значительно опережает реальные возможности науки.
Вторая граница связана с биобезопасностью. Модель, способная проектировать полезные биологические последовательности, потенциально может предложить и опасные. Разработчики Evo 2, например, намеренно исключали из обучающих данных вирусы, заражающие человека. Однако исследования показывают, что часть подобных ограничений можно обойти последующим дообучением. Это не повод отказываться от технологии, но открытый вопрос, который необходимо решать одновременно с развитием самих моделей.
Дешевеет результат, дорожает понимание
Геномные модели являются частью более общего сдвига. Базовый результат — текст, код или первоначальный анализ последовательности — сегодня можно получить быстро и сравнительно дешево. Дефицитным становится понимание: какой вопрос следует задать, где заканчиваются возможности модели, где она ошиблась и можно ли использовать ее ответ для принятия решения.
Поэтому роль исследователя не исчезает. Напротив, чем убедительнее становятся ответы модели, тем важнее способность проверить их, поставить эксперимент и увидеть границу применимости метода. В биомедицине цена ошибки особенно высока: красивый прогноз не становится фактом только потому, что его уверенно сформулировал алгоритм.
Люди всегда передавали машинам часть интеллектуальной работы. Счет мы отдали калькуляторам, а значительную часть памяти — поисковым системам. Сейчас впервые в таком масштабе мы передаем машине элементы рассуждения и интерпретации: посмотрим, что из этого получится.
Ранее эксперт Наука Mail объяснил, почему не так страшно восстание машин, как человеческое «оно же само».

