Речь не о том, что ИИ внезапно научился мыслить или самостоятельно ставить научные задачи. Модель Unify специально разработали для поиска скрытых биологических закономерностей. Однако результаты оказались достаточно убедительными, чтобы авторы назвали ее не просто инструментом для обработки данных, а «двигателем биологических открытий». Исследование опубликовано в журнале Nature Communications.
Почему клетки разных животных так трудно сравнивать
Современные технологии позволяют ученым изучать активность генов в каждой отдельной клетке. Так появляются клеточные атласы мозга, сердца, иммунной системы и других органов. Они помогают увидеть, чем одна клетка отличается от соседней, как она развивается и что с ней происходит при болезни.
Проблемы начинаются, когда исследователи пытаются сравнить атласы разных видов. Чем дальше животные разошлись в ходе эволюции, тем меньше у них генов, которые можно прямо сопоставить друг с другом.
Большинство существующих методов опирается на ортологи — гены разных видов, унаследованные от общего предка и сохранившие достаточно заметное сходство. Такой подход неплохо работает для близких организмов, но постепенно теряет информацию по мере увеличения эволюционного расстояния.
При этом похожая работа внутри клетки не всегда поручена похожим генам. За миллионы лет один ген может изменить функцию, а совершенно другой — независимо приобрести такую же роль. Если алгоритм смотрит только на родство и строение генов, эти связи остаются для него невидимыми.
ИИ научили смотреть не только на гены, но и на их работу
Создатели Unify решили сравнивать не отдельные гены, а более крупные функциональные группы, которые назвали макрогенами. В них система объединяет гены разных видов, похожие по строению белков или по выполняемой биологической работе.
Для этого исследователи соединили три источника данных. Первый показывал, какие гены активны в каждой клетке. Второй описывал строение белков с помощью специальной языковой модели ESM-2. Третий содержал текстовые описания функций генов из биологических баз данных, которые обрабатывала модель LLaMA-2.
Большая языковая модель здесь не писала тексты и не отвечала на вопросы. Она переводила описания работы генов в числовое представление. Благодаря этому Unify могла заметить, что два непохожих гена выполняют сходные функции, даже если обычное сравнение последовательностей не показывало между ними явного родства.
В результате система получила нечто вроде общего языка, на котором можно описывать клетки разных организмов. Она одновременно старалась убрать различия, вызванные разными лабораториями и технологиями, но не потерять настоящие биологические особенности клеток.
Модель проверили на видах, разделенных 700 миллионами лет
Авторы сравнили Unify с девятью другими методами интеграции клеточных данных. В испытания вошли как близкие виды — например, кошка и тигр, — так и организмы, находящиеся на очень удаленных ветвях эволюционного дерева.
По мере увеличения расстояния между видами результаты большинства конкурирующих методов ухудшались. Unify сохраняла более устойчивый баланс: смешивала сопоставимые данные разных видов, но при этом лучше удерживала информацию о типах клеток и их функциях.
Самым масштабным испытанием стала реконструкция эволюционного дерева клеток семи видов, которых разделяют более 700 миллионов лет. В анализ вошли позвоночные, оболочники, насекомые, нематоды и плоские черви.
Система организовала 125 типов клеток в общую эволюционную структуру. Нейроны разных животных образовали более цельную группу, чем в результатах одной из конкурирующих моделей. Эпителиальные клетки позвоночных и беспозвоночных тоже выстроились в последовательность, в целом соответствующую известному родству видов.
Это не окончательное «дерево всех клеток», а вычислительная реконструкция, зависящая от исходных данных и выбранного метода. Но она показывает, что общие клеточные программы способны сохраняться на протяжении огромных отрезков эволюции.
ИИ нашел одинаковую работу у непохожих генов
Особенно интересными оказались случаи функциональной конвергенции. Так называют ситуации, когда эволюция разными путями приходит к похожему решению.
В одном из примеров Unify связала человеческий ген HP и мышиный H2-Ab1. Их последовательности слабо похожи, поэтому методы, основанные на обычном поиске родственных генов, вряд ли поставили бы их рядом. Но функциональные описания указывали на сходные роли в защитных и антиоксидантных процессах.
При сравнении нейтрофилов человека и мыши модель нашла целую группу генов без прямых гомологичных пар. Несмотря на разное происхождение, они сходились на функциях, связанных с активностью фосфатаз и уничтожением опасных для организма клеток.
Система обнаруживала и обратные ситуации: внешне похожие гены могли выполнять разную работу. Например, родственные представители семейства C1QTNF сохраняли общее строение белка, но были связаны с противоположными процессами — воспалительными и противовоспалительными.
Именно такие результаты позволяют говорить, что модель стала помогать ученым делать открытия. Она не выдвигала гипотезы по собственной воле, но показывала связи, которые трудно увидеть при прямом сравнении генов.
Реакцию человеческих клеток предсказали по данным мышей
Еще одно испытание было связано с проблемой, важной для медицины. Результаты экспериментов на животных далеко не всегда удается перенести на человека: одинаковое воздействие может запускать у разных видов не совсем одинаковые генетические программы.
Исследователи использовали данные о реакции лимфатических узлов мышей на интерферон бета и попросили Unify предсказать, как на такое воздействие ответят клетки человеческой крови. Нужную реакцию человека исключили из обучения, то есть система работала в режиме zero-shot и не могла просто воспроизвести уже показанный ей ответ.
Когда модель учитывала полный набор генов, а не только прямые соответствия между человеком и мышью, она точнее конкурирующих методов предсказывала общее состояние активности генов. Также она показывала хорошие результаты при определении генов, которые должны усилить или снизить свою работу.
Дополнительные тесты провели на макрофагах. Используя реакцию клеток мыши на бактериальный липополисахарид, система предсказывала ответы клеток крысы, кролика и свиньи. И в этих испытаниях использование полного набора генов повысило точность прогноза.
Это не означает, что модель уже может заменить эксперименты на человеческих клетках или предсказать действие готового лекарства. Пока исследователи проверили ее на конкретных наборах данных и ограниченном числе воздействий. Но работа показывает, как ИИ может помочь переносить результаты между видами точнее, чем простое сопоставление родственных генов.
Что это может изменить в поиске лекарств
Большая часть доклинических исследований проводится на клеточных культурах и животных. Одной из главных трудностей остается вопрос: какая часть полученных результатов сохранится у человека?
Unify предлагает учитывать не только формальное родство генов, но и более широкие функциональные программы клетки. В перспективе это может помочь раньше замечать случаи, когда модельный организм и человек реагируют сходным образом, а когда перенос результата вызывает сомнения.
Авторы связывают развитие подобных систем с созданием предсказательных «виртуальных клеток». Это компьютерные модели, которые должны показывать, как клетка определенного типа изменится после воздействия лекарства, мутации или другого вмешательства.
До полноценной виртуальной клетки еще далеко. Нынешняя версия Unify работает главным образом с данными об активности генов. Она пока не объединяет пространственное положение клеток, эпигенетические изменения и другие слои биологической информации.
У модели остаются ограничения
Точность Unify зависит от качества моделей, на которых она построена, и от полноты описаний функций генов. Хорошо изученные организмы представлены в биологических базах гораздо подробнее, чем редкие виды, поэтому исходные знания остаются неравномерными.
Для обучения система также использует уже существующие обозначения типов клеток. Авторы называют их мягкими ориентирами, а не жесткими правилами, однако полностью независимым инструментом для открытия неизвестных типов клеток модель пока не является.
Есть и технический компромисс. При сравнении близких видов Unify хорошо объединяла клетки с одинаковыми обозначениями, но могла хуже сохранять промежуточные состояния развития. Иными словами, четкая группировка иногда сглаживала тонкие переходы между клетками.
Поэтому результаты модели нельзя воспринимать как готовые биологические доказательства. Найденные связи должны становиться гипотезами для дальнейшей проверки в лаборатории.
Тем не менее сама идея выглядит сильной: вместо того чтобы искать только одинаковые гены, ученые научили систему распознавать одинаковую биологическую работу. Это позволило увидеть общие программы в клетках животных, чьи эволюционные пути разошлись сотни миллионов лет назад, и точнее предсказывать, как реакция одного вида может проявиться у другого.

