Джон Джампер: почему после AlphaFold следующий вызов — предсказывать не структуры, а сам эксперимент

В 2020 году на конкурсе CASP14 случилось то, во что мало кто верил: алгоритм предсказал трёхмерные структуры белков с точностью, практически неотличимой от результатов дорогих экспериментальных методов. Задача, над которой биология билась полвека, получила рабочее решение. Его автор — Джон Джампер, руководитель команды AlphaFold в Google DeepMind, — четыре года спустя встал на сцену в Стокгольме за Нобелевской премией по химии. Но в самой интересной части этой истории есть парадокс: человек, решивший «невозможную» задачу, первым говорит, что решена лишь её половина. Структура белка — это фотография. А биология — это кино. И теперь Джампер хочет, чтобы машина предсказывала не кадр, а сюжет: свяжется ли молекула с мишенью, сработает ли лекарство, что покажет эксперимент, который ещё никто не поставил.

Полвека в тупике

Белки — главные рабочие молекулы жизни: ферменты, антитела, рецепторы, транспортёры. Что делает белок, определяется его формой, а форма — тем, как длинная цепочка аминокислот складывается в компактную трёхмерную структуру. Проблема в том, что вариантов сворачивания астрономически много, и предсказать итоговую форму по последовательности аминокислот казалось почти безнадёжным делом. Экспериментальные методы — рентгеноструктурный анализ, криоэлектронная микроскопия — работают, но требуют месяцев или лет на один белок и серьёзных денег.

С 1994 года раз в два года проходит CASP — «олимпиада» предсказания структур, где участникам выдают последовательности белков с ещё неопубликованными структурами. Десятилетиями прогресс был медленным. В 2020-м AlphaFold 2 под руководством Джампера достиг медианной точности, сопоставимой с экспериментальной. Организаторы конкурса констатировали: задача в её практической постановке решена.

Важно понимать, что именно произошло. AlphaFold не «симулирует физику сворачивания» — он выучил закономерности из сотен тысяч известных структур и огромных массивов генетических последовательностей, находя эволюционные подсказки: какие участки белка менялись согласованно, значит, находятся рядом в пространстве. Это статистический подвиг на данных, накопленных структурной биологией за десятилетия, — а не машина, которая «поняла» белок.

База на 200 миллионов

Следующий шаг DeepMind был не менее значимым, чем сам алгоритм. В 2021 году компания совместно с Европейским институтом биоинформатики EMBL-EBI открыла AlphaFold Protein Structure Database — бесплатную базу предсказанных структур. Сегодня в ней более 200 миллионов белков, что покрывает практически все известные науке последовательности, и ей пользуются миллионы исследователей по всему миру.

Эффект оказался тихим, но массовым: аспирант в лаборатории без крио-ЭМ-микроскопа получил рабочую гипотезу о структуре своего белка за минуты. Базу используют для поиска мишеней лекарств, изучения механизмов устойчивости к антибиотикам, дизайна ферментов, разлагающих пластик. За это в 2024 году Джампер и глава DeepMind Демис Хассабис получили Нобелевскую премию по химии — вместе с Дэвидом Бейкером, чья лаборатория научилась проектировать белки «с нуля». Премия за метод — редкий случай, когда Нобелевский комитет фактически признал инструмент, а не открытие.

Фотография против кино

Но тут начинается то, о чём Джампер говорит снова и снова в лекциях и интервью: статичная структура — это не функция. Зная форму белка, вы не знаете, как он движется, какие конформации принимает в работе, как быстро связывается с партнёрами и как отпускает их. Белок в клетке — не статуя, а механизм: он дышит, изгибается, переключается между состояниями. Многие важные события — открытие активного центра фермента, связывание лекарства — происходят именно в движении.

Сам Джампер формулирует следующий рубеж так: модели должны предсказывать исход эксперимента. Не «как выглядит комплекс», а «свяжется ли эта молекула с этим белком и насколько крепко», «как мутация изменит активность фермента», «будет ли кандидат в лекарства токсичен». Это качественно другая задача. Геометрия — статика; аффинность связывания, кинетика, активность — это энергетика и динамика, тонко зависящие от условий: температуры, pH, присутствия мембраны, других молекул.

Разница в сложности — не количественная, а структурная. Для обучения AlphaFold существовала огромная, относительно чистая база экспериментальных структур. Данных по аффинности и активности на порядки меньше, они разрознены, измерены в разных условиях и часто противоречат друг другу. «Виртуальный эксперимент» упирается не в умность алгоритма, а в дефицит хороших данных.

Что AlphaFold не умеет — и об этом честно говорят

К достоинству команды Джампера — она не преувеличивает. Ограничения модели известны и задокументированы.

Первое: внутренне неупорядоченные регионы. Значительная часть белков вообще не имеет фиксированной структуры — они работают как гибкие цепи. AlphaFold выдаёт для них предсказания с низкой уверенностью, что корректно как сигнал «не знаю», но не даёт ответа о функции.

Второе: мутации. Модель слабо предсказывает, как замена одной аминокислоты повлияет на стабильность белка, — а это ключевой вопрос и для генетики болезней, и для инженерии ферментов.

Третье: среда. AlphaFold предсказывает структуру «в вакууме» — без мембраны, без учёта pH, без клеточного контекста. Мембранные белки, рецепторы, зависящие от липидного окружения, предсказываются с оговорками.

И главное: даже идеально предсказанный комплекс «лекарство + мишень» не говорит, сработает ли препарат в организме. Между связыванием в пробирке и клиническим эффектом — пропасть из фармакокинетики, токсичности и биологии целого организма, где исторически проваливается большинство кандидатов.

AlphaFold 3: шаг к комплексам

В мае 2024 года DeepMind представила AlphaFold 3 — и это уже другая архитектура. Вместо специализированной системы для белковых цепей — диффузионная модель, та же семья методов, что породила генераторы изображений, но работающая с координатами атомов. Она предсказывает совместные структуры белков с ДНК, РНК, малыми молекулами и ионами — то есть не отдельные молекулы, а их взаимодействия. По опубликованным данным, точность предсказания контактов белок–лиганд заметно превзошла классические методы молекулярного докинга.

Это реальный шаг к предсказанию эксперимента — но именно шаг, а не прибытие. Модель предсказывает, как молекула сядет на белок, а не насколько крепко и не с каким биологическим эффектом. Аффинность и активность остаются за пределами её надёжных возможностей.

Отдельная история — доступ. Поначалу AlphaFold 3 был доступен только через веб-сервер с ограничениями на число запросов и типы молекул, что вызвало резкую критику научного сообщества: для инструмента, за который дана Нобелевская премия, закрытость выглядела отступлением от принципов открытой науки. Под давлением DeepMind в ноябре 2024 года открыла код и веса модели — правда, только для некоммерческого использования. Параллельно появились открытые альтернативы: репликация OpenFold и модель Boltz-1 из MIT, которая воспроизводит возможности AlphaFold 3 в полностью открытом виде. Конкуренция открытых моделей — возможно, самый здоровый эффект этой полемики.

Лекарства на конвейере?

Коммерческое крыло этой истории — Isomorphic Labs, «дочка» Alphabet во главе с тем же Хассабисом, применяющая модели семейства AlphaFold к дизайну лекарств. Компания заключила крупные партнёрства с Eli Lilly и Novartis — сделки с потенциальным объёмом в миллиарды долларов. Это серьёзная ставка фармы на то, что предсказательные модели сократят самый дорогой этап — поиск и оптимизацию молекул-кандидатов.

Здесь нужна трезвость. Ни одно лекарство, спроектированное с помощью этих моделей, пока не одобрено регуляторами; программы Isomorphic находятся на ранних стадиях. Модель может сэкономить годы на поиске попаданий и оптимизации, но клинические испытания — с их токсичностью, метаболизмом и человеческой биологией — никуда не денутся. Обещание «лекарства за месяцы вместо лет» в том виде, как его иногда подают, — это маркетинг, а не факт. Реалистичная оценка: ускорение ранних этапов и снижение числа мёртвых веток.

Что дальше: от структуры к поведению

Логика дальнейшего пути вырисовывается так. Сначала — надёжное предсказание взаимодействий: не только геометрия, но сила связывания. Затем — динамика: ансамбли конформаций, переходы между состояниями, кинетика. Затем — контекст: белок в мембране, в клетке, в ткани. Каждый уровень на порядок сложнее предыдущего и требует данных, которых пока не существует в нужных объёмах.

История Джампера поучительна именно своей честной асимметрией. Он решил задачу, которую считали неподъёмной, — и тем самым получил право точно сказать, где проходит граница решённого. «ИИ предсказал все белки» — правда. «ИИ понял биологию» — нет. Между этими фразами — вся следующая декада науки: научить машины предсказывать не то, как молекулы выглядят, а то, как они себя ведут. И судя по тому, как Джампер формулирует эту цель, он уже работает над ней — с ясным пониманием, что на этот раз полувека ждать не придётся, но и лёгкой прогулки не будет.