AdaptiveFlow: как ИИ-платформа ускоряет поиск лекарств и снижает затраты на облака в 1000 раз
По данным EurekAlert!, исследователи из St. Jude Children's Research Hospital, University of Pavia, Dana-Farber Cancer Institute и Harvard Medical School представили открытую платформу AdaptiveFlow…

По данным EurekAlert!, исследователи из St. Jude Children's Research Hospital, University of Pavia, Dana-Farber Cancer Institute и Harvard Medical School представили открытую платформу AdaptiveFlow, которая позволяет виртуально тестировать миллиарды молекул-кандидатов в лекарствах и сокращает вычислительные затраты в 1000 раз по сравнению с существующими подходами. Для команд, которые упираются в cloud budget при ML-нагрузках, это редкий случай, когда академический проект сразу даёт измеримую экономию и линейное масштабирование — кейс стоит разобрать на инженерном уровне.
Архитектура платформы: от молекулярной сетки к докингу
В основе AdaptiveFlow лежит 18-мерная сетка, где каждое измерение отвечает за конкретное свойство молекулы — например, молекулярную массу. Это позволяет не перебирать всю библиотеку вслепую, а заранее выбирать химически разнообразные подмножества для более глубокого скрининга. На результатах этого прескрининга обучается ML-модель, которая отбирает самых перспективных кандидатов и отправляет их на финальный докинг — платформа поддерживает более 1500 протоколов. Идея в том, чтобы основной объём вычислений приходился не на дорогостоящий докинг, а на дешёвый отбор, и именно здесь выигрывается кратный порядок затрат.
Самое интересное с инженерной точки зрения — линейное масштабирование до 5,6 миллиона виртуальных процессоров без потери эффективности коммуникаций. Соавтор работы Кристоф Горгулла из St. Jude в разговоре с EurekAlert подчёркивает: большинство ПО теряет коммуникационную эффективность при росте числа CPU, но в AdaptiveFlow масштабирование остаётся линейным даже на миллионах ядер.
Что это меняет в экономике скрининга
Главный сценарий, который пересобирает платформа, — ultra-large скрининг. Раньше такие задачи были разовыми и неподъёмными по бюджету: одна попытка прогнать миллиарды соединений стоила столько, что её могли позволить себе единичные лаборатории. Сейчас команда AdaptiveFlow заявляет о возможности обработать до 69 миллиардов молекул — это крупнейшая на сегодняшний день библиотека, готовая к докингу. На уровне процесса это значит меньше ручного отбора, более качественные хиты на входе и экономию месяцев работы команды на этапе оптимизации молекулы.
В качестве proof of concept исследователи нашли сильные ингибиторы для двух мишеней — PARP1, давно известной противораковой мишени, и FSP1, белка-супрессора ферроптоза, связанного с выживанием раковых клеток. По каждой из них ранее было известно мало ингибиторов. Результат опубликован в Nature Biotechnology и прошёл peer-review.
Точки трения при адаптации подхода
Прежде чем закладывать внедрение в roadmap, реалистично оцените три точки трения.
Первая — порог входа. Платформа заточена под команды с опытом в вычислительной биологии и молекулярном моделировании. Без специалиста по моделированию и data-инженера, который собирает инфраструктуру, эффект не раскроется: получите очередной инструмент, а не работающий процесс.
Вторая — лицензия и поддержка. Open-source снижает стоимость входа, но поддержка сообщества — это не то же, что SLA коммерческого вендора. Заложите в сценарий время на собственную команду сопровождения, иначе любой апдейт в продакшене превратится в авральный спринт.
Третья — измерение эффекта. Прогоните пилот на небольшой библиотеке и сравните качество хитов с текущим процессом. Метрика здесь не сколько молекул обработано, а сколько часов работы команды сэкономлено на оптимизации — именно это покажет реальный тайм-ту-маркет.
В остатке: AdaptiveFlow — не волшебная кнопка, а хорошо собранная инженерная система, снимающая конкретное узкое место — стоимость облачных вычислений в drug discovery. Если команда упирается в cloud budget при ML-нагрузках, стоит разобрать архитектурные решения, которые позволили команде Горгуллы получить линейное масштабирование на миллионах ядер.