Фарма — индустрия с долгими циклами, сложными процессами и высокой ценой ошибки. Это особенно видно на пути разработки препарата: от поиска перспективной молекулы и доклинических исследований до нескольких фаз клинических испытаний, регистрации и вывода на рынок. В среднем разработка одного препарата занимает 10-15 лет и стоит порядка 1-2 млрд долларов, а из кандидатов, дошедших до клинических исследований, девять из десяти не доходят до регистрации1.
Мы не будем писать текст в жанре «внедрили AI → стало лучше». Таких материалов на Хабре уже много, и ввиду распространённости и повального культа AI они могут не вызывать доверия. Нам интереснее показать, что меняется в самой логике работы фармы на конкретных примерах.
1. Как AI ускоряет разработку лекарств
Самый тяжелый этап разработки — начало. Прежде чем препарат дойдет до клинических исследований, нужно выбрать биологическую мишень, найти молекулы-кандидаты, проверить их активность и свойства с помощью скрининговых тестов и расчетных моделей, а затем постепенно сузить круг до тех соединений, которые есть смысл изучать дальше2.
На практике это похоже на воронку: сначала нужно оценивать большие библиотеки соединений, а затем, когда остаются наиболее перспективные кандидаты, переходить к более точным, дорогим и трудоемким экспериментам. В этом процессе скорость имеет значение: чем раньше удается отсеять слабые гипотезы, тем меньше ресурсов уходит на проверку кандидатов, которые с высокой вероятностью не дойдут до следующих этапов2.
Пространство возможных молекул настолько огромно, что классический перебор не работает.
Что меняется на практике:
-
молекулы кодируются как графы или последовательности;
-
модели предсказывают их свойства;
-
кандидаты ранжируются по вероятности «сработать».
То есть мы больше не ищем одну «лучшую» молекулу — мы оцениваем вероятность того, что она сработает. Это позволяет быстрее отбрасывать слабые гипотезы и сокращать число экспериментов.
Мы используем knowledge graphs, объединяющие геномные, клинические, молекулярные и safety-данные. Поверх графов работают графовые нейросети (Graph Neural Networks), которые помогают находить неочевидные связи3.
Из конкретного: в январе 2021 года в R&D-портфель компании вошёл первый drug target, найденный с помощью AI в партнёрстве с BenevolentAI (мишень для лечения хронической болезни почек). Позже из этой же коллаборации в портфель добавились и другие AI-таргеты2.
2. От клинических исследований до диагностики: как это устроено на практике
Сначала пара слов про специфику. Клинические исследования (КИ) — это многолетние, строго регламентированные испытания препарата с участием пациентов, разбитые на фазы, с жесткими требованиями к безопасности, дизайну и отчётности. Именно здесь цена ошибки особенно высока, а любые изменения процесса должны проходить через регуляторные требования 4.
Модели помогают прогнозировать отклик пациентов и делать дизайн исследований более точным, не заменяя врача и не ломая существующие процессы.
Например, FDA прорабатывает подходы к использованию AI на отдельных этапах ранних клинических исследований — для ускорения решений «go / no-go» и мониторинга испытаний в реальном времени (один из пилотов идёт с участием AstraZeneca и Amgen). Речь не о замене классических процедур, а о том, чтобы сделать их быстрее и точнее. Пока это не массовая практика, но вектор показывает, куда движется индустрия 5.
Изменения происходят не только на этапе клинических исследований. AI применяется также и на ранних стадиях разработки препаратов: появляются кейсы, ещё недавно казавшиеся невозможными. Самый известный — разработка кандидата для лечения идиопатического лёгочного фиброза: мишень TNIK нашли с помощью AI, молекулу тоже сгенерировали алгоритмы. От идентификации мишени до преклинического кандидата прошло 18 месяцев, и синтезировать пришлось меньше 80 соединений. Обычно на этом этапе счёт идёт на тысячи молекул и на несколько лет 6.
Это не отраслевая норма, а единичный случай. Но он показывает, насколько быстро может идти разработка, когда AI встроен в процесс с самого начала.
Интересно, что конкурентное преимущество в таких историях — не сами модели, а данные. Точнее обработанные данные: не сырые датасеты, которые есть у всех, а данные, прошедшие несколько циклов очистки, валидации, обогащения и переработки через собственные алгоритмы. Именно этот слой делает данные уникальными и воспроизводимыми.
Способность работать с данными и превращать их в новые научные знания играет важную роль в современной фармацевтической разработке. Развитие data science и AI становится одним из факторов, который позволяет ускорять R&D-процессы и повышать их эффективность 7.
Помимо клинических исследований и ранних этапов разработки препаратов, хочется упомянуть применение AI в диагностике. При участии «АстраЗенека» в Санкт-Петербурге и Нижнем Новгороде были запущены пилотные проекты, где AI используется как вспомогательный инструмент анализа КТ-снимков. Это не замена врача: модель работает «вторым контуром» и помогает повысить эффективность диагностики рака лёгкого примерно на 10% 8.
Логика везде одна: модель обрабатывает данные, решение принимает человек. Но чтобы модель вообще появилась, кто-то должен построить под неё пайплайн обработки данных. В фарме этот слой обычно остаётся внутри компании — и это одна из причин, почему исследования так медленно воспроизводятся. Мы часть своих инструментов открываем.
У глобальной «АстраЗенека» есть публичная страница на GitHub — это более 100 open-source проектов в области data science, биоинформатики и AI. Это не демо-репозитории, а инструменты, выросшие из реальных задач: обработки научных данных, моделирования молекул и автоматизации исследований.
Один из таких проектов — СellAtria — расскажем про него подробней и в картинках.
3. Как работает CellAtria
СellAtria — это open-source агентная AI‑система, которая обеспечивает полностью автоматизированный цикл работы с данными в single‑cell исследованиях: от документа до финального анализа.
Она объединяет взаимодействие на естественном языке с мощным графовым фреймворком исполнения, основанным на мультиагентной архитектуре. Система оркестрирует разнообразные задачи — от парсинга научной литературы и извлечения метаданных до поиска датасетов и последующего анализа scRNA-seq с использованием совместно разработанного пайплайна CellExpress.
Через единый интерфейс CellAtria позволяет пользователю работать с языковой моделью, расширенной специализированными инструментами. Это устраняет необходимость ручной работы через командную строку, ускоряет загрузку данных и упрощает повторное использование публичных single‑cell ресурсов.
Ключевая идея: пользователь формулирует задачу на естественном языке, после чего LLM-агент интерпретирует запрос, вызывает необходимые инструменты и последовательно выполняет pipeline анализа.
Запустить агент CellAtria можно всего за три шага:
-
Открыть терминал
-
Загрузить преднастроенный Docker‑образ (в котором уже есть все необходимые зависимости)
-
Запустить контейнер, указав путь к файлу с учётными данными для выбранного LLM‑провайдера
Такой минималистичный setup обеспечивает единообразное выполнение в любой среде — будь то ноутбук, рабочая станция или HPC‑кластер. При этом пользователю не нужно вручную управлять зависимостями и конфигурациями.
Несмотря на гибкость взаимодействия с системой, работа CellAtria опирается на чёткий сценарий исполнения — последовательность модульных шагов, определяющих, как задачи интерпретируются, маршрутизируются и выполняются.
Пользователь может запускать отдельные модули независимо, однако для получения наилучшего результата рекомендуется следовать заложенному workflow.
Внутренняя логика CellAtria включает несколько ключевых этапов:
● Парсинг документов (Document Parsing)
Извлечение структурированных метаданных из научных публикаций (PDF или URL)
● Определение accession‑идентификаторов (Accession Resolution)
Поиск релевантных GEO‑идентификаторов на основе извлечённых данных
● Загрузка датасетов (Dataset Retrieval)
Автоматическое скачивание данных из публичных репозиториев
● Организация файлов и данных (File & Data Organization)
Приведение данных к единой структуре директорий для дальнейшего анализа
● Конфигурация пайплайна (Pipeline Configuration)
Подготовка параметров и аргументов для запуска CellExpress
● Запуск CellExpress (CellExpress Execution)
Старт стандартизированного пайплайна анализа single‑cell данных в фоновом режиме
Такой модульный, агент‑ориентированный подход позволяет стартовать с любого этапа, сохраняя логическую целостность всего процесса.
CellExpress — встроенный в CellAtria пайплайн, обеспечивающий воспроизводимый и автоматизированный анализ данных single‑cell RNA‑seq: от сырых матриц счётов (raw count matrices) до аннотаций типов клеток и финальных отчётов.
Он снижает порог входа в биоинформатику за счёт готового стека на базе Scanpy, включающего:
● контроль качества данных,
● нормализацию, отбор высоковариабельных генов и масштабирование,
● снижение размерности (UMAP, t‑SNE),
● графовую кластеризацию,
● поиск маркерных генов.
Дополнительно поддерживаются более сложные задачи: детекция doublet‑клеток, batch‑коррекция и автоматическая аннотация клеток (с универсальными и тканеспецифичными моделями).
Все этапы выполняются последовательно под централизованным управлением, с полной настройкой через единую конфигурацию.
CellExpress можно использовать как отдельно (через CLI), так и внутри CellAtria — в составе агентного pipeline.
CellAtria спроектирована с учётом требований индустрии — воспроизводимости, прозрачности происхождения данных и работы с регулируемыми средами (human‑in‑the‑loop), при этом на уровне реализации это обеспечивается через Docker‑образ с изолированной Ubuntu‑средой, предустановленными зависимостями (Python, R), инструментами визуализации и отчётности, а также всем необходимым для сквозного выполнения аналитического пайплайна.
Поскольку CellAtria работает с регулируемыми источниками данных, система изначально учитывает требования этики и compliance: она сохраняет информацию о происхождении данных (репозитории, издатели, конфликты интересов), а для работы с чувствительными наборами использует Docker‑среду с воспроизводимым и аудируемым запуском (в том числе GxP‑совместимым). При этом контроль остаётся за пользователем и организацией — платформа не обходит лицензии и доступы, а агентная автоматизация усиливает, но не заменяет человеческое участие (human‑in‑the‑loop).
4. Как AI ускоряет бизнес-процессы «АстраЗенека» в России
Локальные AI-проекты «АстраЗенека» в России и Евразии связаны прежде всего с данными. Часть процессов уже опирается на цифровые инструменты, где-то планируется использование математических моделей и AI, но самый заметный эффект сегодня в операционных процессах.
Так, мы разрабатываем и используем AI-агентов для проверки медицинских материалов: это автоматизация рутинных проверок, ускорение согласований и снижение количества ошибок.
AIRIS 2.0 и работа с корпоративными знаниями
Объём данных в фарме настолько велик, что работать с ними без собственной инженерной команды уже сложно. Внутри нашего российского подразделения выросло направление Data & Digital: с 2024 года команда увеличилась в 3,5 раза, сегодня это около 190 человек — DevSecOps, Data & BI, Innovations & AI, Commercial IT, Digital, SFE & Multichannel, Digital Transformation и Project Management Office. Что делает каждое направление, коротко описали в примечаниях.
В современной фарме IT-системы влияют на скорость и качество бизнес-процессов, а значит, косвенно и на продукт. Работа с информацией у нас всегда связана с внутренними процедурами, контрольными мерами и требованиями к качеству, проверяемости и документации. Поэтому AI здесь — часть IT-системы, и внедрять его нужно аккуратно.
Наши команды ежедневно работают с большим объёмом документов: научные и медицинские публикации, внутренние регламенты, презентации, отчёты, таблицы, методические рекомендации, результаты исследований. Часть из них хорошо структурирована, но многое приходит в неудобном для машины виде — сканы, сложные PDF, смешанные презентации, изображения, многостраничные материалы. Особенно сложны большие таблицы и смешанные страницы, где смысл зависит не только от текста, но и от структуры: строки, столбца, заголовка, единицы измерения, подписи к рисунку. Если эту структуру потерять, документ можно формально «прочитать», но понять неправильно.
Отсюда выросла AIRIS 2.0 — наша внутренняя система работы с корпоративными знаниями. Сотрудник задаёт вопрос на естественном языке и получает ответ, основанный на содержании внутренних документов, структурированных и неструктурированных. Система показывает, из каких именно источников взята информация.
Прозрачность здесь принципиальна. Нельзя полагаться на убедительность и «красоту» ответа: пользователь должен понимать, откуда взялась формулировка, и иметь возможность вернуться к первоисточнику.
Задача была двойной: с одной стороны, научить систему «переваривать» документы любой сложности и давать точные ответы. С другой — там, где это уместно, снизить общее количество сложных документов в обороте.
AIRIS — только один слой. Опора на одну универсальную систему, которая должна знать всё и одинаково хорошо отвечать на любые запросы, со временем создаёт узкие места: в производительности, в точности, в масштабируемости. Поэтому мы смотрим в сторону мультиагентного подхода, где модель-оркестратор направляет запрос к подходящему инструменту или специализированному агенту в зависимости от задачи. Такая логика позволяет расширять функциональность постепенно, по мере роста требований.
Следующий этап — научить систему не только отвечать на single- и multi-hop вопросы, но и выполнять многошаговые задачи за счёт более тесной интеграции с корпоративными системами и источниками данных.
Специализированные агенты у нас уже работают. Один из них отвечает за доредакторскую проверку материалов — этап, который традиционно отнимает у специалистов из разных отделов много времени. Агент действует по правилам, согласованным командами, и финальных решений не принимает: human-in-the-loop здесь принципиален. Это сокращает время на первичные проверки и первые согласования, снижает риск пропустить типовую ошибку и сохраняет полный контроль над содержанием.
5. Как AI ускоряет производство (опыт производства «АстраЗенека» в Калужской области)
Если разработка и клинические исследования — это про скорость поиска решений, то на производстве AI решает другую задачу: помогает обеспечивать качество в среде, где каждый шаг регламентирован.
На заводе «АстраЗенека» в Ворсино Калужской области искусственный интеллект внедряется в работу всех сотрудников для регулярного сбора, обработки, передачи и анализа данных. Особую роль он играет в отделе обеспечения качества (ООК), помогая специалистам ежедневно справляться с отклонениями, расследованиями и большими объемами документации.
Специфика здесь в том, что фармпроизводство работает по стандартам GMP, и к AI в таких процессах предъявляются жёсткие требования. Модель не может быть «чёрным ящиком»: она должна фиксировать, какие параметры повлияли на результат, сопровождать прогноз метрикой уверенности и работать с данными по принципам целостности (ALCOA++) с полным аудиторским следом. Данные для обучения и для тестирования модели строго разделяются, а сами разработчики обучающей выборки не участвуют в её проверке.
И главный принцип — human-in-the-loop: AI остаётся вспомогательным инструментом, а все критические выводы проходят оценку и надзор специалиста.
Чтобы это работало системно, на площадке выстроена не просто пара инструментов, а целая рамка: корпоративные политики по управлению AI, единый реестр AI-решений, оценка рисков и зрелости, а также пятиуровневая система обучения сотрудников — от базового понимания AI (чтобы снять страхи и сформировать спокойное отношение) до уровня бизнес-партнёра, который способен перестраивать процессы на основе данных.
На практике в ООК внедряется несколько AI-ассистентов.
1. Первый помогает оценивать повторные отклонения: он автоматически находит похожие события за последние 12 месяцев, ранжирует совпадения и сразу даёт переход к связанным записям CAPA — то, что раньше требовало ручного поиска, теперь становится объективным и быстрым.
2. Второй проверяет качество самих расследований: оценивает, насколько описание отклонения соответствует требованиям СОП, насколько оно полное, и выдаёт рекомендации по доработке с разбивкой по баллам.
3. Третий работает с документами — приводит СОП и рабочие инструкции к корпоративным шаблонам, улучшает читаемость, сравнивает версии и переносит документы из старого шаблона в новый.
4. Четвёртый отвечает на вопросы по документации: сотрудник спрашивает, например, как провести очистку линии или калибровку весов, а ассистент находит нужную процедуру и указывает конкретные страницы.
Пример использования AI-ассистента для оценки повторных отклонений:
1. Пользователь указывает номер отклонения и запускает оценку на повторное отклонение

2. Ассистент обрабатывает, анализирует данные по отклонениям в системе и генерирует детальный отчет с оценкой сходства

3. Пользователь анализирует полученный результат, проводит финальную проверку и делает вывод о наличии повтора

Пример использования AI-ассистента для проверки отклонений
-
Пользователь выбирает отклонение и запускает проверку

2. Ассистент обрабатывает описание отклонения и оценивает текст на соответствие СОП и генерирует детальный отчет

3. Пользователь анализирует подсказки, проводит экспертную оценку и принимает окончательное решение об одобрении записи

Отдельный слой — поддержка пользователей и работа со знаниями. AI ассистенты берут на себя ответы на типовые вопросы, помогают ориентироваться в системах и находить нужные процедуры.
На текущий момент на заводе в Ворсино уже запущен в продуктивную эксплуатацию СОП ассистент — инструмент, который осуществляет поиск информации в документации и сразу возвращает не только ссылку на документ, но и конкретную страницу, где находится нужная информация.
Параллельно начинается подготовка Авто‑скрайбера — решения, которое позволит обрабатывать документы и приводить их к единому корпоративному стандарту без ручной доработки.
В результате опытные специалисты экономят до 40% рабочего времени на рутинных задачах — и это время перераспределяется в пользу более сложной аналитической работы.
Есть эффект и на уровне операционной деятельности: быстрый доступ к регламентам и помощь в применении процедур на практике даёт дополнительное повышение эффективности примерно на 5% за счёт снижения задержек и ошибок в повседневной работе.
Пример использования AI-ассистента для работы с базой знаний
1. Пользователь создает новый запрос, что необходимо найти в документации

2. Ассистент предлагает документы и ссылки на них

3. Автоматическое открытие документа при нажатии на ссылку в системе документации
Во всех случаях логика одна и та же: ассистент обрабатывает запрос и готовит детальный результат, но финальное решение — повтор это или нет, одобрить запись или нет — всегда остаётся за человеком.
Эффект уже измерим. По оценкам площадки:
до 40% рабочего времени опытных специалистов экономят AI-ассистенты, отвечая на типовые вопросы и снимая с экспертов стандартные задачи;
≈30% трудозатрат сокращает проверка документации за счёт автоматического анализа и выявления несоответствий;
≈5% прибавляет эффективность работы с процедурами, благодаря быстрому поиску нужных регламентов.
В сумме это высвобождает время специалистов для более сложных и приоритетных задач при росте точности и скорости рутинных операций.
6. Что такое программа AI30
Все эти инструменты — не разрозненные инициативы. Их объединяет программа AI30 — сквозной слой нашей стратегии до 2035 года.
Раньше путь разработки лекарств выглядел так: гипотеза → эксперимент → вывод.
Сейчас он постепенно меняется: гипотеза → модель → отбор → эксперимент. AI30 запущена для того, чтобы перестроить процессы вокруг данных и моделей: цель — делать ключевые этапы быстрее, точнее и эффективнее на 30% и более.
Главный эффект AI30 не в автоматизации, а в том, где принимается решение. Идея простая: максимум решений принимать на уровне моделей, до того как начинаются дорогие эксперименты.
Чтобы это работало не только на бумаге, нужна инфраструктура. Например, шведский консорциум с участием глобальной «АстраЗенека» (вместе с Ericsson, Saab, SEB и Wallenberg Investments) строит крупную AI-фабрику на базе вычислений NVIDIA, а сама NVIDIA открывает в Швеции свой первый Центр технологий искусственного интеллекта9.
Для нас эта инфраструктура станет вычислительной и инженерной базой для ускорения поиска и разработки новых молекул.
7. Коротко о главном
В начале статьи мы упомянули, что девять из десяти кандидатов, дошедших до этапа клинических исследований, не проходят весь путь до регистрации лекарственного препарата. Эта цифра не изменится к следующему году. Но меняется то, где именно эти девять отсеиваются: раньше это происходило в лаборатории, теперь всё чаще в расчёте, до того как начнутся дорогие эксперименты.
В этой статье AI побывал в четырёх ролях. В ранней разработке предсказывал мишени по графам знаний. В биоинформатике собирал пайплайн анализа single-cell данных — CellAtria, который мы выложили в открытый доступ. В клинических исследованиях уточнял дизайн, а в регуляторной среде попал в пилот FDA. На заводе в Ворсино проверял отклонения и вернул специалистам до 40% рабочего времени.
Роли разные, принцип один: human-in-the-loop. AI ускоряет путь к решению, но не принимает его сам: ни в агентной системе, ни в ассистенте на производстве. Последнее слово остаётся за человеком.
Программа AI30 в этом контексте есть попытка перестроить логику работы системно, от разработки до операционки. И вопрос уже не в том, нужен ли AI, а в том, кто быстрее встроит его в реальные процессы — мы или кто-то другой.
Примечания:
Команда Data & Digital в «АстраЗенека», Россия и Евразия представлена направлениями:
DevSecOps — инфраструктура, frontend- и backend-разработка, CI/CD, мониторинг жизненного цикла ПО и облачных сред, информационная безопасность.
Commercial IT — цифровые системы для автоматизации внутренних процессов, интеграция корпоративных систем, поддержка полевых и офисных команд.
Data & BI — сбор и систематизация внутренних и внешних данных, отчётность и аналитика, управление бонусной схемой, работа с новыми источниками данных.
Innovations & AI — AI-продукты и RAG-системы, развитие компетенций в области нейросетей, governance применения AI внутри компании.
Digital — цифровая экосистема в сфере здоровья: сервисы и контент для пациентов, врачей и фармацевтов, цифровой маркетинг.
SFE & Multichannel — персонализированные каналы коммуникации с медицинскими специалистами, инструменты полевых команд, аналитика покрытия, операционное управление колл-центром.
Digital Transformation — оценка эффекта цифровых инициатив, повышение цифровой зрелости, внутренние коммуникации по трансформации, Digital-бренд.
PMO — портфель проектов D&D, agile-культура, управление изменениями.
Глоссарий:
AI — искусственный интеллект (русское обозначение ИИ).
КИ — клинические исследования.
КТ — компьютерная томография.
ООК — отдел обеспечения качества.
СОП — стандартная операционная процедура (англ. SOP).
AI (Artificial Intelligence) — искусственный интеллект.
AI30 — программа/миссия AstraZeneca по применению AI как сквозного слоя стратегии до 2035 года
AIRIS — внутренняя AI -платформа российской AstraZeneca.
ALCOA++ — набор принципов целостности данных (Attributable, Legible, Contemporaneous, Original, Accurate и расширения) в регулируемых GxP-средах.
CAPA (Corrective and Preventive Actions) — корректирующие и предупреждающие действия (система управления качеством).
CLI (Command-Line Interface) — интерфейс командной строки.
FDA (Food and Drug Administration) — Управление по санитарному надзору за качеством пищевых продуктов и медикаментов (США).
GEO (Gene Expression Omnibus) — публичный репозиторий геномных данных.
GMP (Good Manufacturing Practice) — надлежащая производственная практика.
GNN (Graph Neural Networks) — графовые нейронные сети.
GxP — обобщённое обозначение «надлежащих практик» (GMP, GCP, GLP и др.).
HPC (High-Performance Computing) — высокопроизводительные вычисления.
IQ/OQ/PQ (Installation/Operational/Performance Qualification) — квалификация монтажа, функционирования и эксплуатации (валидация систем).
IT (Information Technology) — информационные технологии.
LLM (Large Language Model) — большая языковая модель.
NVIDIA — компания-производитель вычислительных решений (имя собственное, не аббревиатура).
PDF (Portable Document Format) — формат документов.
RNA (в тексте scRNA-seq, single-cell RNA sequencing) — секвенирование РНК единичных клеток.
TNIK (TRAF2- and NCK-interacting kinase) — киназа-мишень препарата рентосертиб.
UMAP / t-SNE — методы снижения размерности данных (визуализация многомерных данных).
ссылка на оригинал статьи https://habr.com/ru/articles/1078636/