Дамп кишечника: как учёные читают микробиом — и зачем (спойлер: чтобы предсказать и вылечить болезни, конечно)

от автора

Внутри нас живет ИИ, который имеет переменные веса, и еще и за вас решает, что вы хотите или не хотите — радоваться, грустить, есть. Это микробиом кишечника. Ученые уже частично научились читать его как большой биологический датасет. Но путь этот тернист, шумен, и имеет те же проблемы что и небиологическая бигдата. 

В статье разберем, как микробиота нами управляет, что она может рассказать о человеке и как исследователи анализируют этот микро-ИИ, который всегда с нами и внутри нас. 

Привет, Хабр!

Что у вас сегодня на завтрак? Что хотите съесть прямо сейчас? А вы уверены, что это ваше желание?

Скорее всего, не совсем. За вас сейчас принимают решение 38 трлн бактерий, живущих в вашем кишечнике. Именно они во многом отвечают за вкусовые пристрастия, тягу к сладкому или жирному, и даже за то, насколько вы тревожны или спокойны прямо сейчас.

Да и почему бы им это не делать, если даже количество бактериальных клеток превышает количество клеток тела. Не в разы, как иногда могут говорить, но разница такая: около 30 трлн человеческих клеток против 38 трлн бактерий. 

Да и взять совокупность генов. В кишечнике человека насчитывается около 3 млн уникальных микробных генов: это примерно в 150 раз больше, чем в нашем собственном геноме. Формально, мы вообще симбиотический организм. И наш большой и страшный симбионт — микробиота — также имеет свое видение, как стоит организму жить и развиваться. 

Конечно, человеку хотелось бы понимать решения и в каком-то смысле быть главнее своего симбионта. Или хитрее. Вдруг он решит вас убить? Эти вопросы стали возникать все чаще на рубеже XX и XXI веков — когда секвенирование подешевело настолько, что микробов стало можно изучать, не выращивая их предварительно в чашке Петри. Появились первые серьезные работы по изучению темы микробиома. Релман и Фальков призвали к «геномному проекту человека» — сплошной инвентаризации генов микробов четырех главных мест колонизации: рта, кишечника, влагалища и кожи. В 2007-м NIH запустил Human Microbiome Project — также направленный на изучение микробиома человека, а в 2010-м вышел первый каталог генов кишечной микробиоты. 

Оказалось, что микробиом имеет огромное влияние на организм. Но чтобы разобраться, как влияют составляющие микробиома вместе и по отдельности, нужно решить множество довольно специфических задач. 

Кто такая эта ваша микробиота? Введение и общие понятия

Когда говорят микробиота, то часто имеют в виду бактерий. А на деле микробиота — это не только бактерии. У нас еще есть археи — древние одноклеточные, которые выделены в отдельный домен жизни и умеют делать то, чего бактерии не могут. Например, производить метан. Да, в человеках. Есть еще грибки, простейшие… Вирусы, которые вообще отдельная вселенная — виром. Нормальную такую долю вирома составляют бактериофаги — вирусы, которые заражают бактерий (да, они тоже болеют). И каждый вносит свой отдельный вклад. 

В общем микробиота — огромная экосистема, со своими взаимодействиями. Много-много различных МИКРОорганизмов. И их контингент зависит от того, какой вы человек. Какого возраста, пола, телосложения, где живете в конце концов. 

Большая часть микробиоты находится в толстом кишечнике — по разным оценкам до 0,5 кг. Так что на весах можете спокойно немного скинуть как погрешность.

Почему, собственно, в кишечнике? Там темно, тепло, нет кислорода, постоянный поток вкусностей — шикарные условия: не говорите, что не хотели бы так же. Кишечная микробиота умеет влиять на организм самым неожиданным, а иногда и довольно жутким образом. Особенно ярко это проявляется в её общении с мозгом. Каналов такой связи несколько, и их мы рассмотрим. 

Ось микробиота-кишечник-мог

Один из них — ось микробиота-кишечник-мозг. Да, кишечник и мозг общаются. Причем в обе стороны, и у этого разговора несколько каналов связи одновременно.

Ось микробиота-кишечник-мозг.  Микробиота посылает сигналы к мозгу, а мозг может и ответить.

Ось микробиота-кишечник-мозг.  Микробиота посылает сигналы к мозгу, а мозг может и ответить.

Первый канал связи — через нервную систему. Способ управления чем-либо с помощью нервов называют иннервацией. У нас внутренности иннервируются блуждающим нервом — он буквально блуждает по всей брюшной полости. Это самый длинный нерв в организме человека. Он ветвится, проникает во все органы в брюшной полости и устанавливает связь между ними и продолговатым мозгом. Как оно работает, думаю, вы понимаете: есть сигнал по нерву — орган реагирует.

Второй канал связи — химическая регуляция. В отличие от нервной, она основана на том, что ткани реагируют на присутствие определённых химических веществ. Например, кортизола. То есть управление кишечником всё равно происходит через его собственные нервы, но они активируются не блуждающим нервом, а химическим веществом.

Представим: что-то случилось с организмом. В ответ происходит выброс химического вещества, которое активирует нейроны, напрягающие мускулатуру кишечника. И внезапно — вам больно, начинаются спазмы. Вдобавок блуждающий нерв может дополнительно иннервировать кишечник, усиливая спазмы. Беда.

Но вы выпили ношпу. В ней есть вещество, которое (если упрощённо) действует в обход нервной системы и блокирует рецепторы сокращения мышц. Всё. Дальше организм, может, и хотел бы продолжить спазмы, и нерв напрягает, но «таблеточные» химические вещества оказались «сильнее» или «быстрее» — и мускулатура расслабляется. 

Третий канал — иммунный. Микробные метаболиты попадают в кровоток и влияют на воспалительные процессы, которые, в свою очередь, влияют на мозг.Иными словами, если вы съедите какую-то гадость с враждебной микрофлорой, то антигены этих бактерий будут всасываться через кишечник, попадут в кровь, и организм решит, что он заболевает. Сработает иммунная система: у вас поднимается температура, начинаются спазмы, уменьшается всасывание воды. Будет диарея. Это специально так происходит, чтобы ограничить поступление гадости в кровь и откачать ее с жидкостями. Поэтому и говорят, что при отравлениях важно много пить. В том числе и для прочистки кишечника от всего плохого. 

Таким образом, мы имеем сложную кибернетическую систему двустороннего влияния. Бактерии воздействуют на кишечник, выделяя вещества, способные проникать в кровоток или нейроны — так кишечник влияет на поведение. В свою очередь мозг регулирует моторику и иммунный ответ кишечника.

Такое устройство — одна из причин, почему когда вы стрессуете у вас возникают проблемы с животиком. Механизм здесь прямолинейный. Кортизол, которого у вас много выделяется при переживаниях, попадает в клетки кишечника. Внутри них он нарушает условия для синтеза серотонина. И вдобавок увеличивает проницаемость кишечника для всякой гадости. Если у вас хронический стресс, то автоматически ухудшается биохимия крови: в неё попадает больше гадости, возникает перегрузка печени (кровь из кишечника идёт сначала именно туда), к тому же в крови становится меньше серотонина, а как следствие — хуже настроение. В то же время если у вас все нормально с настроением, вы вкусно покушаете, то довольны жизнью. 

О чем говорит микрофлора: общие понятия о биомаркерах

Теперь вернемся к разнообразию микробиоты, о котором говорили выше. У нас в своем большинстве там именно бактерии. И 90% их разнообразия — это типы Firmicutes и Bacteroidetes. 

Соотношение между относительным количеством этих бактерий является одним их так называемых биомаркеров.

Биомаркера кого и чего? Что это такое? Биомаркер — это такое состояние системы микробиоты, которое может существовать в заданном состоянии при определенных внешних условиях. Например, во время опытов на мышах, определили, что если у мыши больше Firmicutes, чем других типов бактерий, то, скорее всего, она пухляш. То есть, в данном случае соотношение микроорганизмов будет биомаркером избыточного веса. У человека все, конечно, оказалось сложнее, с большим количеством нюансов, но суть, думаю, уловили.

По населению в экскрементах ученые могут определить не только полноту, но и много еще интересного рассказать, причем такого, что не получается диагностировать другими методами.

Вот у нас есть пухленькая мышь и худая. Пухленькой подсаживают микробиоту худенькой, и та начинает стремительно худеть. При этом она сохраняет ту же диету, тот же объем потребляемых калорий. Это и в обратную сторону работает. К худой подселяют микрофлору пухлого и худая начинает набирать вес, не меняя количество потребляемых калорий. Таким образом мы видим какое значение микробиота оказывает. И это только на примере лишнего веса. Но есть еще много других параметров, которые от этого зависят. Таким образом появилась использовать особенности состава микробиома как маркера концепция  «микроорганизм — маркер».

Как ученые изучают кишечное население

В классической микробиологии есть множество различных интересных методов. 

Обычно работа по изучению какой-то бактерии начинается с ее размножения. Как правило, учёные смотрят на их колонии, а не на отдельные клетки. Происходит это так: берешь образец чего-то, где по твоему мнению есть бактерии, сеешь на питательную среду на чашке Петри или в пробирку (тут, конечно, не обойтись без нюансов), ждешь, пока вырастет колония (потомство от одной клетки), смотришь на нее. Делаешь выводы. Метод, несомненно, рабочий, если организм вообще соглашается расти в лабораторных условиях. А он может и не согласиться. Особенно если это не один отдельный микроорганизм, а их кучка. Самых разных. 

Понимаете в чем дело, жизнь в кале — это целая экосистема. Со своими бактериально-социальными, экологическими и прочими взаимодействиями. И как вы понимаете, если ученые вторгаются в этот мир, то автоматически нарушают в нем многие процессы.

Представьте, что прилетают инопланетяне на наш мир, хотят изучить как взаимодействуют все живые организмы друг с другом. Они собирают всех в своей гигантской пробирке: рыб, китов, кошечек, белого медведя, баобаб возьмут, дождевых червей, людей. И будут смотреть, как мы тут все земляне будем развиваться. Они увидят, что белый медведь сожрет всех и сделают вывод, что планетой правят белые медведи, а баобаб вообще бесполезен, он никого не съел и не двигается. Вот то же самое происходит, если ученые пытаются изучить состав кала стандартными микробиологическими методами. Увы, на чашке Петри работает плохо. 

Большая часть обитателей кишечника против этих всех лабораторий и их методов культивирования. Им нужна конкретная среда: pH, конкретные соседи, конкретный состав газов. То есть — уникальные условия.

Это называется great plate count anomaly — аномалия подсчета на чашках Петри. То есть даже под микроскопом мы увидим гораздо большее разнообразие микробов в образце, чем при культивировании этого же образца. Соответственно и изучим только частично. В общем изучить это можно, но понять как какой вид друг на друга влияет в оригинальном образце уже нельзя. Смоделировать кал в лабораторных условиях нельзя: это сложная композиция, уникальная для каждого конкретного организма. 

Как вообще изучить то, что нельзя вырастить в чашке Петри

И что делать? 

Не будем пытаться ничего выращивать, конечно же!

Возьмем образец. Например, кал. Выделим из образца ДНК все микроорганизмы, которые там обитают. Такая совокупность ДНК называется метагеном. А наука, которая изучает совокупность ДНК — метагеномика. 

Поставили памятник метагеномике. Хоть где-то уважают этот великий раздел науки (с) Labrats (шутка, это памятник читосу в Канаде)

Поставили памятник метагеномике. Хоть где-то уважают этот великий раздел науки (с) Labrats (шутка, это памятник читосу в Канаде)

Метагеномный образец — по сути биологический дамп оперативной памяти: учёные взяли слепок всего, что было в системе в конкретный момент времени.

Чем это лучше? А тем, что если инопланетяне так сделают, то ДНК белого медведя не сожрет других уже. Уже можно делать какие то выводы не на основе конкурентной борьбы живых организмов. Вот тут у нас то же самое. Ученым проще проанализировать ДНК всех организмов в кале, чем анализировать непосредственно эти организмы. 

На самом деле ученым известно, как у бактерий отличается ДНК. Или как ее отличить. Зная особенности каждого, легко можно разобрать в общей куче всех ДНК, кто же там находится. Более того, мы можем даже приблизительное количество посчитать.

На удивление или нет, подход более чем успешен. Первый крупный метагеномный каталог кишечника опубликовали сразу в Nature еще в далеком 2010 году, его получили от 124 добровольцев и вытащили те самые 3 млн уникальных генов, как и говорилось в кате. Вот вам и big data с одного конца тела. 

Но данные получить это классно, можем и дальше их в табличках и файлах оставить. А для настоящего ресерча нужно их как-то обработать.

И как обработать?

Итак, у нас есть образец кала и гигабайты сырой ДНК. 

Здесь начинается биоинформатика: о ней уже писалось много статей на Хабре (тут, тут, тут), и сразу с развилки.

Есть два подхода с принципиальным различием по цене, глубине и силе боли в разных точках тела. Зависит от того, как данные получали. 

Примечание автора: здесь секвенирование и выбор метода — неотъемлемая часть биоинфы, ибо от выбора метода секвенирования зависит вся дальнейшая обработка на комплюктерах. 

Первый подход — 16S рРНК секвенирование 

Помним что такое рибосомы? Это органоиды, которые делают белок. У нас в клетках есть ДНК, из ДНК специальные ферменты делают функциональную копию в виде РНК, а РНК идет в рибосомы, где собирается белок. 

Рибо сома… 

Рибо сома… 

Такие органоиды есть у всех живых организмов на земле. Другими словами, рибосома — это производственный конвейер со станками ЧПУ, сваркой, сушкой, покраской и всем сразу. В него загружают код с управляющей программой, а он вытачивает детали, варит их, красит и делает все что нужно, согласно коду РНК. 

И как вы понимаете, этот станок тоже собирается по своим чертежам. Один из них хранится в гене 16S. Этот ген — консервативный, то есть схожий у всех организмов. Он редко накапливает мутации, поскольку  это может привести к жесткой поломке. Другими словами, станок, который делает белки, имеет очень тонкие настройки: чуть их изменил, и всё — производственная линия ложится. Поэтому организмы особо внимательно следят за генами, которые кодируют работу рибосом.

Тем не менее, в гене 16S есть небольшие вариабельные участки, которые отличаются у разных видов микроорганизмов. Это как если бы станки по одним и тем же чертежам собирали в разных странах. Принцип работы один, но мелкие детали, окраска или надписи будут разными. По этим «национальным» особенностям можно примерно понять, откуда станок. Точно так же по вариабельным участкам 16S мы можем определить, кто живёт в образце. Берём праймеры под эти участки, секвенируем  и получаем список обитателей. Дёшево, быстро, понятно.

Что понимается под праймерами? Праймер — это комплементарный участок короткой ДНК к более длинному куску. Если мы такой праймер добавим в огромную массу других ДНК, то наш праймер найдет только ту последовательность, для которой он создан. Например, если мы хотим подтвердить, есть ли в метагеноме ДНК кишечной палочки, то мы подсовываем синтезированную нами искусственным образом специальную последовательность ДНК, которая свяжется с вариабельным участком гена рРНК кишечной палочки. А как только он свяжется, то мы можем его размножить настолько, что при добавлении красителя буквально увидим эту ДНК. Если же ДНК кишечной палочки там не будет, то праймер не найдет ее, ДНК не размножатся и краситель не сработает.

Золушка — это кишечная палочка, вы — принц, а праймер — ее туфелька. Думаю поняли, да?) 

Целевые ДНК размножили и далее их секвенируют. Т.е прочитывают, какие нуклеотиды в ДНК. Полученные данные далее прогоняют через R-пакет с алгоритмом удаления шума, который можно запускать самостоятельно ( DADA2), или через аналитическую платформу с набором плагинов (QIIME 2). 

Далее нам данные нужно обработать, разберем по порядку. 

Убираем шум в ридах. Риды (по-другому их называют чтениями) — это последовательность нуклеотидов, которую секвенатор определяет для одного короткого фрагмента ДНК. Попросту строчка из букв A, T, G и C. Важно, что рид — это  не сама молекула, а машинное прочтение. И там, конечно, есть ошибки. Условная очепятка, слияние текста и т. д.

Сырые риды грязные, и не готовы к анализу. Где-то произошли ошибки при размножении, где-то секвенатор неправильно считал нуклеотид, где-то получилась химера (гибрид двух разных ДНК). DADA2 строит модель ошибок конкретно для этого прогона секвенатора (какие замены чаще случаются, как часто и при каком качестве рида), а потом статистически отделяет реальную последовательность от похожей на последовательность. Вероятностная модель, что сказать. 

Классифицируем по базе, например, SILVA. На руках набор точных последовательностей, но без названий,  просто буквы ATGC (ну вообще в виде AAAGGGTCCCTAG). SILVA — это база данных, где собраны миллионы 16S-последовательностей с уже известной таксономией, какой бактерии какая последовательность принадлежит. Классификатор сравнивает наш ASV с этой базой и присваивает наиболее вероятную метку. Загвоздка та же, о которой уже писали выше: разрешение 16S невысокое, поэтому уверенно опознать обычно получается только до уровня рода, реже до вида, и почти никогда до штамма.

На выходе получаем feature table. И вот тут все неожиданно превращается в обычную табличку.

Образец 1

Образец 2

Образец 3

ASV_001 (Bacteroides)

1204

890

15

ASV_002 (Faecalibacterium)

56

1100

980

ASV_003 (Escherichia)

3

0

412

Строки — уникальные последовательности (ASV), столбцы — образцы, значения — сколько ридов этой последовательности нашли в этом образце. Привет, Google Sheets! 

Еще раз. Это самое 16S-секвенирование позволяет определить какой-то определенный конкретный признак конкретного микроорганизма. Это относительно дешевый метод, но он создает много шума. Если у нас образец с бактериями имеет доминирующий вид, и мы его ищем, то метод работает хорошо, если же есть распределение доминирующих видов и т.п., то уже нужно использовать что-то другое.

Второй подход — Shotgun-метагеномика (WGS)

Если 16S — это определение японца по разрезу глаз, то шотган — это чтение паспорта. Берем образец и секвенируем абсолютно всю ДНК, которая там есть, случайными короткими фрагментами по 100–300 нуклеотидов. Никакого выбора генов, никакой амплификации конкретных участков, только чтение всего подряд, только хардкор. На выходе, соответственно, получаем миллионы, сотни миллионов коротких ридов, которые ничего не значат. Теперь задача — собрать из обрывков что-то осмысленное.

Контроль качества и предобработка

Инструмент FastQC проверяет качество каждого рида (нет ли мест, где секвенатор был не уверен в прочитанном нуклеотиде, нет ли обрезанных или слишком коротких фрагментов). Риды с плохим качеством либо обрезают, либо выкидывают целиком. После этого KneadData убирает из данных человеческую ДНК. Звучит странно, учитывая что мы анализируем бактерий, но в образце кала всегда присутствуют и собственные клетки человека. Например, эпителий кишечника, иммунные клетки. Если их не отфильтровать, заметная часть ридов и вычислительных ресурсов уйдет на то, чтобы заново собрать геном владельца образца, а не его микродрузей.

Таксономия — сопоставление прочитанного с базой

Дальше идет таксономия — определение, какой именно организм перед нами (вид, иногда штамм и другие). Здесь конкурируют два принципиально разных подхода.

Первый вариант — MetaPhlAn, он работает через маркерные гены. У инструмента заранее есть своя база. Для каждого известного вида подобран небольшой набор уникальных участков генома, которые встречаются только у этого вида и почти ни у какого другого. Метод ищет в ридах именно эти маркеры. Быстро и здорово, но если вид не попал в базу маркеров, инструмент его просто не увидит. 

Второй вариант это — Kraken2 + Bracken работают грубее и шире. Каждый рид режется на короткие перекрывающиеся кусочки фиксированной длины под названием k-меры (по сути, то же самое, что n-граммы в обработке текста), и каждый такой кусочек сверяется с гигантской базой из тысяч целых геномов. Метод дает больше ложных совпадений, чем MetaPhlAn, зато покрывает на порядок больше организмов, включая те, для которых нет собранной маркерной базы. Другими словами это что-то вроде DPI при анализе пакетов данных. Только у вас не https запросы, а ATGAATATAG. 

Ну и конечно по точности лучше использовать MetaPhlAn. 

Ну вот мы прочитали метагеном. А что дальше? 

Функциональная аннотация

Знать, кто здесь живет, это круто не круто, потому что ничего вам не дает. Если только, вы не знаете значение того, что там живет. 

Инструмент HUMAnN берет все те же  данные и сопоставляет их с базами метаболических путей. Например, этот бактерий может синтезировать витамин. А этот — расщеплять жирные кислоты. Имея такие знания, уже будет проще и интереснее разбираться в том, насколько рискованно иметь таких сожителей

Сборка и MAGs

Самый тяжелый по вычислениям этап — попытка теперь собрать из обрывков что-то цельное. MegaHit или SPAdes склеивают перекрывающиеся риды в более длинные куски под названием контиги, примерно как текстовый файл восстанавливают из множества фрагментов по совпадающим краям. Дальше Anvi’o или MetaBAT2 раскладывают контиги по группам, формируя черновики геномов отдельных организмов (MAGs, metagenome-assembled genomes).

Вот так. Если вы осилили чтение досюда, то мы с вами наконец дошли до реконструкции генома тех микроорганизмов, которых хотели вырастить! И здесь мы близки как никогда к полному геному каждого отдельного организма. И ничего не пришлось выращивать в чашке Петри. 

Образцов становится много

Раньше исследования микробиома были довольно скромными: несколько десятков человек, и готово. Гонять обработку одиночно, последовательно или параллельно было ок. А сейчас все изменилось.

Что все же изменилось и зачем оно так сделало? Еще 40 лет назад люди боялись всего того, что связано с ДНК примерно так же сильно, как сейчас многие боятся ИИ. Собственно боятся потому, что ИИ выйдет из под контроля и убьет всех людей. Так и тогда боялись, что эксперименты над ДНК приведут к созданию неведомо и непонятно чего с неясными последствиями вывода из под контроля своих собственных генов. Даже в 1974 года (письмо Берга в Science) ученые добровольно самоорганизовались и самоограничили работу с ДНК. Тогда технологии редактирования генома только набирали силу, и ученые из осторожности ввели такие ограничения. Правда уже в следующем году они были сняты в рамках Асиломарской конференции. И далее, с развитием новых методов молекулярной биологии скорость новых открытий стала расти геометрическими темпами. И в этом всем есть еще одно сходство с современным ИИ. Какое спросите вы?

ИНФОРМАЦИЯ!!! Да! Как сейчас качество данных влияет на качество моделей при обучении, так и в области молекулярной биологии данные о генах, их функциях, метаболических путях, взаимодействиях между организмами, генами и т.п. является топливом для этого направления. 

И знаете, что интересно. Биологии, молекулярные биологии как бы занимаются разметкой. Только если специалисты в IT размечают датасеты для подготовки весов, биологи занимаются сопоставлением ДНК с процессами в организме.

Чтобы получить больше данных биологи постоянно придумывают, где эти данные можно взять. Например проект American Gut Project — открытая платформа для исследования микробиома кишечника — собрал более 10 тысяч образцов от обычных людей со всего мира. Любой мог отправить свой образец и узнать, что у него внутри. А дальше только по нарастающей. 

Сейчас в Bioconductor — проект (пакет с пакетами) с открытым исходным кодом для анализа и понимания геномных данных — есть пакет curatedMetagenomicData, где собраны сотни публичных датасетов в удобном виде. Биокондуктор — это пакет на R. А R — это отличный язык программирования, отлично подходящий для статистической обработки. Ну правда о том, насколько это язык, идут споры. Тем не менее хорошая часть биоинформатики идет на R. 

Теперь мы работаем с тысячами и десятками тысяч образцов, терабайтами данных и миллиардами последовательностей. Это уже настоящий big data, со всеми вытекающими.

И конечно вылазит большая проблема. 

Когда данные из разных лабораторий не хотят дружить

Если вы пытаетесь объединить результаты разных исследований, вас быстро ждет разочарование — батч эффект. Этот эффект возникает, когда небиологические факторы в эксперименте вызывают изменения в данных, полученных в результате эксперимента. 

По сути, это то же самое, когда в разных лабах использовали один и тот же алгоритм обучения, но данные при подготовке обучающих датасетов сделаны по разному. Только в случае с биологическими лабами это происходит так.

Лаборатории используют разные протоколы выделения ДНК, разные праймеры, разные секвенаторы. В итоге два одинаковых микробиома, проанализированные в разных местах, могут выглядеть совсем по-разному. 

Такие технические смещения легко принять за биологические различия. И радостно побежать публиковать статьи. Или на основе результатов создавать общие клинические рекомендации. Но, благо, есть такой критерий как воспроизводимость. И то, что может красиво выглядеть на одном датасете полностью размажется о другой. 

Что делать с батчем

Тулы, тулы, инструментики любимые. Конечно, изобретать интересные вычурные пайплайны и инструменты приходится до сих пор, но уже есть готовые решения.Например, ComBat и MMUPHin

Первый работает через эмпирический байесовский подход, т.е. предполагает, что разные признаки (гены,а касаемо микробиологии — таксоны) переживают батч-эффект похожим образом, и использует эту общую информацию, чтобы стабильнее оценить и вычесть систематический сдвиг каждого батча. Но есть нюанс: инструмент не учитывает особенности микробиологических данных (обилие нулей в таблицах, сами данные композиционной природы и прочее). Второй инструмент уже заточили под микру, и он эти нюансы учитывает. 

Ну и вместо того чтобы сваливать все в одну кучу (мета-анализ), часто анализируют каждое исследование отдельно, а потом объединяют результаты. Плюс, конечно, нужна обязательная валидация на независимых когортах. одна красивая картинка на 500 образцах уже никого не удивит, так студенты на первом курсе развлекаются. Ну и после того как поборолись с батчем и пришли к какому-никакому результату, можно переходить к более интересным экспериментам.

Машинное обучение на микробах

У нас есть данные, пайплайны, нормализованные матрицы. Теперь самое интересное: а можно ли по микробиому предсказать болезнь?

Да, вполне, смотря какую. Относительно успешные кейсы такие.

Колоректальный рак. Мета-анализ на 969 образцах кала из нескольких стран показал воспроизводимые микробные маркеры рака толстой кишки, а предсказательные модели, обученные на нескольких датасетах, стабильно показывали высокую точность на данных, не участвовавших в обучении. Результаты  сопоставимы с тестом на скрытую кровь в кале, который сейчас используется для скрининга. Причем микробиом рассказывает не только о том, какие бактерии живут в кишечнике, но и о том, чем они заняты и какую работу выполняют. Задачи при развитии онкологии заметно меняются. Усиливается переработка белков, при этом в результате могут появляться побочные вещества, которые токсичны для кишечника. Одновременно с этим ослабляется переработка клетчатки, из которой как раз бактерии могут производить соединения для защиты кишечника.

Болезнь Паркинсона. Здесь история особенно интересная. Желудочно-кишечные симптомы встречаются более чем у 80% пациентов с болезнью Паркинсона и могут предшествовать появлению двигательных симптомов на годы, а иногда и на десятилетия раньше. То есть изменения в микробиоме — потенциально один из самых ранних маркеров нейродегенерации, который образуется задолго до того, как невролог вообще поставит диагноз. 

Механизм возникновения заболевания объясняет гипотеза Браака. Специальный белок (маркер) α-синуклеин (точнее, его “неправильная”форма) по Брааку сперва появляется в энтеральной нервной системе кишечника и только потом по блуждающему нерву добирается до мозга. 

α-синуклеин — это обычный белок нервных клеток, он есть у всех и в норме помогает нейронам общаться между собой. Проблема начинается, когда молекула такого белка “складывается” неправильно. Испорченная молекула становится “липкой” и начинает слипаться с другими в комки. Эти комки накапливаются внутри нейронов, мешают им работать, и в конце концов, убивают клетку.

Одна неправильно свернутая молекула работает как дурной пример. Она заставляет соседние, здоровые молекулы тоже сворачиваться неправильно, по типу того, как ведут себя прионы. 

В мозге эти комки особенно быстро выкашивают нейроны в маленькой области, которая производит дофамин. Когда таких нейронов гибнет достаточно много, и появляются знакомые всем симптомы Паркинсона: дрожь, скованность, замедленность движений.

Диабет 2 типа. Один из первых примеров, где метагеномный подход дал клинически значимый результат: у пациентов с диабетом выявилось снижение бутират-продуцирующих бактерий и повышение оппортунистических патогенов. 

Звучит как будущее медицины. Но пора разочароваться. Проблема оказалась в том, что модель обучали на когорте датчан. Применяли на датчанах. все супер. Потом перевели на когорту из Китая, и все порушилось.Потому что в рамках особенностей диеты, образа жизни и пр. разных народностей кишечники с микробиотой тоже различаются. И факторы вроде транзитного времени кишечника и ИМТ объясняли различия между датчанами и китайцами лучше чем различия между больной / здоровый. 

И покатаю на эмоциональных качелях. Направление НЕ тупиковое. нужно больше данных, возможно, другой уровень сложности моделей. 

Какие кейсы уже используют на практике? 

Самый воспроизводимый кейс — тот самый колоректальный рак. Все потому что на разных географиях и разных национальностях все стабильно отработало. Но здесь и выборка была большая и разнородная.

Второй рабочий кейс — трансплантация фекальной микробиоты при инфекции C. difficile. Кал полон микроорганизмов. У каждого человека набор в кале разный. Ученые, конечно, подумали, а что если микроорганизмы от здорового передать больному. Он выздоровеет? В общем, да, кал тоже пересаживают. Через прием капсул ртом. Ну или через анальное отверстие.  В общем тема отдельной статьи. Здесь данные анализа микробиома впервые прошли полный путь от секвенирования до одобрения регулятором. FDA одобрило два препарата на основе донорского микробиома, и в клинических испытаниях рецидив инфекции снизился с 40% до 12%. 

И все. Модели в клинику конвертиться не хотят. Снова повторение — что работает на одних, абсолютно не применимо на других. И есть научные шарлатаны, что тоже может осложнять развитие такого направления науки. Например стартап uBiome, который поднял больше $100 млн при оценке около $600 млн, обещая ставить диагнозы по анализу микробиома на дому. В 2019-м все закончилось рейдом ФБР и банкротством. тесты продавали (иногда повторно одни и те же под давлением) и выставляли счета страховым как нечто гораздо более клинически обоснованное, чем было на самом деле. 

И напоследок. 

Мы пытаемся читать геном целого города, жители которого постоянно переезжают, меняются и не говорят на одном языке. Инструменты уже есть. Данных тоже завались. Методов, которые с этим надежно справляются, пока условно и на вырост. Но именно это и делает работу с микробиомом одной из самых интересных вычислительных задач. Да и важна эта задача. Вдруг в один день микробиота решит, что человек ей больше не нужен?)


НЛО прилетело и оставило здесь промокод для читателей нашего блога:
-15% на заказ нового VDS — HABRFIRSTVDS.

ссылка на оригинал статьи https://habr.com/ru/articles/1067728/