Быстрое обучение, экономия ресурсов и другие преимущества сетей эхо-состояний

от автора

Существует класс рекуррентных нейросетей, в котором обучается только линейный выходной слой, а внутренняя структура (резервуар) остаётся фиксированной. Отсюда появилось название более общего подхода — «резервуарные вычисления».

Такая архитектура делает нейросети крайне быстрыми и энергоэффективными, но сложными в настройке. Поэтому они пока не получили широкого распространения и долгое время оставались в тени более универсальных архитектур.

Сотрудник отдела перспективных исследований компании «Криптонит» Илья Андросов провёл глубокий сравнительный анализ архитектур и методов обучения сетей эхо-состояний (Echo State Networks, ESNs). Автор выполнил обзор ряда известных ESNs и для некоторых из них предложил модификации, существенно улучшившие их основные характеристики.

Почему ESNs так ценны?

В отличие от сетей других распространённых архитектур (LSTM, трансформеры), ESNs обладают рядом преимуществ:

  1. Они не требуют десятков тысяч эпох обучения. Выходной слой обучается за один проход (offline) или пошагово (online) за несколько десятков или сотен шагов, что можно использовать для обучения в реальном времени.

  2. Так как резервуар не обучается, то можно для нескольких задач использовать один резервуар, отличие будет только в дешёвом выходном слое.

  3. ESNs более «прозрачны». В них можно анализировать, какие части резервуара отвечают за какие частоты сигнала, что критично в медицине и финансах для объяснения прогноза регуляторам.

  4. Резервуар куда проще реализовать физически (например, на FPGA), чем классическую нейросеть, так как резервуар не обучается.

  5. ESNs устойчивы к шуму. Фиксированный резервуар действует как нелинейный фильтр, сглаживая выбросы.

Рис. 1. Схематическое изображение ESN, иллюстрирующее входной слой с сигналом p(t), резервуар с состоянием x(t) и выходной слой y(t), соединённые через входные веса W_in и W_out

Рис. 1. Схематическое изображение ESN, иллюстрирующее входной слой с сигналом p(t), резервуар с состоянием x(t) и выходной слой y(t), соединённые через входные веса W_in и W_out

Энергоэффективность ESNs позволяет внедрять их в маломощные устройства (датчики, периферийные контроллеры) для прогнозирования отказов оборудования, мониторинга процессов в реальном времени, реализуя методику edge-computing.

Графовая память

Автор вводит понятие графовой памяти (Graph Memory) для сетей эхо-состояний и формулирует её свойства. В ESN она обеспечивает способность запоминать прошлые сигналы за счёт задержек распространения сигнала по графу. Разная длина путей заставляет нейроны воспринимать сигнал в разные моменты времени. Это решает проблему отсутствия пространственно-временной привязки в классических ESNs, добавляя в систему естественные временные метки, «вшитые» в структуру связей.

Концепцию графовой памяти иллюстрирует рис. 2., показывающий зависимость задержек распространения сигнала от топологии графа.

Рис. 2. Ориентированный граф связей ESN, демонстрирующий графовую память. В нём вершины – это нейроны, а рёбра – ненулевые веса в матрице связей. Вершины помечены кратчайшими расстояниями от выбранной начальной вершины с индексом «0».

Рис. 2. Ориентированный граф связей ESN, демонстрирующий графовую память. В нём вершины – это нейроны, а рёбра – ненулевые веса в матрице связей. Вершины помечены кратчайшими расстояниями от выбранной начальной вершины с индексом «0».

Графовая память улучшает способность сети разделять похожие входные сигналы, поступающие в разное время, без потери нелинейной динамики. С графовой памятью можно эффективнее моделировать распространение волн, химические реакции, нейродинамику и другие сложные процессы, сохраняя низкие вычислительные затраты. 

Также графовая память не требует дополнительной настройки весов и возникает из самой топологии. Используя графовую память, разработчик может получить более точный прогноз, затрачивая меньше ресурсов на симуляцию.

Главный результат

Автор сравнил разные методы обучения, как оффлайновые (гребневая регрессия, QR-разложение, SVD, усечённое SVD), так и онлайновые (RLS-FORCE и LMS-FORCE). Дополнительно в статье сравниваются разные архитектуры резервуаров: классические ESNs, их версии с непрерывным временем (ESNs DE), модели с задержками, нейрополевые модели Амари и Нуньеса, системы «реакция-диффузия» и один нейрон с запаздывающей обратной связью.

В задаче прогнозирования хаотического временного ряда, описываемого уравнением, Макки–Гласса лучшей оказалась архитектура ESN с кососимметрической матрицей весов (ESN skew) в сочетании с алгоритмом RLS-FORCE. Она дала минимальную ошибку (NRMSE ~0.066 на 400 шагов). Почти так же точно, но с дополнительными бонусами (масштабируемость, наглядность, встроенная графовая память) выступила модель Neural Field (NF) skew.

Выводы

Выполненная работа даёт чёткие сравнительные характеристики и содержит экспериментальные результаты, что экономит время и ресурсы других исследователей на выбор архитектур и подбор гиперпараметров. 

Проведённый анализ показывает, что наиболее перспективными ESNs являются конструкции, которые порождают несинхронизированные колебания и включают графовую память. В частности, архитектура нейронного поля (skew) продемонстрировала конкурентоспособную производительность, предлагая при этом ряд дополнительных преимуществ. 

Главное преимущество резервуарных вычислений состоит в том, что резервуары не нужно обучать. Процесс обучения затрагивает только выходной слой. Он выполняется на порядки быстрее и дешевле, чем при использовании нейросетей классической архитектуры. 

Способность улавливать сложную, изменяющуюся во времени динамику на которую влияет большое число  не измеряемых непосредственно факторов, в том числе с элементами хаотического поведения, используется для раннего обнаружения рыночных аномалий, в краткосрочном прогнозировании нагрузки на электросети, для оптимизации транспортной логистики, прогнозирования оставшегося ресурса оборудования и предотвращения аварий, в раннем предсказании аритмий и эпилептических приступов, прогнозировании эпидемий, обнаружении DDoS-атак и множестве других сценариев, сводящихся к анализу изменчивых временных рядов.

Подробнее читайте в научной статье Ильи Андросова «Сравнительный анализ методов обучения и архитектур Echo State Networks» (PDF на русском языке).

ссылка на оригинал статьи https://habr.com/ru/articles/1072416/