Рекуррентные нейронные сети (RNN) служат архитектурной основой для последовательной обработки данных, однако они испытывают серьезные трудности при моделировании долгосрочных зависимостей. В основе этой неудачи лежит проблема исчезающего градиента, которая...
Введение в RNN и проблему исчезающего градиента
Рекуррентные нейронные сети (RNN) служат архитектурной основой для последовательной обработки данных, однако они испытывают серьезные трудности при моделировании долгосрочных зависимостей. В основе этой неудачи лежит проблема исчезающего градиента, которая возникает во время обратного распространения ошибки во времени (BPTT). Поскольку стандартные RNN полагаются на многократное умножение матриц через временные шаги, градиенты часто затухают экспоненциально, эффективно «забывая» информацию из более ранних входных данных.
Особенность
Стандартный РНН
Закрытые архитектуры (LSTM/GRU)
Градиентный поток
Мультипликативный
Присадка/закрытый
Долговременная память
Бедный
Прочный
Стабильность тренировок
Низкий
Высокий
Математическая нестабильность возникает из-за того, что градиент функции потерь включает в себя произведение весовых матриц; если собственные значения меньше единицы, градиент исчезает, в результате чего веса в начальных слоях обновляются незначительно. Чтобы решить эту проблему, LSTM и GRU вводят сложные механизмы шлюзования. Упрощая аддитивный градиентный поток, эти архитектуры сохраняют сигналы ошибок в более длинных последовательностях, обходя ограничения чисто мультипликативных обновлений. Понимание этих ограничений очень важно