В современных нейросетях, включая LLM на базе Transformer, стандартом стали неограниченные функции активации — ReLU и GELU. Их основное преимущество, хорошая проходимость градиентов и быстрое обучение глубоких моделей.Однако на практике наблюдается проблема: при появлении доминирующих…
В статье я рассказываю о LTanh — функции активации, которая сохраняет форму Tanh, но решает проблему затухающего градиента. Показываю, как пришёл к формуле, вывожу производную и сравниваю её с Tanh в точках 0–5. В хвостах LTanh даёт в 150–850 000 раз больший градиент, оставаясь ограниченной и гладкой. Читать далее
В машинном обучении и нейронных сетях слои активации играют очень важную роль в процессе обработки данных. В этой статье мы рассмотрим, что такое слои активации, как они работают и как выбрать наиболее подходящий слой для вашей задачи.Что такое слои активации?Слои активации -…
Знакомые с нейронными сетями читатели скорее всего слышали про термин «функция активации». Такие варианты функции активации, как сигмоида, гиперболический тангенс (TanH) и ReLU (линейный выпрямитель), активно применяются в нейронных сетях и широко известны энтузиастам,…