Про архитектуру Mixture of Experts (MoE) слышал каждый, кто следит за ML: Mixtral и DeepSeek доказали эффективность динамического роутинга. Но пока индустрия осваивает базовый MoE, появилось его прямое продолжение под названием MoVA. В статье разберем: как устроен классический MoE, что именно MoVA меняет в механизме внимания, чем это архитектурно отличается от MoE, и как это все выглядит на конкретной модели, с цифрами, бенчмарками и первыми независимыми обзорами. Читать далее
Когда я пишу новости про ИИ, то часто сталкиваюсь с проблемой: они пестрят техническими терминами, которые не всегда понятны даже людям использующим ИИ регулярно. SFT, MoE, RL/RLHF/DPO, миллионы их.Я захотел описать самые популярные термины простым русским языком, чтобы каждый, даже…
Архитектура Трансформеров уперлась в стену квадратичной сложности O(n²), или «Тиранию Квадрата». В статье мы разбираем два пути решения этой проблемы: Mixture-of-Experts (MoE), масштабирующий знания, и State Space Models (SSM), масштабирующий контекст. Это сравнительный анализ архитектур, которые определяют будущее AI. Читать далее
11 декабря 2023 года Mistral AI, парижский ai-стартап, основанный 7 месяцев назад, выпустил новую модель Mixtral 8x7B – high-quality sparse mixture of experts model (SMoE). Многие считают модели Mistral AI самыми крутыми из открытых llm-ок, я тоже так считаю, поэтому интерес к новой модели есть большой. В этой статье я хочу…