Обучение LLM — это в первую очередь инфраструктурная задача: нужен пайплайн, который можно перезапускать с новыми данными, архитектурой или другим расписанием обучения и получать повторяемый внутри команды результат. В этом материале — рассказ команды обучения и инференса моделей RWB о том, как мы с нуля, без загрузки pretrained-весов, обучили текстовую модель на основе гибридной архитектуры Qwen3.5-2B-Base и какие выводы сделали по пути — от сборки датасетов до чтения графиков онлайн-оценки. Читать далее
Привет, Хабр! Меня зовут Владимир, и я давно хотел погрузиться во вселенную Warhammer40K. Для погружение во вселенную я решил обучить LLM на лоре Warhammer40K. И чтобы было интереснее, код этой LLM я решил написать сам, на голом pytorch (ну почти).Данная статья - первая в цикле статей по созданию и обучению GPT-like LLM с нуля. В них я постараюсь рассказать, как работают Decoder-only модели, как обучить небольшую LLM, сколько это заняло у меня времени. Читать далее
Вот уже несколько месяцев мы встречаемся, общаемся, работаем и учимся в онлайне гораздо больше, чем делали это ранее. Раз кто то учится значит кто-то, неизбежно, обучает. Как это происходит? Какие сложности, проблемы и возможности дает нам обучение людей чему-то в формате онлайн? Причем речь идет не только про онлайн-вебинары в режиме реального времени, но и про скринкасты и книги в том числе. Обо всем этом и появилась идея провести онлайн-митап под названием “Худобедно учим онлайн”. Читать дальше →
Business Intelligence (BI) находит применение в самых разных сферах, в том числе, например, при анализе результатов бенчмарков. Часто возникает задача сравнения производительности двух версий приложения на основе результатов бенчмарков (время выполнения тестов для нескольких прогонов и…