Как собрать собственную визуально-языковую модель с нуля, имея ограниченный бюджет и одну арендованную GPU? Автор эксперимента взял небольшую языковую модель, подключил к ней визуальный энкодер и прошёл весь путь обучения VLM – от настройки архитектуры до оценки качества ответов. В статье – разбор решений, ошибки первых запусков и результаты модели на 628 млн параметров, которая научилась описывать изображения примерно за $200. Смотреть результат
Я обучил небольшую языковую модель, которая отвечает на дореформенном русском как человек из XIX века. Рассказываю, как подготовил данные, собрал синтетический корпус, обучил tiny-LLM и опубликовал её в виде чат-бота. Читать далѣе
Вот среднегодовые вложения в IT нескольких крупнейших европейских банков: BNP Paribas — $7,1 млрд HSBC — $6,0 млрд Societe Generale — $4,7 млрд Deutsche Bank — $4,5 млрд UBS — $3,5 млрд Barclays — $3,5 млрд RBS — $2,9 млрд Credit Suisse — $2,9 млрд Commerzbank — $1,4 млрд Это затраты как на собственные IT-отделы, так и на приобретение…
DeepSeek V4 Pro — это 1,6 триллиона параметров, mixture of experts (MoE), 49 млрд активных параметров и контекст в 1 миллион токенов. V4 Flash — рабочая лошадка: 284 млрд параметров суммарно, 13 млрд активных. Обе модели обучены примерно на 33 трлн токенов. На агентских бенчмарках кода, MMLU Pro, GPQA Diamond, SWE-bench…