Некоторые люди предпочитают пользоваться не только облачными сервисами, но и запускать LLM у себя дома. Например, так можно запустить дообученные модели без цензуры, или не посылать в облако свои личные документы. А то и запускать бесчеловечные эксперименты над LLM так, чтобы…
Локальный запуск больших LLM быстро упирается в память: веса не помещаются, оффлоад режет скорость, а красивые бенчмарки мало говорят о реальной нагрузке. Разбираем эксперимент с Kimi K3 на 2,8 трлн параметров и смотрим, как MoE, квантование, стриминг и иерархия памяти меняют пределы потребительского железа. Читать далее
На прошедшей неделе вышло сразу несколько новых Open Source LLM. Разбираемся, что в них особенного, а также как и зачем их запускать локально. Читать далее
По ощущениям, на Хабре одна группа пользователей пользуется LLM локально, а другая - через внешние API. А третья еще не определилась, и у неё периодически возникают следующие вопросы:- Что будет, если запускать LLM на CPU вместо GPU? Сильно упадет скорость?- А как это от размера модели…