Мощная видеокарта не всегда означает быстрый локальный запуск LLM. Разбираемся, почему GPU может простаивать, как на производительность влияют память, KV‑кэш и движок инференса, и что учитывать перед сборкой собственного стенда. Разобраться в LLM
Геймеры, играющие в 4К-игры, энтузиасты генеративного ИИ и все, кто работает с крупными LLM-моделями, всё чаще сталкиваются с серьезным ограничением — недостаточным объемом видеопамяти. Даже топовые игровые видеокарты с 24 ГБ VRAM не всегда справляются с тяжелыми задачами. Почему же до сих пор нет игровой видеокарты с 48 ГБ памяти? В статье разбираемся, что мешает запустить такие карты в серию и, главное, стоит ли вообще ждать их появления. Читать далее
Некоторые люди предпочитают пользоваться не только облачными сервисами, но и запускать LLM у себя дома. Например, так можно запустить дообученные модели без цензуры, или не посылать в облако свои личные документы. А то и запускать бесчеловечные эксперименты над LLM так, чтобы…
На прошедшей неделе вышло сразу несколько новых Open Source LLM. Разбираемся, что в них особенного, а также как и зачем их запускать локально. Читать далее