Последние новости в сфере ИИ намекают на важный сдвиг: локальный запуск очень больших моделей уже не выглядит чистой фантастикой. В этой статье я разбираю две технологии — Bonsai и TurboQuant, — которые бьют по двум главным ограничениям инференса: размеру весов и объёму KV-cache. А затем прикидываю, что будет, если однажды их удастся объединить и масштабировать до моделей уровня 235B. Читать далее
Корпус — алюминий, цвета — графит, коричневый. Двойной плафон из стекла. Внешний — прозрачный с линейным рельефным рисунком. Внутренний — белый глянцевый рассеиватель. Модели мощностью от 12Вт до 20Вт — предназначены для основного освещения. LED-источник света, цветовая температура — 3000К. Высокая степень защиты — IP65. Аксессуар Technical TRX034DR4-200B Вес 0.3800 Высота 42 Длина 330 Код поставщика […]
Google Research выпустили TurboQuant - новый алгоритм сжатия данных, который сокращает объём кэш-памяти LLM как минимум в 6 раз и даёт ускорение до 8 раз. При этом заявляется отсутствие потерь в точности, что напрямую влияет на эффективность работы ИИ. Читать далее
В этой статье я расскажу, как запустить Bonsai-27B на обычной видеокарте и как мой форк llama.cpp делает модель умнее прямо на инференсе. Показываю реальный тест: на одной и той же задаче базовая модель зависла и не смогла решить, а рекуррентная довела до ответа. Объясняю, что происходит внутри, сколько это стоит по скорости, и даю команды, чтобы повторить всё у себя на железе. Ну давай посомтрим