Встала задача - срочно за вечер решить практический вопрос: какой квант ставить на карту и нужна ли мне RTX5090 домой (спойлер: нет, 9B и Q5/Q6 и я буду счастлив). Прогнал 18 конфигураций по схеме - три модели, пять-шесть квантов на каждую, один и тот же набор из 22 реальных задач. Читать далее
Ornith‑1.0‑35B обошла Qwen3.5‑397B в Terminal‑Bench, а на нашем локальном срезе хорошо показала себя в агентном кодинге. Мы решили проверить, насколько быстрее она сможет работать на AMD Strix Halo с пропускной способностью памяти до 256 ГБ/с.В статье — результаты экспериментов с Vulkan, MTP, селективной квантизацией и n‑gram reuse: что не дало прироста, как удалось получить 99 ток/с без потери качества и каким способом 35B‑модель запустилась на Windows‑ноутбуке с 8 ГБ VRAM. Читать далее
Закончил тесты и подготовил результаты этих тестов по самой новой, последней, крутой (и способной влезть на карту, что можно купить домой - RTX5090, за такие деньги конечно покупать - безумно, но в магазинах есть, а значит “можно купить домо”) модели Qwen 3.8-27B!Если коротко, то Qwen3.8-27B на…
В прошлой серии сравнил Qwen3.8-27B на своей карте с DeepSeek V4 Flash по API. Меня спросили: а если DeepSeek поставить на ту же карту, урезав до 2 бит? Ответ: 0.697 против 0.731 у той же модели на полной точности — минус 0.034 балла, реальная цена квантования или шум? Читать далее