В прошлой серии сравнил Qwen3.8-27B на своей карте с DeepSeek V4 Flash по API. Меня спросили: а если DeepSeek поставить на ту же карту, урезав до 2 бит? Ответ: 0.697 против 0.731 у той же модели на полной точности — минус 0.034 балла, реальная цена квантования или шум? Читать далее
Видеокарты NVIDIA на архитектуре Blackwell в очередной раз трансформируют рынок GPU. Три новые модели — RTX Pro 2000 Blackwell, RTX Pro 4000 SFF Blackwell Edition и RTX Pro 6000 Blackwell — делают технологии AI и высокопроизводительных вычислений более доступными для широкого круга компаний.В этой статье мы…
За последние 2 месяца я протестировал RTX PRO 6000 96GB / RTX4090 48GB и даже H200, оценивая варианты для селф-хоста, купил RTX5070ti и V100 32GB и прогнал большое количество бенчей (в том числе искренне своих). Потом увидел бешеный рост цен на железо и череду утечек персональных данных к провайдерам LLM (и…
Я давно слежу за развитием локальных LLM, но всегда упирался в одно и то же — либо модель маленькая и качество не устраивает, либо большая и не влезает в видеопамять. Всё изменилось когда я наткнулся на статью про MoE-модели и параметр -cmoe в llama.cpp.Расскажу как я запустил Qwen3.6 35B-A3B на RTX 4070 12GB с 32GB RAM, настроил его как AI-ассистент для реального проекта в opencode, и почему теперь эта модель у меня работает постоянно. Читать далее