Вышло 2 модели prism-ml/Ternary-Bonsai-27B-gguf и prism-ml/Bonsai-27B-ggufМодели представлены в 2-битном и 1-битном вариантах и занимают всего 7,2 и 3,8 ГБ соответственно. Но самое интересное здесь не размер, а качество после столь агрессивного сжатия. По заявленным результатам, 2-битная версия сохраняет около
В этой статье я расскажу, как запустить Bonsai-27B на обычной видеокарте и как мой форк llama.cpp делает модель умнее прямо на инференсе. Показываю реальный тест: на одной и той же задаче базовая модель зависла и не смогла решить, а рекуррентная довела до ответа. Объясняю, что происходит внутри, сколько это стоит по скорости, и даю команды, чтобы повторить всё у себя на железе. Ну давай посомтрим
Привет всем.Расскажу про свой личный опыт разработки через Qwen 3.6 Plus и Qwen ClI. И да, статья полностью написана человеком.Это небольшой pet-проект, сделанный в момент, когда Qwen 3.6 Plus был бесплатным с лимитом в 1000 запросов в день. Проект представляет из себя фронтенд вымышленного интернет-магазина по продаже микрокомпьютеров.Цель была протестировать возможности Qwen. На весь проект у меня ушло 4 дня по 2-3 часа. Читать далее
Сегодня мы поговорим не просто об очередном минорном релизе, а о раннем архитектурном превью платформы Qwen 4. Главная идея Qwen 4 заключается в переосмыслении того, как трансформерные блоки обрабатывают контекст и расходуют память.В этой статье мы разберем новые механизмы (GDN + QSA, Gated Residual, 51B N-gram эмбеддинги), сравним архитектуру и бенчмарки с популярной плотной моделью Qwen 3.8 27B, а также запустим новую модель локально. Читать далее