В этой статье я расскажу, как запустить Bonsai-27B на обычной видеокарте и как мой форк llama.cpp делает модель умнее прямо на инференсе. Показываю реальный тест: на одной и той же задаче базовая модель зависла и не смогла решить, а рекуррентная довела до ответа. Объясняю, что происходит внутри, сколько это стоит по скорости, и даю команды, чтобы повторить всё у себя на железе. Ну давай посомтрим
Вышло 2 модели prism-ml/Ternary-Bonsai-27B-gguf и prism-ml/Bonsai-27B-ggufМодели представлены в 2-битном и 1-битном вариантах и занимают всего 7,2 и 3,8 ГБ соответственно. Но самое интересное здесь не размер, а качество после столь агрессивного сжатия. По заявленным результатам, 2-битная версия сохраняет около
В этой статье мы детально разберём, есть ли практическая польза от рекурсивного механизма в форке llama.cpp, и стоит ли овчинка выделки. Для объективности сравним поведение трёх разных моделей — от лёгких 7B до тяжёлых 32B — в одинаковых условиях, замерив качество и скорость Читать далее
Стартап PrismML представил Bonsai 27B — сжатые версии открытой модели Qwen3.6-27B, младшая из которых стала первой нейросетью такого класса, которая помещается в память смартфона. Веса выложены на Hugging Face под лицензией Apache 2.0, а в демонстрациях PrismML модель работает прямо на iPhone 17 Pro Max — рассуждает, вызывает инструменты и разбирает скриншоты без единого обращения к облаку. Читать далее