До обновления API LLMCOD работал на Qwen 3.6. Модель справлялась, но по мере роста числа клиентов и усложнения промптов (длинные базы знаний, многошаговые диалоги, агенты) стало понятно: нужен более свежий бэкенд с лучшим качеством推理 и более эффективным использованием GPU.Цель — получить максимум от имеющегося железа (Tesla V100-SXM2-32GB), не покупая новый GPU. Читать далее
Еще несколько лет назад NVIDIA Tesla V100 ассоциировалась прежде всего с дата‑центрами и суперкомпьютерами. Сегодня эти списанные ускорители V100 SXM2 на 16 ГБ массово попадают на вторичный рынок, и для энтузиаста локального ИИ они выглядят неожиданно интересно. Особенно это касается версии V100 SXM2 на 32 ГБ. Читать далее
Привет всем.Расскажу про свой личный опыт разработки через Qwen 3.6 Plus и Qwen ClI. И да, статья полностью написана человеком.Это небольшой pet-проект, сделанный в момент, когда Qwen 3.6 Plus был бесплатным с лимитом в 1000 запросов в день. Проект представляет из себя фронтенд вымышленного интернет-магазина по продаже микрокомпьютеров.Цель была протестировать возможности Qwen. На весь проект у меня ушло 4 дня по 2-3 часа. Читать далее
Сегодня мы поговорим не просто об очередном минорном релизе, а о раннем архитектурном превью платформы Qwen 4. Главная идея Qwen 4 заключается в переосмыслении того, как трансформерные блоки обрабатывают контекст и расходуют память.В этой статье мы разберем новые механизмы (GDN + QSA, Gated Residual, 51B N-gram эмбеддинги), сравним архитектуру и бенчмарки с популярной плотной моделью Qwen 3.8 27B, а также запустим новую модель локально. Читать далее