27 июля Moonshot AI открыла веса Kimi K3 и опубликовала результаты модели на coding- и агентных бенчмарках. Мы проверили, как эти показатели переносятся на рабочие операции с файлами, счетами, корзинами, платежами, возвратами и отчётами. Kimi K3 прошла 204 задачи PAC1 и ECOM1 и набрала 61/104 и 44,75/100. В…
Недавно я участвовал в корпоративном хакатоне по обходу ИИ-песочниц. Задача: пройти закрытый бенчмарк PAC1, где ИИ-агенту нужно работать с виртуальной файловой системой (чтение логов, поиск файлов, отправка писем) и обходить ловушки безопасности (Indirect Prompt Injections).Но реальность…
Китайская компания Moonshot AI представила Kimi K3, и почти сразу лента заполнилась демонстрациями: браузерные игры, сайты, 3D-сцены, визуализации и проекты, собранные по короткому описанию.Я изучил Kimi K3 прежде всего с точки зрения практической разработки. Меня интересовало не только то, насколько эффектно выглядит очередное демо.Гораздо важнее для меня другое: Читать далее
За неделю команда бенчмарка Design Arena выпустила два разбора моделей, возглавивших ее дизайн-лидерборды: разбор GPT-5.6 Sol, флагмана OpenAI, и свежий разбор Kimi K3 от китайской Moonshot AI. Исследователи заглянули внутрь генераций и рассуждений моделей и показали, как именно те научились "вкусу". Выяснилось, что универсального рецепта нет: две модели пришли к хорошему дизайну противоположными путями, а третья — прошлый лидер GLM 5.2 — своим, третьим. Читать далее