Мы посадили модели Claude играть друг против друга в пошаговую стратегию, где нужно строить экономику, воевать, договариваться с соседями и решать, когда договор пора нарушить. Хотели понять две вещи: как топовые языковые модели справляются с такой игрой и совпадёт ли расстановка…
Все уже знают, что в феврале от Claude вышли модели версии 4.6. Я попытался сравнить Opus и Sonnet, но результат оказался каким-то невнятным. Тогда родился вопрос: а что, если сравнивать не горизонтально, а вертикально? Ведь для меня Sonnet – это прежде всего генерация текста. Раньше, на версии…
Opus 5 не делает Fable 5 ненужным: благодаря вдвое более низкой официальной цене за токен, управляемому effort и близкому уровню возможностей Opus подходит как модель по умолчанию для большинства сложных задач, а Fable — как уровень эскалации для длинных, неоднозначных и дорогих в случае ошибки сценариев. Статья сравнивает цену принятой задачи, публичные рейтинги, работу с данными, fallback и доступ из России, а затем предлагает проверяемую двухуровневую схему маршрутизации. Читать далее
Claude Opus 5, Claude Fable 5, GPT 5.6 Sol, Kimi K3, Claude Opus 4.8, Grok 4.5, Composer 2.5, GPT 5.5, DeepSeek v4, GLM 5.2, Qwen 3.8 Max, Claude Sonnet 5, Mimi 2.5, MiniMax M2.7.Для тех, кому лень читать до конца, текущий итог: Читать далее