Привет! Я Чичев Максим, работаю руководителем разработки платформенных решений в Петрович-Тех. В этой статье хочу рассказать о том, как я прогнал три LLM трёх весовых категорий через один и тот же харнесс на агентных задачах длиной 2, 3 и 15 шагов — и почему на длинных цепочках тезис «харнесс важнее модели» перестаёт работать. Читать далее
В 2026 все, кто плотно сидит в ИИ и разработке, пришли примерно к одному выводу: гнаться за моделью получше почти перестало иметь смысл. Работает то, что ты строишь вокруг модели. Агент это модель плюс харнесс. Модель предлагает следующее действие и вероятностна по природе; харнесс…
Зачем использовать бенчмарки для оценки LLM? Бенчмарки LLM помогают оценивать точность больших языковых моделей, обеспечивая стандартизированную процедуру измерения метрик выполнения различных задач. Бенчмарки содержат все структуры и данные, необходимые для оценки LLM, в том…
Все обсуждают модели: GPT, Claude, Codex, Gemini, Opus. Но в реальной работе побеждает не только самая сильная модель, а правильно собранная система вокруг неё. Эта система называется agent harness — харнесс. В статье разберём, что это такое, из каких компонентов он состоит и как я собираю свой рабочий AI-сетап: Orca, GitHub, VPS, Pi Agent и кастомный pipeline для разработки. Читать далее