Исследователи из NVIDIA, MIT и NTU поручили одному ИИ-агенту улучшать harness другого, кодинг-ассистента на базе открытого Pi. Агент перебрал 152 идеи, и 4 из них сократили расход токенов почти вдвое при той же модели. Счёт за API упал на треть, средний балл на EdgeBench снизился на 6 %. Разбираем, что такое harness, какие приёмы сработали и где у результатов слабые места. Какие 4 приёма сработали
Привет, Хабр! На связи команда GigaChain. В этой статье мы расскажем, как итеративно настраивали обвязку (harness) Deep Agents под особенности GigaChat: правили промпты и описания инструментов, а часть правил зашивали прямо в код, и как сделали для этого открытый бенчмарк harness-bench-fast, чтобы измерять прогресс. На зафиксированном сете из 391 задачи подключение профиля подняло долю решённых задач с 77,2% до 87,0%, а расход токенов сократило практически вдвое. Читать далее
Я собираю своего кодинг‑агента поверх моделей OpenAI. Базовый агентный цикл написал сам на Pydantic AI, и он быстро заработал. А потом начались сложные узлы: как сжимать распухший контекст, как не дать агенту делать заново уже сделанное, как понять, что он правда закончил, а не выдохся. На
Привет! Я Андрей Иванов, NLP-исследователь в R&D-лаборатории red_mad_robot.Когда мы собираем AI-агента, первым делом выбираем модель под задачу. Но в реальном приложении она не работает в одиночку, ей нужен агентский harness — программная обвязка. Поэтому выбирать приходится не просто…