Недавно увидел ещё один репозиторий с обещанием резко сократить расход контекста у LLM-агентов — Headroom. Я сейчас исследую эту тему на примере SKILL.state и уже писал о первых результатах на Хабре - это были первые инженерные эксперименты; более строгие проверки ещё продолжаются. Так что
Признаю: в прошлой статье про тестирование Caveman я в конце написал, что такие инструменты, как RTK, действительно, могут помочь сэкономить токены. Я доверял самому принципу возможности экономии токенов, но не доверял конкретным цифрам эффективности, которые заявляет Headroom. Был уверен, что, садясь за тесты, скорее всего, увижу, не 60–95% экономии токенов, а типа 10% — или что-то такое. Но результат меня удивил в худшую сторону. Итак, тестируем Headroom вместе: Читать далее
ИИ-агенты упираются не только в цену модели, но и в лишний контекст: длинные ответы, раздутый код, большие логи и JSON. Разбираю Caveman, Ponytail и Headroom как три разных слоя токенной диеты для агентной разработки. Читать далее
Неудачное решение обрастает костылями, пока модель защищает первую догадку. Я встроил обсуждение четырёх ролей перед первой правкой и проверил схему в 480 запусках. Удалось сэкономить 4,5 млн токенов — и найти ошибку, из-за которой агенты продолжали спорить, когда их ответы ещё нельзя было сравнить. Читать далее