Представьте, что у нас есть бенчмарк из 4 тысяч вопросов и эталонных ответов. Как определить, действительно ли очередное изменение в системе (обновления в промпте, дополнительный агент в цепочке или, например, переход с базового RAG на гибридный) даёт реальный прирост качества? Читать далее
В этой статье будет рассказано о популярных метриках оценки для задач генерации текста: BLEU, ROUGE, METEOR, BERTScore. Рассказ будет сопровождаться визуализацией, примерами и кодом на Python. ???? Начинаем ????
Меня зовут Дмитрий Успенский, я работаю в команде ML RnD Техплатформы Городских сервисов Яндекса, и в статье я расскажу, как мы применили подход LLM as a judge — когда сама языковая модель оценивает качество генераций и сравнивает между собой разные варианты описаний.…
Когда игрок закрывает окно оплаты в моей игре, с ним заговаривает LLM-бот — короткое exit-интервью по книге «Спроси маму», максимум 5 реплик. За 2 недели: 59 сессий, 20 ответов. Главная находка: люди шли из поиска на слово «бесплатно» в моём же title. Внутри — схема, промпты и код-каркас под любой проект. Смотреть схему, промпты и грабли