Когда вендор защиты данных пишет на сайте «точность детекции 99%», возникает ровно один вопрос: как это измерено? Без методики цифра не значит ничего — «99%» может означать честный span-level F1 на внешнем бенчмарке, а может — «в 99 из 100 сообщений сканер что-то нашёл». Это разные вещи, и…
ВведениеПривет, сегодня я поделюсь с вами очередным отчетом. Уязвимость, о которой мы поговорим, это IDOR. С помощью которой, я смог раскрыть личную идентификационную информацию (сокращенно PII). Быстро объясню, что такое IDOR и PII.Что такое IDORЭто сокращение от Insecure Direct Object Reference…
Генеральная совокупность - множество всех объектов, относительно которых предполагается делать выводы при изучении конкретной задачи.Выборка - часть генеральной совокупности, которая охватывается экспериментом.Репрезентативная выборка - выборка, в которой все основные…
В статье представлено многоязычное расширение SWE-Bench от команды Doubletapp — бенчмарка для оценки больших языковых моделей (LLM) на реальных задачах программной инженерии, на различных языках программирования и кодовых базах индустрии. О процессе сбора SWE-Bench мы уже рассказывали в…