Мы собрали training‑free детектор галлюцинаций из шести готовых языковых моделей, получили хорошие метрики и наткнулись на красивую загадку: группу примеров, которые все судьи единогласно считали корректными, хотя эталонная разметка помечала их…
*6 LLM‑судей, 4 лаборатории, 3 страны — а ошибки коррелируют: ρ̄ ≈ 0,42, эффективно 1,9 из 6.В июле я писал, что консенсус шести LLM‑судей на RAGTruth бьёт любого одиночного судью. Это по‑прежнему верно. Но тогда я не проверил главного: сколько независимых…
Внеочередной XII съезд судей Украины назначил судью Высшего административного суда Украины Алексея Муравьева и судью Высшего хозяйственного суда Украины Наталью Волковицкую членами Высшего совета юстиции. Также съезд назначил шестерых судей в Высшую квалификационную…
Anthropic отчиталась, что больше 80% её кода теперь пишет Claude, — а её же автоматический проверяющий ловит лишь треть прошлых ошибок, то есть две трети пропускает. Если код пишет один ИИ, а проверяет такой же — они слепнут в одних и тех же местах, и второй контур даёт не защиту, а общую слепую зону. Разбираю на инженерном уровне, почему «проверка ИИ» не равна независимой проверке, как измерить слепое пятно и как сюда ложится двухконтурная схема из мира промышленной безопасности (IEC 61508). Читать далее