Если вы замеряете прогресс своего солвера на случайной подвыборке из train, вы замеряете его не на том наборе. Медианная задача train занимает 100 клеток на выходе, у медианной задачи eval их 225. Два и более тестовых входа требуют 6.9 процента задач train и 40.8 процента задач eval. Расхождение…
Две зрелости – внедрения ИИ и его защиты – почти никогда не совпадают, и именно зазор между ними даёт большинство инцидентов и претензий регулятора. В статье приведём обе оси к единой шкале CMMI, покажем, как организации проходят узнаваемые состояния (от отрицания до бесконтрольных агентов), и свяжем всё это с Приказом ФСТЭК № 117 и российскими стандартами. Читать далее
Раньше инженера растили на задачах, которые сейчас называют «рутиной»: написать автотесты, собрать первичную аналитику, разметить датасет или составить документацию. Эта черновая работа была естественным тренировочным полем. Пробираясь через нее, новичок совершал…
Привет, Хабр! Испытания интересующих многих соотечественников аккумуляторных батарей Camel продолжаются. Мы сравниваем их параметры со старыми знакомыми АКОМ, прекрасно показывающими себя в течение многих лет.Все аккумуляторы АКОМ снабжены пробками для доступа к электролиту, куда при необходимости всегда можно долить дистиллированную воду. Camel не предоставляет такой возможности, поэтому тема сегодняшнего эксперимента представляет особую актуальность. Читать далее
Я играю в STALCRAFT, ныне STALZONE. Там есть радио Grind FM — играет фоном, создаёт атмосферу. Проблема в том, что это радио находится в безопасной зоне и играет даже не на всю эту зону. И мне захотелось сделать так, чтобы во время вылазки можно было включить это радио и…
На прошлой неделе мы опубликовали интервью с Артуром Григорьевичем Погосовым, преподавателем Физфака НГУ и автором задач для олимпиады «Твой путь в настоящую науку». Сегодня разберем одну из его демонстрационных задач, где нужно дать качественное объяснение наблюдаемому явлению. Задача старенькая, 2013 года — и для неё мы собрали установку, известную как колыбель Ньютона. Читать далее
И снова про ИИ, точнее, про большие языковые модели, LLM, которые сейчас считаются панацеей для всего и уже разрушили всё, куда были внедрены: найм, разработку, маркетинг и т.д. Почему так происходит? Отличная штука же, ты ему пишешь, что тебе надо, он делает. Ну да, иногда делает не очень хорошо, но ведь новые модели выходят постоянно! И каждая лучше, чем предыдущая, вон, результаты тестов не дадут соврать. Или дадут?
13 августа Google выложила Credentio — C++ библиотеку для проверки C2PA Content Credentials. Я решил собрать её и сделать простой тест: кидаешь картинку и смотришь, можно ли понять, камера это, генератор или редактор.Спойлер: нельзя. Причём ограничение оказалось не в Credentio — я…
Привет, Хабр! Меня зовут Дмитрий, руковожу отделом рекламы и продвижения в Аспро. Мы запускаем сайты, интернет-магазины и развиваем систему управления бизнесом Аспро.Cloud.Частый вопрос от клиентов, которые заказывают у нас аудит: он же вроде нормально работает, зачем еще платить…
Локальный запуск больших LLM быстро упирается в память: веса не помещаются, оффлоад режет скорость, а красивые бенчмарки мало говорят о реальной нагрузке. Разбираем эксперимент с Kimi K3 на 2,8 трлн параметров и смотрим, как MoE, квантование, стриминг и иерархия памяти меняют пределы потребительского железа. Читать далее