Вышли Claude Opus 5.5 и GPT-6 Sol, и все пошли смотреть прайсы шлюзов. Я собрал цены пяти шлюзов с оплатой из России и посчитал иначе: сколько стоит час работы в Claude Code, если нагрузка как у меня — по логам 49 моих сессий, 138 часов работы.Разброс получился почти десятикратный: от 181 до 1 756 рублей…
«У меня игра на Flame, можно ли добавить в неё 3D?». Можно, и игру не придётся переписывать: корабль летает по трёхмерному двору со светом и тенями, а джойстик, HUD и вся игровая логика остаются на Flame. У двух движков одни часы, одна физика и один ввод, поэтому таран, который посчитала…
CMF модель для быстрого принятия решений (аналог Jev) — локальная модель для выбора решений без генерации токенов. Она определяет класс, умеет отказываться от неуверенных ответов и передавать незнакомые случаи оракулу(сторонней модели в качестве учителя) и обучаться (повторные…
Аж до самого ногтя шабили сигареты Японцы после войны, потому что табак тогда ценился дороже риса. Это заметили братья Касио и придумали кольцо-сигаретник, которое надевалось на палец и удерживало сигу, позволяя скуривать все до победного конца не обжигаясь. Поэтому девайс разлетался как горячие чебуреки. Читать далее
Как менялась эксплуатация переполнений буфера в Windows за последние десятилетия?Рассмотрим путь от классического Stack Smashing до современных механизмов защиты потока выполнения. На практике рассматриваются x86-техники переписывания EIP, NOP-sled, JMP ESP, эксплуатация SEH, переход к ROP как способу обхода DEP.Практически продемонстрированы примеры создания и эксплуатации указанных уязвимостей. Читать далее
15 сентября мы выпустили БОЛТУН с Windows-клиентом на Tauri. К 28 сентября сервер учёл 134 млн входящих голосовых кадров, а среднее число разных клиентских ID в сутки выросло со 145 до 192 при сравнении одинаковых дней недели — примерно на 33%. Разбираем первые результаты: рост активности, голосовой трафик, демонстрации экрана и 854 часа суммарного прослушивания радио. Читать далее
В бизнесе важна каждая минута. Но если документ сначала нужно передать на обработку, проверить его и только потом внести данные в учетную систему, между реальной операцией и ее отражением в системе возникает разрыв. Все это время собственник не видит актуальной картины и…
Привет, Хаброжители! Когда вы вводите промпт в большую языковую модель (LLM), машина преобразует ваш текст в числа, обрабатывает их, а потом возвращает ответ токен за токеном. В этой статье мы разберём, что такое инференс (логический вывод) в LLM и посмотрим, как он работает. Читать далее
Высокая загрузка GPU ещё не означает, что инфраструктуре не хватает ресурсов. В продакшене значительная часть времени может уходить на повторный расчёт одинаковых промптов, неэффективное распределение кэша или неверные параметры сервинга. Разберём шесть шагов оптимизации инференса LLM на стеке vLLM и Kubernetes: от поиска узкого места и расчёта KV‑кэша до настройки prefix caching и проверки квантования. Читать гайд
В обычном backend fallback обычно означает: тот же контракт, другой исполнитель. С LLM всё сложнее — резервная модель может вернуть валидный JSON, но изменить смысл результата. Разбираю, почему retry и fallback нужно разделять, как учитывать деградацию качества и когда честная ошибка лучше «успешного» ответа другой модели. Читать далее