В замере Red Hat два балансировщика распределяли один и тот же чат-трафик между четырьмя GPU NVIDIA L4. По числу обработанных запросов в секунду результаты почти совпали: 0,52 у обычного round-robin и 0,49 у маршрутизации с учётом префиксов. Но p95 времени до первого токена различался в 2,7 раза: 745 мс
Всем привет! Меня зовут Андрей, я копирайтер и журналист. В этой серии постов я расскажу свою кривую карьерную историю — как я безуспешно искал и ищу работу, как получил жирный проект, который длился 4 года и принес около 4 млн рублей, как прошел несколько обучений и потратил кучу денег на «рост». Это будет не «история взлета», а «американские горки», в которых эйфория сменяется депрессией и обратно. Пристегивайте ремни! Читать далее
Использовать возможности нейросетей или организовать традиционную видеосъёмку? Рассказываем, как, получив задачу создать имиджевое видео, мы объединили усилия двух команд, ИИ-инструменты и ручную работу. В итоге инхаус создали трёхминутный фильм — с актёрами и трёхмерной графикой. Три технологии в одном фильме
В этом году Anthropic опубликовала исследование инфраструктурного шума в бенчмарках для ИИ-агентов, которые пишут и запускают код. На Terminal-Bench 2.0 разница между самой строгой и неограниченной конфигурациями достигла шести процентных пунктов. Это больше, чем типичный разрыв между…
Сделал калькулятор налога для самозанятых на Laravel + Inertia + Vue с SSR и выложил на обычный shared-хостинг. Сам калькулятор написал за пару вечеров. Всё остальное время ушло на то, чтобы поисковики увидели сайт так же, как браузер.За два месяца: SSR-демон падал с EPERM, порт оказывался занят…
Мне сложно в это поверить, но до релиза GTA VI осталось совсем немного, а по меркам разницы с прошлой частью вообще кажется, что игра выходит завтра. Как именно шестая часть повлияет на индустрию, мы поймем нескоро. Зато ничто не мешает вспомнить былое: оценить, насколько Сэм Хаузер был занозой для всей индустрии, причем тут актер Дэниэл Рэдклифф и каким не всегда однозначно хорошим вещам Rockstar научила игровой рынок. Читать далее
Мы привыкли воспринимать слово «локализация» позитивно почти на автомате. В узких кругах считается, что раз локализовали производство оборудования, то значит сделали его своим. Останется только добавить немного российских компонентов, слегка адаптировать под свои…
см. часть 1: Как я создавал персонального ассистента на домашнем железесм. часть 2: Ассистент получает личность: память, сновидения и самовыражениеВкратце. Циклическая генерация изображения и его последующий анализ дают агенту возможность получать новую информацию, которая…
На днях SemiAnalysis опубликовали исследование с довольно убийственным для OpenAI выводом: подписка Claude якобы дает более чем в пять раз больше ценности, чем сопоставимая подписка ChatGPT.Но как обычно бывает, всё не так однозначно.... Читать далее
Когда LLM помещается на одной GPU и получает несколько запросов в минуту, настройка движка инференса обычно заканчивается на выборе модели и типа данных. Проблемы начинаются дальше: модель перестает помещаться в память, растет очередь запросов, длинные промпты съедают KV-кэш, а GPU…