Инженеры Google пообещали сократить потребление памяти в 8 раз. Рынок ОЗУ тут же отреагировал: акции покатались вниз. Финансовые аналитики, как и всё ИИ-сообщество в те дни, не учли несколько технических нюансов. Читать далее
Google Research выпустили TurboQuant - новый алгоритм сжатия данных, который сокращает объём кэш-памяти LLM как минимум в 6 раз и даёт ускорение до 8 раз. При этом заявляется отсутствие потерь в точности, что напрямую влияет на эффективность работы ИИ. Читать далее
Последние новости в сфере ИИ намекают на важный сдвиг: локальный запуск очень больших моделей уже не выглядит чистой фантастикой. В этой статье я разбираю две технологии — Bonsai и TurboQuant, — которые бьют по двум главным ограничениям инференса: размеру весов и объёму KV-cache. А затем прикидываю, что будет, если однажды их удастся объединить и масштабировать до моделей уровня 235B. Читать далее
На CES 2024 представлено много интересных устройств и технологий. Одна из них — реализация нового типа памяти ОЗУ, стандарт LPCAMM2. Именно такой модуль представлен компанией Micron. Аналогичные продукты готовят и другие компании. В чём их преимущества и недостатки и какие изменения могут вызвать на рынке потребительской электроники планки ОЗУ нового стандарта? Всё это давайте обсудим под катом. Читать далее