Вторая статья цикла «CDC Pipeline в домашней лаборатории». В первой мы сделали Telegram-бота для парсинга банковских скриншотов. Теперь подготовим PostgreSQL к тому, чтобы Debezium мог захватывать изменения в реальном времени. Читать далее
Седьмая статья цикла о построении CDC-пайплайна с нуля. Инфраструктура работает, данные текут из PostgreSQL через Kafka в HDFS. Займемся те, что никто не любит(по крайнее мере у нас на работе). Сегодня поднимаем мониторинг и настраиваем алерты в Telegram. Читать далее
Шестая статья цикла о построении CDC-пайплайна с нуля. Данные уже текут из PostgreSQL в Kafka, но дальше просто исчезают по retention. Сегодня пишем Consumer на Python, реализуем криптографическую верификацию сообщений и строим трёхслойную архитектуру данных. Читать далее
Перевёл Zabbix с PostgreSQL на OceanBase онлайн, без простоя и потери метрик. Flink CDC лил данные из PostgreSQL в реальном времени, пока я переключал хосты по одному. Таблицы с историей сжались в 15–18 раз. Пошаговый разбор и все грабли. Читать далее