Senior
Diyelim ki biz büyük bir reklam ağıyız. Ortak sitelere dünya genelinde bannerlar yerleştiriyoruz. Gerçek zamanlı olay toplama ve işleme sistemi tasarlamamız gerekiyor. Bu veriler iki amaç için kritik önemdedir: Faturalama: Tıklamalar için reklamverenlerden para tahsilatı. Analitik: Kampanyaların güncel etkinliğini (CTR, gösterimler) kişisel panelde gösterme. Girdi verileri (yükü hesaplamak için) Aşağıdaki metriklere dayanarak gereken kapasiteyi kendiniz tahmin etmelisiniz: Ortak ağ: 500.000 aktif site. Trafik: Her sitede ortalama 2 sayfa görüntüleme/saniye. Reklam blokları: Her sayfada aynı anda 3 banner gösteriliyor. Dönüşüm: Ortalama CTR (Click-Through Rate) %1. Düzensizlik: Pik yük (akşam saatleri) ortalamanın 4 katıdır. Olay boyutu: Olay nesnesi (Banner ID, Site ID, UserID, Timestamp, olay tipi) yaklaşık 500 bayt tutar. Teknik gereksinimler Yaklaşık Gerçek Zamanlı: Analitik arayüzündeki veriler en fazla 10 saniye gecikmeyle görünmelidir. Güvenilirlik: Tıklama kaybı kabul edilemez (bu doğrudan para kaybı anlamına gelir). Gösterim kaybı %0.01'e kadar kabul edilebilir. Ölçeklenebilirlik: Sistem, platform sayısındaki artışla kolayca genişletilmelidir.
sobes.tech yapay zeka
AI'dan gelen yanıt
Для проектирования системы сбора и обработки событий в реальном времени для крупной рекламной сети с указанными параметрами, рассмотрим ключевые аспекты:
Оценка нагрузки
- Активных сайтов: 500,000
- Просмотры страниц в секунду на сайте: 2
- Баннеры на странице: 3
- CTR: 1%
- Пиковая нагрузка: ×4
- Размер события: 500 байт
Расчёт событий в секунду (RPS):
- Просмотры страниц: 500,000 × 2 = 1,000,000 в секунду
- Показов баннеров: 1,000,000 × 3 = 3,000,000 показов в секунду
- Клики: 3,000,000 × 1% = 30,000 кликов в секунду
Пиковая нагрузка: 3,000,000 × 4 = 12,000,000 показов и 30,000 × 4 = 120,000 кликов в секунду.
Трафик данных
- Показ: 500 байт × 12,000,000 = ~6 ГБ/сек
- Клик: 500 байт × 120,000 = ~60 МБ/сек
Архитектура системы
-
Сбор данных:
- Использовать легковесные агенты или SDK на сайтах для отправки событий.
- Протоколы: HTTP/2, gRPC или Kafka Producer для высокой пропускной способности.
-
Приём и буферизация:
- Использовать распределённый брокер сообщений (например, Apache Kafka) для устойчивого приёма и буферизации событий.
- Настроить партиционирование по ID сайта или баннера для масштабируемости.
-
Обработка:
- Потоковая обработка с помощью систем типа Apache Flink, Kafka Streams или собственного сервиса на Go.
- Клики обрабатывать с гарантией доставки (exactly-once или at-least-once).
- Показов можно допускать небольшую потерю (0.01%), использовать компромиссы в обработке.
-
Хранение:
- Для биллинга — база данных с транзакционной поддержкой (например, PostgreSQL, CockroachDB).
- Для аналитики — OLAP-хранилище или колоночная БД (ClickHouse, Druid) для быстрых агрегаций.
-
Отображение данных:
- Кэширование агрегированных данных для быстрого доступа в личном кабинете.
- Обновление данных с задержкой не более 10 секунд.
Масштабируемость и надёжность
- Горизонтальное масштабирование всех компонентов.
- Репликация и резервирование брокеров и баз данных.
- Мониторинг и алерты на потерю данных и задержки.
Итог
- Система должна выдерживать до 12 млн событий в секунду на пике.
- Использовать распределённые технологии для приёма и обработки.
- Обеспечить гарантии доставки для кликов и минимальные потери для показов.
- Обеспечить near real-time обновление аналитики с задержкой до 10 секунд.