IV. Veri İşleme Mimarileri
Veriyi ölçekte işlemek, iki şekil arasında bir seçimi dayatır: verim (throughput) için hesaplanan sınırlı toplu işler (batch) ve gecikme (latency) için hesaplanan sınırsız akışlar (stream). Sektör, bunların iki ayrı sistem değil, log tarafından birleştirilen tek bir sürekliliğin iki ucu olduğunu keşfetmek için on yıl harcadı. Bu bölüm, batch paradigmasını (MapReduce’tan Spark’a), stream paradigmasını ve onun zor zaman problemini (olay zamanı, filigranlar, pencereleme) ve bunları uzlaştıran hibrit mimarileri kapsar.
İncelenen Konular
Section titled “İncelenen Konular”- 4.1. Toplu İşleme: Sonlu veri kümeleri üzerinde hesaplama: MapReduce’tan Spark’a, shuffle darboğazı, hata toleransı ve spekülatif yürütme.
- 4.2. Akış İşleme: Sınırsız veri üzerinde hesaplama: olay zamanı ve işleme zamanı, pencereleme, filigranlar, tetikleyiciler ve Apache Flink.
- 4.3. Hibrit Mimariler ve Log Soyutlaması: Gerçeğin kaynağı olarak commit log: Lambda ve Kappa mimarileri, log compaction ve Change Data Capture.