İçeriğe geç

IV. Veri İşleme Mimarileri

Veriyi ölçekte işlemek, iki şekil arasında bir seçimi dayatır: verim (throughput) için hesaplanan sınırlı toplu işler (batch) ve gecikme (latency) için hesaplanan sınırsız akışlar (stream). Sektör, bunların iki ayrı sistem değil, log tarafından birleştirilen tek bir sürekliliğin iki ucu olduğunu keşfetmek için on yıl harcadı. Bu bölüm, batch paradigmasını (MapReduce’tan Spark’a), stream paradigmasını ve onun zor zaman problemini (olay zamanı, filigranlar, pencereleme) ve bunları uzlaştıran hibrit mimarileri kapsar.

  • 4.1. Toplu İşleme: Sonlu veri kümeleri üzerinde hesaplama: MapReduce’tan Spark’a, shuffle darboğazı, hata toleransı ve spekülatif yürütme.
  • 4.2. Akış İşleme: Sınırsız veri üzerinde hesaplama: olay zamanı ve işleme zamanı, pencereleme, filigranlar, tetikleyiciler ve Apache Flink.
  • 4.3. Hibrit Mimariler ve Log Soyutlaması: Gerçeğin kaynağı olarak commit log: Lambda ve Kappa mimarileri, log compaction ve Change Data Capture.