İçeriğe geç

4.1. Toplu İşleme

Batch işleme, sonlu ve eksiksiz bir veri kümesi üzerinde hesaplama yapar — başlamadan önce tüm girdiye sahipsinizdir; bu da doğruluğu kolay, gecikmeyi yüksek kılar. Belirleyici zorluk map ya da reduce değil, aralarındaki shuffle’dır: ilgili anahtarları bir araya getirmek için terabaytlarca veriyi ağ üzerinden taşımak ve burada yavaş kalanlar (straggler) ile çarpıklık (skew) işinizin çalışma süresini belirler. Bu bölüm, paradigmayı MapReduce’un diske bağlı modelinden Spark’ın bellek içi DAG’ına ve bin düğümlü bir işi bitiren hata toleransı ile spekülatif yürütme mekaniğine kadar izler.