Sobes.tech
Middle

Qu'est-ce que la calcul différé dans Spark?

sobes.tech IA

Réponse de l'IA

Dans Apache Spark, les calculs paresseux (lazy) signifient que les opérations sur les données ne sont pas exécutées immédiatement lors de leur appel. À la place, Spark construit un plan de calcul (DAG — Graphe Acyclique Dirigé), qui ne sera exécuté que lorsque le résultat sera nécessaire, par exemple lors de l'appel à des actions comme collect(), count(), save().

Cela permet d'optimiser l'exécution en combinant plusieurs transformations en une seule étape, en minimisant la lecture et l'écriture des données, et en répartissant efficacement la charge sur les clusters.

Exemple:

val rdd = sc.textFile("data.txt")
val filtered = rdd.filter(line => line.contains("error")) // transformation paresseuse
val count = filtered.count() // action, qui lance les calculs

Ici, filter n'est pas exécuté immédiatement, mais seulement lors de l'appel à count().