Middle
Ar turite patirties su laiko eilutėmis ir PySpark?
sobes.tech AI
Atsakymas iš AI
Taip, patirtis su laiko eilutėmis PySpark apima didelių duomenų kiekių apdorojimą su laiko žymėmis, agregavimą, slankiojančiais langais ir modelių taikymą prognozėms.
PySpark dažnai naudoja funkcijas iš modulio pyspark.sql.functions, pavyzdžiui, window grupavimui pagal laiko intervalus.
Pavyzdys, kaip agreguoti duomenis valandomis:
from pyspark.sql import SparkSession
from pyspark.sql.functions import window, avg
spark = SparkSession.builder.getOrCreate()
data = [
("2024-06-01 10:05:00", 10),
("2024-06-01 10:15:00", 20),
("2024-06-01 11:00:00", 30),
]
schema = "timestamp STRING, value INT"
df = spark.createDataFrame(data, schema=schema)
df = df.withColumn("timestamp", df["timestamp"].cast("timestamp"))
rezultatas = df.groupBy(window("timestamp", "1 valanda")).agg(avg("value").alias("vidutine_reiksme"))
rezultatas.show(truncate=False)
Šis požiūris leidžia efektyviai apdoroti ir analizuoti laiko eilutes dideliuose duomenų rinkiniuose.