Sobes.tech
Middle

Ar turite patirties su laiko eilutėmis ir PySpark?

sobes.tech AI

Atsakymas iš AI

Taip, patirtis su laiko eilutėmis PySpark apima didelių duomenų kiekių apdorojimą su laiko žymėmis, agregavimą, slankiojančiais langais ir modelių taikymą prognozėms.

PySpark dažnai naudoja funkcijas iš modulio pyspark.sql.functions, pavyzdžiui, window grupavimui pagal laiko intervalus.

Pavyzdys, kaip agreguoti duomenis valandomis:

from pyspark.sql import SparkSession
from pyspark.sql.functions import window, avg

spark = SparkSession.builder.getOrCreate()

data = [
    ("2024-06-01 10:05:00", 10),
    ("2024-06-01 10:15:00", 20),
    ("2024-06-01 11:00:00", 30),
]

schema = "timestamp STRING, value INT"
df = spark.createDataFrame(data, schema=schema)
df = df.withColumn("timestamp", df["timestamp"].cast("timestamp"))

rezultatas = df.groupBy(window("timestamp", "1 valanda")).agg(avg("value").alias("vidutine_reiksme"))
rezultatas.show(truncate=False)

Šis požiūris leidžia efektyviai apdoroti ir analizuoti laiko eilutes dideliuose duomenų rinkiniuose.