Sobes.tech
Middle

Van tapasztalata időszakos adatsorokkal és PySpark-kal?

sobes.tech MI

Válasz az MI-től

Igen, a PySparkben végzett idősortani tapasztalat magában foglalja nagy adatmennyiségek időbélyegekkel való feldolgozását, aggregálást, mozgó ablakokat és modellek alkalmazását előrejelzésekhez.

PySparkben az idősortani adatokkal való munka során gyakran használják a pyspark.sql.functions modulból származó funkciókat, például a window-t az időintervallumok szerinti csoportosításhoz.

Óránkénti adatok aggregálásának példája:

from pyspark.sql import SparkSession
from pyspark.sql.functions import window, avg

spark = SparkSession.builder.getOrCreate()

data = [
    ("2024-06-01 10:05:00", 10),
    ("2024-06-01 10:15:00", 20),
    ("2024-06-01 11:00:00", 30),
]

schema = "timestamp STRING, value INT"
df = spark.createDataFrame(data, schema=schema)
df = df.withColumn("timestamp", df["timestamp"].cast("timestamp"))

eredmény = df.groupBy(window("timestamp", "1 óra")).agg(avg("value").alias("átlagérték"))
eredmény.show(truncate=False)

Ez a megközelítés hatékonyan lehetővé teszi az idősortani adatok feldolgozását és elemzését nagy adathalmazokon.