Sobes.tech
Middle

Vaqt qatorlari va PySpark bilan tajribangiz bormi?

sobes.tech AI

AIdan javob

Ha, PySparkda vaqt ketma-ketligi bo'yicha tajriba katta hajmdagi ma'lumotlarni vaqt bilan ishlash, agregatsiya qilish, siljiydigan oynalar va prognoz qilish uchun modellarni qo'llashni o'z ichiga oladi.

PySparkda vaqt ketma-ketligi bilan ishlash uchun odatda pyspark.sql.functions modulidan funksiyalar, masalan, window yordamida vaqt oralig'iga qarab guruhlash uchun foydalaniladi.

Soatlik ma'lumotlarni agregatsiya qilish misoli:

from pyspark.sql import SparkSession
from pyspark.sql.functions import window, avg

spark = SparkSession.builder.getOrCreate()

data = [
    ("2024-06-01 10:05:00", 10),
    ("2024-06-01 10:15:00", 20),
    ("2024-06-01 11:00:00", 30),
]

schema = "timestamp STRING, value INT"
df = spark.createDataFrame(data, schema=schema)
df = df.withColumn("timestamp", df["timestamp"].cast("timestamp"))

natija = df.groupBy(window("timestamp", "1 hour")).agg(avg("value").alias("o'rtacha_qiymat"))
natija.show(truncate=False)

Bu yondashuv katta ma'lumotlar to'plamida vaqt ketma-ketligini samarali tarzda ishlash va tahlil qilish imkonini beradi.