Middle
Как да получим възраст в бинове в Spark по дата на раждане за определена дата?
sobes.tech AI
Отговор от AI
В Apache Spark, за да получите възрастта в бинове въз основа на дата на раждане към определена дата, можете да следвате следните стъпки:
- Изчислете възрастта в години, като извадите датата на раждане от зададената дата.
- Определете границите на биновете (например 0-10, 11-20, 21-30 и т.н.).
- Използвайте функцията
whenилиbucketizer, за да разпределите възрастта по бинове.
Пример с PySpark:
from pyspark.sql import functions as F
from pyspark.sql import SparkSession
spark = SparkSession.builder.getOrCreate()
data = [
("2000-05-15",),
("1985-10-30",),
("2010-01-01",)
]
df = spark.createDataFrame(data, ["birth_date"])
# Дата за референция за изчисляване на възрастта
reference_date = F.lit("2024-06-01")
# Конвертиране на низове в дати
df = df.withColumn("birth_date", F.to_date("birth_date"))
# Изчисляване на възрастта в години
df = df.withColumn(
"age",
F.floor(F.months_between(reference_date, F.col("birth_date")) / 12)
)
# Определяне на бинове за възрастта
bins = [0, 10, 20, 30, 40, 50, 60, 100]
from pyspark.ml.feature import Bucketizer
bucketizer = Bucketizer(
splits=bins,
inputCol="age",
outputCol="age_bin"
)
df = bucketizer.transform(df)
df.show()
Резултатът ще бъде, че в колоната age_bin ще се показва индексът на бин, в който попада възрастта. Тези индекси могат също да бъдат свързани с четливи етикети.