Sobes.tech
Middle — Senior

Zaman serisi modelleri için veri seti oluşturma ve doğrulama özellikleri nelerdir?

sobes.tech yapay zeka

AI'dan gelen yanıt

Zaman serileri modelleri için veri kümesi oluştururken ve doğrulama yaparken, verilerin zaman bağımlılığını dikkate almak ve gelecekteki bilgilerden geçmişe sızmayı önlemek önemlidir.

Ana özellikler:

  1. Kaydırmalı pencere (Sliding window) — ardışık zaman aralıklarından eğitim örnekleri oluşturma, burada giriş önceki değerler, çıkış ise bir sonraki adımdır.

  2. Zamana göre veri bölme — veriler, modelin eğitim sırasında gelecekteki verileri görmemesi için zaman çizelgesine göre katı şekilde eğitim, doğrulama ve test bölümlerine ayrılır.

  3. Zaman dizisi dikkate alınarak doğrulama:

    • TimeSeriesSplit gibi yöntemlerin kullanılması, verilerin sırasını dikkate alan ardışık bölmeler oluşturur.
    • Rastgele karıştırmadan (shuffle) kaçınılmalıdır, çünkü bu zaman yapısını bozar.
  4. Mevsimsellik ve trendlerin işlenmesi — özellikler oluşturulurken, hafta günü, saat, tatiller gibi zaman özellikleri dikkate alınır.

  5. Eksik değerler ve anomalilerin işlenmesi — doğru ön işleme önemlidir, çünkü zaman serileri bu tür bozulmalara karşı hassastır.

Veri bölme örneği:

import pandas as pd
from sklearn.model_selection import TimeSeriesSplit

dataset = pd.read_csv('timeseries.csv', parse_dates=['date'])
dataset = dataset.sort_values('date')

# Tarihe göre eğitim ve test bölmesi
train = dataset[dataset['date'] < '2023-01-01']
test = dataset[dataset['date'] >= '2023-01-01']

# Çapraz doğrulama için TimeSeriesSplit
tscv = TimeSeriesSplit(n_splits=5)
for train_index, val_index in tscv.split(train):
    train_fold = train.iloc[train_index]
    val_fold = train.iloc[val_index]
    # model eğitimi ve doğrulaması

Anahtar, kronolojik sıralamayı korumak ve gelecekteki bilgilerin geçmişe sızmasını önlemektir.