Milyen jellemzői vannak az adathalmaz építésének és validálásának időbeli sorozatmodellekhez?
sobes.tech MI
Válasz az MI-től
Idősort modellekhez adatgyűjtemények és validációk készítésekor fontos figyelembe venni az adatok időbeli függőségét, és elkerülni a jövőbeli információk szivárgását a múltba.
Fő jellemzők:
-
Csúszó ablak (Sliding window) — szekvenciális időintervallumokból képzett tanulási példák, ahol a bemenet a korábbi értékek, a kimenet a következő lépés.
-
Adatok idő szerinti felosztása — az adatok szigorúan idő szerint oszlanak fel tanulási, validációs és teszt részekre, hogy a modell ne lásson jövőbeli adatokat a tanulás során.
-
Validáció időbeli sorrend figyelembevételével:
- Olyan módszerek alkalmazása, mint a TimeSeriesSplit, amelyek szekvenciális felosztásokat hoznak létre, figyelembe véve az adatok sorrendjét.
- Véletlenszerű keverés (shuffle) elkerülése, mivel ez megsérti az időbeli struktúrát.
-
Szezonális hatások és trendek kezelése — a jellemzők készítésekor figyelembe veszik az időbeli jellemzőket (hét napja, óra, ünnepek).
-
Hiányzó értékek és anomáliák kezelése — a helyes előfeldolgozás fontos, mivel az idősortípusok érzékenyek az ilyen torzulásokra.
Adatfelosztási példa:
import pandas as pd
from sklearn.model_selection import TimeSeriesSplit
data = pd.read_csv('timeseries.csv', parse_dates=['date'])
data = data.sort_values('date')
# Felosztás tanulási és teszt adatokra dátum szerint
train = data[data['date'] < '2023-01-01']
test = data[data['date'] >= '2023-01-01']
# TimeSeriesSplit a keresztvalidációhoz
tscv = TimeSeriesSplit(n_splits=5)
for train_index, val_index in tscv.split(train):
train_fold = train.iloc[train_index]
val_fold = train.iloc[val_index]
# modell tanítása és validálása
A kulcs az időrendi sorrend megőrzése és a jövőbeli információk szivárgásának elkerülése a múltba.