Middle
Czym jest cofanie się (back leakage)?
sobes.tech AI
Odpowiedź od AI
Back leakage (wyciek do tyłu) w kontekście uczenia maszynowego i testów jakości danych to sytuacja, gdy informacje odnoszące się do przyszłości trafiają do modelu lub danych testowych przeznaczonych do uczenia lub weryfikacji na danych historycznych. Prowadzi to do nierealistycznie zawyżonej wydajności modelu na danych testowych, ponieważ model w istocie "podgląda" odpowiedzi z przyszłości.
Przykłady back leakage:
- Szeregi czasowe: Uwzględnianie przyszłych wartości szeregu czasowego (np. cena akcji jutro) w cechach lub etykietach do trenowania modelu, który ma przewidywać przeszłość lub teraźniejszość.
- Wycieki z zestawu testowego do treningowego: Przypadkowe włączenie danych z zestawu testowego do treningowego lub użycie informacji z zestawu testowego podczas przetwarzania zestawu treningowego (np. skalowanie cech na podstawie statystyk całego zbioru danych, w tym testowego).
- Tworzenie cech: Tworzenie cech na podstawie danych zebranych po czasie, dla którego dokonywana jest predykcja.
Skutki back leakage:
- Nierealistyczne metryki wydajności na danych testowych.
- Niska wydajność modelu w warunkach rzeczywistych (po zastosowaniu do nowych, przyszłych danych).
- Błędne wnioski na temat jakości modelu.
Zapobieganie back leakage jest kluczowe dla budowania niezawodnych modeli i przeprowadzania poprawnych testów.