Middle
Jak sprawdzać poprawność danych?
sobes.tech AI
Odpowiedź od AI
Weryfikacja poprawności danych jest ważnym etapem w uczeniu maszynowym i przetwarzaniu danych. Główne podejścia:
- Inspekcja wizualna: tworzenie wykresów (histogramów, scatter plotów) w celu wykrycia anomalii i wartości odstających.
- Analiza statystyczna: sprawdzanie rozkładu danych, średnich, median, odchyleń standardowych, wykrywanie wartości odstających za pomocą z-score lub IQR.
- Sprawdzanie brakujących wartości: identyfikacja i obsługa NaN lub pustych wartości.
- Weryfikacja typów i formatów: upewnienie się, że dane odpowiadają oczekiwanym typom (liczby, łańcuchy) i formatom (np. daty).
- Sprawdzanie duplikatów: usuwanie lub obsługa powtarzających się rekordów.
- Krosowa weryfikacja z regułami biznesowymi: np. wiek nie może być ujemny.
Przykład w Pythonie z użyciem pandas:
import pandas as pd
data = pd.read_csv('data.csv')
# Sprawdzanie brakujących wartości
print(data.isnull().sum())
# Statystyki
print(data.describe())
# Wykrywanie wartości odstających za pomocą IQR
Q1 = data['feature'].quantile(0.25)
Q3 = data['feature'].quantile(0.75)
IQR = Q3 - Q1
outliers = data[(data['feature'] < Q1 - 1.5 * IQR) | (data['feature'] > Q3 + 1.5 * IQR)]
print(outliers)
Regularne sprawdzanie danych pomaga poprawić jakość modelu i unikać błędów podczas treningu.