Middle
Kuidas kontrollida andmete õigsust?
sobes.tech AI
Vastus AI-lt
Andmete õigsuse kontroll on oluline samm masinõppes ja andmetöötluses. Peamised lähenemisviisid:
- Visuaalne kontroll: graafikute (histogrammid, scatter plotid) loomine anomaaliate ja väliste väärtuste tuvastamiseks.
- Statistiline analüüs: andmete jaotuse, keskmiste, mediaanide, standardhälvete kontroll, väliste väärtuste tuvastamine z-score või IQR abil.
- Puuduvate väärtuste kontroll: NaN või tühjade väärtuste tuvastamine ja töötlemine.
- Tüüpide ja formaatide valideerimine: veendumine, et andmed vastavad oodatud tüüpidele (arvud, stringid) ja formaatidele (nt kuupäevad).
- Duplikaatide kontroll: nende eemaldamine või töötlemine.
- Kross-kontroll ärireeglitega: näiteks, vanus ei tohi olla negatiivne.
Näide Pythonis pandasiga:
import pandas as pd
data = pd.read_csv('data.csv')
# Puuduvate väärtuste kontroll
print(data.isnull().sum())
# Statistika
print(data.describe())
# Väliste väärtuste tuvastamine IQR abil
Q1 = data['feature'].quantile(0.25)
Q3 = data['feature'].quantile(0.75)
IQR = Q3 - Q1
outliers = data[(data['feature'] < Q1 - 1.5 * IQR) | (data['feature'] > Q3 + 1.5 * IQR)]
print(outliers)
Regulaarne andmete kontroll aitab parandada mudeli kvaliteeti ja vältida vigu treeningu ajal.