Sobes.tech
Middle

Kuidas kontrollida andmete õigsust?

sobes.tech AI

Vastus AI-lt

Andmete õigsuse kontroll on oluline samm masinõppes ja andmetöötluses. Peamised lähenemisviisid:

  • Visuaalne kontroll: graafikute (histogrammid, scatter plotid) loomine anomaaliate ja väliste väärtuste tuvastamiseks.
  • Statistiline analüüs: andmete jaotuse, keskmiste, mediaanide, standardhälvete kontroll, väliste väärtuste tuvastamine z-score või IQR abil.
  • Puuduvate väärtuste kontroll: NaN või tühjade väärtuste tuvastamine ja töötlemine.
  • Tüüpide ja formaatide valideerimine: veendumine, et andmed vastavad oodatud tüüpidele (arvud, stringid) ja formaatidele (nt kuupäevad).
  • Duplikaatide kontroll: nende eemaldamine või töötlemine.
  • Kross-kontroll ärireeglitega: näiteks, vanus ei tohi olla negatiivne.

Näide Pythonis pandasiga:

import pandas as pd

data = pd.read_csv('data.csv')

# Puuduvate väärtuste kontroll
print(data.isnull().sum())

# Statistika
print(data.describe())

# Väliste väärtuste tuvastamine IQR abil
Q1 = data['feature'].quantile(0.25)
Q3 = data['feature'].quantile(0.75)
IQR = Q3 - Q1
outliers = data[(data['feature'] < Q1 - 1.5 * IQR) | (data['feature'] > Q3 + 1.5 * IQR)]
print(outliers)

Regulaarne andmete kontroll aitab parandada mudeli kvaliteeti ja vältida vigu treeningu ajal.