Sobes.tech
Middle

Pandasda xotira sig‘maydigan katta fayllarni qanday ishlash muammosidan qochish mumkin?

sobes.tech AI

AIdan javob

Pandasda katta fayllarni ishlash uchun, ular operativ xotiraga sigʼmaydigan bo‘lsa, bir nechta yondashuvlardan foydalanish mumkin:

  1. Qism-qism o‘qish (chunking) pd.read_csv() kabi o‘qish funksiyalarida chunksize parametridan foydalaning, shunda ma’lumotlarni bo‘laklarga bo‘lib yuklab, ularni alohida ishlash mumkin:
import pandas as pd

chunksize = 10**6  # bir bo‘lakdagi satrlar soni
for chunk in pd.read_csv('large_file.csv', chunksize=chunksize):
    # har bir bo‘lakni alohida ishlash
    process(chunk)
  1. Katta ma’lumotlar bilan ishlash uchun kutubxonalar

    • Dask DataFrame — Pandas bilan mos API, lekin kechiktirilgan hisoblash va tarqatilgan ishlashni qo‘llab-quvvatlaydi.
    • Vaex — barcha ma’lumotlarni xotiraga yuklamasdan katta ma’lumotlar bilan ishlash imkonini beradi.
  2. Ma’lumot turlarini optimallashtirish Ma’lumotlarni o‘qishda, ustun turlarini aniq ko‘rsating, bu xotira iste’molini kamaytiradi (masalan, takrorlanadigan qiymatlari bo‘lgan satr ustunlari uchun category dan foydalaning).

  3. Ma’lumotlar bazasi yoki qisman yuklashni qo‘llab-quvvatlovchi formatlardan foydalanish Ma’lumotlarni SQLite kabi bazaga yuklab, bo‘lak-bo‘lak so‘rovlar qilish mumkin.

Shu tarzda, qism-qism o‘qish va turlarni optimallashtirishni birlashtirib, Pandasda katta fayllar bilan samarali ishlash mumkin.