Middle
Pandasda xotira sig‘maydigan katta fayllarni qanday ishlash muammosidan qochish mumkin?
sobes.tech AI
AIdan javob
Pandasda katta fayllarni ishlash uchun, ular operativ xotiraga sigʼmaydigan bo‘lsa, bir nechta yondashuvlardan foydalanish mumkin:
- Qism-qism o‘qish (chunking)
pd.read_csv()kabi o‘qish funksiyalaridachunksizeparametridan foydalaning, shunda ma’lumotlarni bo‘laklarga bo‘lib yuklab, ularni alohida ishlash mumkin:
import pandas as pd
chunksize = 10**6 # bir bo‘lakdagi satrlar soni
for chunk in pd.read_csv('large_file.csv', chunksize=chunksize):
# har bir bo‘lakni alohida ishlash
process(chunk)
-
Katta ma’lumotlar bilan ishlash uchun kutubxonalar
- Dask DataFrame — Pandas bilan mos API, lekin kechiktirilgan hisoblash va tarqatilgan ishlashni qo‘llab-quvvatlaydi.
- Vaex — barcha ma’lumotlarni xotiraga yuklamasdan katta ma’lumotlar bilan ishlash imkonini beradi.
-
Ma’lumot turlarini optimallashtirish Ma’lumotlarni o‘qishda, ustun turlarini aniq ko‘rsating, bu xotira iste’molini kamaytiradi (masalan, takrorlanadigan qiymatlari bo‘lgan satr ustunlari uchun
categorydan foydalaning). -
Ma’lumotlar bazasi yoki qisman yuklashni qo‘llab-quvvatlovchi formatlardan foydalanish Ma’lumotlarni SQLite kabi bazaga yuklab, bo‘lak-bo‘lak so‘rovlar qilish mumkin.
Shu tarzda, qism-qism o‘qish va turlarni optimallashtirishni birlashtirib, Pandasda katta fayllar bilan samarali ishlash mumkin.