Parquet'te hangi sıralama veya sıkıştırma türü kullanılır?
Data Engineer
API dışında, veri kaynaklarıyla çalışmak için başka hangi yöntemler ve protokoller kullandınız?
1C ile nasıl çalıştılar: verileri doğrudan veritabanından mı alıyorlardı, yoksa bir iletişim hattı veya başka bir yöntemle mi?
OpenMetadata kaynaklarını tarayan ingestion süreçlerini yazdın mı?
Veri kalitesi sınırı tetiklendiğinde ne oluyordu: uyarı, çökme, yeniden başlatma?
Neden ORC yerine Parquet kullanıldı?
S3'te "klasörler"/ön ekler neden gereklidir, kullanışlılığın ötesinde?
Satellitler, bağlantılar ve hub'larda hangi teknik alanlar kullanıldı?
Portal üzerinden dosya veya veri almak için FTP ile çalıştınız mı?
S3'te tablo görünümlerinin sonuçlarını Parquet veya başka bir şekilde sakladınız mı?
S3'te bucket veya nesnelerde etiketler ayarladınız mı?
Kayıt zaten mevcut olduğunu ve tekrar kaydetmeye gerek olmadığını nasıl belirlediniz?
Hangi dosya formatlarıyla çalıştınız?