Data Engineer
Spark'ta hangi fiziksel JOIN türleri vardır?
ClickHouse'daki Distributed motorunun hangi parametreleriyle tanışıyorsunuz?
ReplicatedQueue ile tanışıyor musunuz? Onunla çalışma deneyiminiz var mı?
Vitrin veya ara tabloya yanlış veriler yüklendiyse, bunların üst pipeline'lara geçmesini nasıl engellersiniz?
ETL ve ELT sırasında depolama alanının hesaplama gücü gereksinimleri nasıl farklılık gösterir?
Toplamda Spark ile ne kadar süre çalıştınız ve ne kadar derinlemesine dahil oldunuz?
Spark'ta tembel işlemler nedir ve ne işe yararlar?
PostgreSQL'de SELECT * FROM [tablo] sorgusu çalıştırıldıktan sonra ne olur?
@ sözdizimi olmadan dekoratör oluşturup uygulayabilir misiniz?
Coalesce ve repartition kullanarak bölümlerin nasıl çalışılır?
Kayıt zaten mevcut olduğunu ve tekrar kaydetmeye gerek olmadığını nasıl belirlediniz?
NULL artı 5 — kaç olur?
Spark'ta tek bir Parquet dosyasından verileri paralel okuyabilir miyiz, yoksa sadece bir görevde bir çekirdek mi kullanılır?
Hangi dosya formatlarıyla çalıştınız?
Kendinizden bahsedin: deneyimler, görevler, özellikler veya gurur duyduğunuz başarılar.
FastAPI ile ilgili deneyiminiz var mı?
İstatistiksel kontroller yaptın mı?
Python'da dekoratör nedir?
Verileri üç şarta eşit olmayan şekilde dağıtmak için nasıl uygulayabilirsiniz: ilk şarta %50 ve diğer ikisine %25?
Hangi durumda sözlükte arama en kötü duruma kadar gerileyebilir?