Data Engineer
Neden sıralamayı ayrı bir CTE'ye çıkarmaya karar verdiniz? Neden doğrudan ilk CTE'de kullanılamadı?
Coalesce ve repartition kullanarak bölümlerin nasıl çalışılır?
Kayıt zaten mevcut olduğunu ve tekrar kaydetmeye gerek olmadığını nasıl belirlediniz?
NULL artı 5 — kaç olur?
Spark'ta tek bir Parquet dosyasından verileri paralel okuyabilir miyiz, yoksa sadece bir görevde bir çekirdek mi kullanılır?
Hangi dosya formatlarıyla çalıştınız?
Spark'ta hangi fiziksel JOIN türleri vardır?
ClickHouse'daki Distributed motorunun hangi parametreleriyle tanışıyorsunuz?
Kendinizden bahsedin: deneyimler, görevler, özellikler veya gurur duyduğunuz başarılar.
FastAPI ile ilgili deneyiminiz var mı?
İstatistiksel kontroller yaptın mı?
Python'da dekoratör nedir?
Verileri üç şarta eşit olmayan şekilde dağıtmak için nasıl uygulayabilirsiniz: ilk şarta %50 ve diğer ikisine %25?
Spark'ta tembel işlemler nedir ve ne işe yararlar?
Hangi durumda sözlükte arama en kötü duruma kadar gerileyebilir?
Veri tutarsızlığıyla nasıl başa çıkılır?
# ne çıktı verir s = 'abracadabra' print(s[5][0][0][0]) print(s[::-2]) s = [1, 2, 3] print(s * 2)
Veri kalitesini nasıl takip ediyordunuz?
Hangi veritabanlarıyla çalıştınız? MongoDB nasıl çalışır ve nasıl ölçeklenir?
Bir müşterinin diğerlerinden önemli ölçüde büyük olduğu durumda client_id verilerindeki önyargıyı nasıl düzelttiniz? Hangi seçenekler var?