Data Engineer
Su kokiomis duomenų bazėmis dirbote? Kaip veikia MongoDB ir kaip ji skaluoja?
Ar galima sukurti ir taikyti dekoratorių be @ sintaksės?
Kodėl nusprendėte išskirti reitingą į atskirą CTE? Kodėl jo negalėjote naudoti iš karto pirmojoje CTE?
Kaip nustatėte, kad įrašas jau egzistuoja ir jo pakartotinai įrašyti nereikia?
NULL plus 5 — kiek tai bus?
Ar galima Spark'e skaityti duomenis paraleliai iš vieno Parquet failo, ar tik vienu branduoliu vienoje užduotyje?
Kas yra RDD Apache Spark ir kaip jis skiriasi nuo kitų Spark abstrakcijų?
Ar atlikote statistinius patikrinimus?
Kam reikalingos "katalogai"/prekių ženklai S3, გარდა patogumo?
Jei DAG tvarkaraštis yra @daily, kada jis iš tikrųjų pradeda veikti?
Kas yra dekoratoriai Python?
Kaip technologiškai buvo įgyvendintas didelės lentelės paralelinis iškrovimas iš PostgreSQL į Spark esant [kontekstui]?
Kas yra dekoratorius Python?
Kaip ne tolygiai paskirstyti šios vitrinės duomenis į tris shard'us: 50% pirmame ir po 25% kituose dviejuose?
Kaip kovoti su duomenų neatitikimu?
Kaip buvo sukurtos lentelės klasteryje ir kaip išsprendėte problemą, kai dėl ZooKeeper trūko replikos viename shard'e?
Kaip stebėjote duomenų kokybę?
Kaip ištaisėte duomenų iškraipymą pagal client_id, kai vienas klientas buvo žymiai didesnis už kitus? Kokios yra galimybės?
Kokiose etapose yra sudaryta operacija?
Kaip dirbti su skaidalais naudojant coalesce ir repartition?