Data Engineer
NULL plus 5 — kui palju see on?
Kas Sparkis saab paralleelselt lugeda andmeid ühest Parquet-failist või ainult ühe tuumaga ühes ülesandes?
Milliste failivormingutega töötasite?
Millised füüsilised JOIN-id Sparkis eksisteerivad?
Milliste Distributed mootori parameetritega olete ClickHouse'is tuttav?
Kuidas kirjeldaksid koodis kontrolli, et väärtus oluliselt erineb normaaljaotusest (oodatavast)?
Rääkige endast: kogemused, ülesanded, funktsioonid või saavutused, millega olete uhke.
Kas teil on kogemusi FastAPI-ga?
Milleks on S3-s "kaustad"/eesliited, lisaks mugavusele?
Mis on dekoratsioon Pythonis?
Mis on laiskavad operatsioonid Sparkis ja milleks need on vajalikud?
Millises olukorras võib sõnastiku otsing halveneda kuni halvimini?
Kuidas võidelda andmete ebakõla vastu?
Kuidas jälgisite andmete kvaliteeti?
Milliste andmebaasidega olete töötanud? Kuidas töötab MongoDB ja kuidas see skaleerub?
Kuidas te parandasite andmete kallutat client_id järgi, kui üks klient oli oluliselt suurem kui teised? Millised on võimalused?
Kas saab luua ja rakendada dekoraatorit ilma @ süntaksita?
Kuidas töötada partitsioonidega coalesce ja repartition abil?
Kui DAG-i ajakava on @daily, millal see tegelikult käivitub?
Kas tegi statistilisi kontrollereid?