Data Engineer
Mi a különbség a WHERE és a HAVING között?
Milyen elosztási formátumok vannak a Greenplum-ben a BY column és a RANDOMLY mellett?
Hogyan látod a részvételedet a projektben a leírt csapat összetétele alapján?
Mi az a GIL (Global Interpreter Lock), és hogyan működik a Pythonban?
Milyen fizikai JOINokat ismersz?
Mennyire ismeri a Pythont?
Milyen olvasási típus van a Greenplum-ben — soros vagy oszlopos?
Milyen inkrementális betöltési stratégiákat használtál a dbt-ben?
Mesélj többet a Spark-ról: pontosan mi valósult meg, milyen módszereket használtak
Mindig javítják az indexek a teljesítményt, vagy lehetnek degradációk?
Mi az a GIL (Global Interpreter Lock)?
A CTE sok memóriát használ — amikor nagy memóriaigényünk van, mi történik az adatokkal?
Volt-e vezető vagy más irányította a 4 fős csapatot?
Milyen JOIN típusokat ismersz? (logikai)
Hogyan ne öltesd meg a Jupyter-t vagy a Pandas-t memória miatt?
Hogyan készítsünk felfelé történő kiterjesztést (NULL értékeket töltsünk ki az előző nem null értékkel fordított irányban)?
Mi az a dinamikus típusosítás?
Mit jelent az UNBOUNDED PRECEDING az ablakfüggvény határainál?
Mi a különbség a RANK és a DENSE_RANK között?
Hogyan olvasunk be egy 100 gigabájtos fájlt Pythonban?