Data Engineer
Mondjon egy példát, amikor sikerült javítani a folyamatokat vagy eszközöket a csapat számára.
Van tapasztalata CI/CD pipeline-ok beállításában, például GitLab?
Mi a különbség a WHERE és a HAVING között SQL-ben?
Létrehoz egy audit_logs táblát, ahol az időpontot és az pontos időt kell tárolni időzónával együtt. Melyik adattípus a legmegfelelőbb? idő időzónával intervallum időbélyeg időzónával dátum időbélyeg időzóna nélkül
Meséljen az indexek alkalmazásának legjobb gyakorlatairól - mikor és milyen gyakran használja őket.
A streaminggel működött az Iceberg, hallottad? Ez egy szemét fájltároló.
Mi a különbség a Greenplum és a PostgreSQL között?
Mik a Set és List Pythonban? A teljesítményen kívül milyen más jellemzők vannak?
Egy S3 vödröt használtak vagy többet? Milyen elv szerint?
Hogyan észleljük az adatok torzulását (data skew) Spark-ben?
Miért volt szükséged általában a Data Vault-ra?
Mennyire ismeri a Linux/Docker-t?
Szükség volt-e arra, hogy közvetlenül kapcsolatba lépjen Data Scientistokkal, és összegyűjtse az ő követeléseiket?
Hogyan szervezed általában a feladatokon végzett munkádat, és hogyan követed nyomon a haladást?
Milyen sorrendben hajtódnak végre az SQL fő műveletei: SELECT, FROM stb.?
Hogyan töltötték be a külső táblából származó adatokat a cél táblákba?
Van kérdése a csapatról és a szerepről?
Kik voltak az adatok fogyasztói, és hogyan épültek a vitrinek?
Hogyan akadályozhatjuk meg, hogy a helytelen adatok, amelyek a vitrinbe vagy közbenső táblába kerültek, eljussanak a felső pipeline-okba?
Meséljen magáról, hol dolgozott, mivel foglalkozott, milyen érdekes feladatok és kudarcok voltak.