Használtad már az XCom-ot az Airflow-ban?
Data Engineer
Mondja el az Oracle partícionálásáról: mire használják és milyen típusai vannak?
Milyen más fájlformátumok, a Parquet mellett, működnek jól a Hadoop és Hive rendszerekkel?
Mikor használhatjuk a CSV-formátumcsaládot?
Meg lehet nézni a tábla sémáját a Hive-ben történő lekérdezés előtt?
Mindig megfelel az EXPLAIN végrehajtási terve annak, ami valójában végrehajtódik?
Miért választják szét a nézeteket (VIEW) és a táblákat? Mire jók a nézetek?
Mi az a nézet (VIEW) és a materializált nézet (MATERIALIZED VIEW) az Oracle-ben? Hogyan frissülnek az adatok a materializált nézetben?
Hogyan lehet megtudni egy lekérdezés valódi végrehajtási tervét az Oracle-ban?
Mi a lazító műveletek a Sparkben, és mire valók?
Mesélj a korábbi projektedről, mik voltak a feladataid?
Dolgozott már Oracle Data Integrator (ODI) rendszerrel?
Hogyan felel meg tapasztalata a pozíció feladataihoz: a betöltési folyamatok kísérése és elemzése, anomáliák figyelése és felismerése, tesztelés és fejlesztések telepítése a gyártásban, második szintű támogatás, műszaki dokumentáció ellenőrzése?
Volt egy lassú analitikus lekérdezés Hive-ben. Hogyan lehet megérteni, mi történt vele, és hogyan lehet kijavítani?
Emlékszel a lekérdezés-optimalizálási tapasztalatodra? Hogyan cselekedtél, elemeztél?
Mik az előnye és hátránya a elosztott adatbázis rendszereknek?
Milyen volt az architektúrád a projektben? DWH vagy valami más?
Dolgoztál már ablakfüggvényekkel? Milyen típusú ablakfüggvényeket ismersz?
Dolgoztál már batch- vagy streaming feltöltéssel?
Mi a különbség a több szálú feldolgozás és a többprocesszoros feldolgozás között? Milyen feladatokhoz használjunk szálakat, és milyen feladatokhoz folyamatokat?