Kas yra indeksai duomenų bazėse, kam jie skirti ir koks jų vidinis struktūra?
Data Engineer
Papaskink apie savo darbo patirtį paskutiniuose darbuose, kokie projektai, koks technologijų rinkinys?
Kuo skiriasi UNION ir UNION ALL? Kokios sąlygos turi būti įvykdytos?
Kokias SQL operatorių grupes žinote? Kam jos priklauso?
Kaip veikia Hash Join?
Kas yra Catalyst optimizatorius Spark ir kokius konkrečius optimizavimus jis atlieka (pvz., predicate pushdown)?
Kodėl atsiranda deadlock'ai ir kuris mechanizmas duomenų bazėse užtikrina duomenų nuoseklumą atliekant lygiagrečius užklausimus?
Kaip tikrinate duomenų tikslumą, kai verčiate pipeline iš SAS į DBT?
Ar dirbote su duomenų kokybės incidentais?
Kas yra normalizacija? Kokioje formoje daugiausia dirbame?
Kodėl pasirinkote būtent DBT? Kokius privalumus ir trūkumus matote šiame framework'e?
Kokiu etapu, kokie patikrinimai atliekami ir kas vyksta su nevalidiais duomenimis duomenų kokybės (Data Quality) patikros metu?
Kokios yra ypatybės ir skirtumai tarp Set ir List Python'e? Be našumo, kokios kitos ypatybės yra?
Papaskinkite apie įdomią užduotį įmonėje per pastaruosius 2,5 metų, pavyzdžiui, susijusią su ClickHouse.
Kokie yra paskirstymo formatai Greenplum, išskyrus BY column ir RANDOMLY?
Kaip veikia Merge Join (sujungimas su rūšiavimu)?
Ar labiau mėgsti dirbti kaip ekspertas individualiai ar komandoje programuotojų?
Išvardykite SQL užklausos, kurioje yra SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT, vykdymo seką nuo pirmos iki paskutinės.
Mūsų klientų lentelėje yra (id, vardas, adresas ir kt.), produktai (id, pavadinimas ir kt.), prekių judėjimas (čia turime kliento id, prekės, data, kiekis, suma), turime rasti, kurios prekės buvo parduotos sausio 1 d., tik unikalios, ir taip pat parodyti pirkėjo vardą ir...
Kokie fizinio sujungimo tipai egzistuoja (Hash Join, Merge Join, Nested Loop)?