Kas ir indeksi datu bāzēs, kam tie ir nepieciešami un kāda ir to iekšējā struktūra?
Data Engineer
Pastāsti par savu darba pieredzi pēdējās vietās, kādi projekti, kāds tehnoloģiju klāsts?
Kāda ir atšķirība starp UNION un UNION ALL? Kādi nosacījumi jāievēro?
Kuras SQL operatoru grupas pazīsti? Pie kā tās pieder?
Kas ir Catalyst optimizators Spark un kādus konkrētus optimizācijas piemērus tas veic (piemēram, predicate pushdown)?
Kā darbojas Hash Join?
Kā jūs pārbaudāt datu pareizību, pārvēršot pipeline no SAS uz DBT?
Kāpēc notiek deadlocki un kāds mehānisms datu bāzēs ir atbildīgs par datu saskaņotību paralēlajās vaicājumos?
Vai esat strādājis ar datu kvalitātes incidentiem?
Kas ir normalizācija? Galvenokārt ar kādu formu strādājam?
Kāpēc izvēlējāties tieši DBT? Kādas priekšrocības un trūkumus redzat šajā ietvarā?
Kādā posmā tiek veikti datu kvalitātes (Data Quality) pārbaudes, kādas pārbaudes tiek veiktas un kas notiek ar nederīgiem datiem?
Pastāstiet par interesantu uzdevumu uzņēmumā pēdējo 2,5 gadu laikā, piemēram, saistītu ar ClickHouse.
Kādas ir iezīmes un atšķirības starp Set un List Python? Papildus veiktspējai, kādas citas iezīmes ir?
Kā darbojas Merge Join (savienojums ar kārtošanu)?
Vai tev patīk vairāk strādāt kā eksperts individuāli vai izstrādātāju komandā?
Sarakstiet SQL vaicājuma ar SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT operāciju izpildes secību no pirmās līdz pēdējai.
Kādi ir sadales formāti Greenplum, izņemot BY column un RANDOMLY?
Mums ir tabula ar klienti (id, vārds, adrese utt.), produkti (id, vārds utt.), preču kustība (šeit ir mums klients id, produkts, datums, daudzums, summa), mums jāatrod, kādi produkti tika pārdoti 1. janvārī, tikai unikālie, un arī jāparāda pircēja vārds un...
Kāpēc tu tagad meklē jaunu darbu, vēlies mainīt darbu?