Kā darbojas Oracle vaicājumu optimizētājs, uz ko tas skatās un uz kādu klasi tas attiecas?
Data Engineer
Kāda ir datu sadalīšanas blokos HDFS jēga?
Kā jūs strādājāt ar Impala?
Kā HDFS atšķiras no parastajām izplatītajām failu sistēmām?
Kā darbojas MapReduce, īpaši Reduce posms?
Kas ir YARN un kam tas ir nepieciešams?
Kā jūs strādājāt ar CI/CD?
Kā jūs ielādējāt datus no S3 uz Greenplum?
Kas ir shuffle Spark un kāpēc ir svarīgi to samazināt?
Kā skatīt vaicājuma izpildes plānu Oracle? Kā atšķiras EXPLAIN PLAN no EXPLAIN ANALYZE?
Pastāstiet par PL/SQL procedūru izmantošanu jūsu darbā.
Kas ir broadcast join Spark?
Vai jums ir pieredze Spark uzdevumu optimizācijā? Vai varat sniegt konkrētu piemēru?
Vai jūs strādājāt ar inkrementālām un pilnām ielādēm? Kā cīnījāties ar dublikātiem?
Vai jums kādreiz bija jāraksta paketes Oracle?
Kas ir Hive un kā tas atšķiras no tradicionālajām relāciju datu bāzēm?
Kā tiek lasīts HDFS fails, piemēram, Parquet — pilnībā vai pa blokiem?
Kāda ir atšķirība starp RANK un DENSE_RANK?
Kāda ir kolonnas glabāšanas priekšrocība salīdzinājumā ar rindas glabāšanu?
Kā darbojas sadalīšana Hive un kā tā ir fiziski attēlota failu sistēmā?