Wie funktioniert der Abfrageoptimierer in Oracle, worauf achtet er und zu welcher Klasse gehört er?
Data Engineer
Was ist der Zweck der Aufteilung von Daten in Blöcke im HDFS?
Wie haben Sie mit Impala gearbeitet?
Worin besteht der Unterschied zwischen HDFS und herkömmlichen verteilten Dateisystemen?
Wie funktioniert MapReduce, insbesondere die Reduce-Phase?
Was ist YARN und wozu wird es benötigt?
Wie haben Sie mit CI/CD gearbeitet?
Wie haben Sie Daten aus S3 in Greenplum geladen?
Was ist Shuffle in Spark und warum ist es wichtig, es zu minimieren?
Wie sieht man den Ausführungsplan einer Abfrage in Oracle? Worin unterscheidet sich EXPLAIN PLAN von EXPLAIN ANALYZE?
Erzählen Sie uns von der Verwendung von PL/SQL-Prozeduren in Ihrer Arbeit.
Was ist ein Broadcast-Join in Spark?
Haben Sie Erfahrung in der Optimierung von Spark-Aufgaben? Können Sie ein konkretes Beispiel nennen?
Haben Sie mit inkrementellen und vollständigen Ladungen gearbeitet? Wie sind Sie mit Duplikaten umgegangen?
Mussten Sie jemals Pakete in Oracle schreiben?
Was ist Hive und wie unterscheidet es sich von herkömmlichen relationalen Datenbanken?
Was ist der Unterschied zwischen RANK und DENSE_RANK?
Wie wird eine Datei aus HDFS gelesen, zum Beispiel Parquet — vollständig oder in Blöcken?
Was ist der Vorteil der Spaltenspeicherung gegenüber der Zeilenspeicherung?
Wie funktioniert die Partitionierung in Hive und wie wird sie physisch im Dateisystem dargestellt?