Hoe werkt de query-optimizer in Oracle, waar kijkt hij naar en tot welke klasse behoort hij?
Data Engineer
Wat is het doel van het verdelen van gegevens in blokken in HDFS?
Hoe werkten jullie met Impala?
Hoe verschilt HDFS van gewone gedistribueerde bestandssystemen?
Hoe werkt MapReduce, met name de Reduce-fase?
Wat is YARN en waar wordt het voor gebruikt?
Hoe hebben jullie met CI/CD gewerkt?
Hoe hebt u gegevens uit S3 in Greenplum geladen?
Wat is shuffle in Spark en waarom is het belangrijk om het te minimaliseren?
Hoe bekijk je het uitvoeringsplan van een query in Oracle? Hoe verschilt EXPLAIN PLAN van EXPLAIN ANALYZE?
Vertel over het gebruik van PL/SQL-procedures in uw werk.
Wat is een broadcast join in Spark?
Heeft u ervaring met het optimaliseren van Spark-taken? Kunt u een concreet voorbeeld geven?
Heb je ooit pakketten in Oracle moeten schrijven?
Heb je gewerkt met incrementele en volledige ladingen? Hoe ging je om met duplicaten?
Wat is Hive en hoe verschilt het van traditionele relationele databases?
Wat is het verschil tussen RANK en DENSE_RANK?
Wat is het voordeel van kolomgebaseerde opslag ten opzichte van rijgebaseerde opslag?
Hoe wordt een bestand uit HDFS gelezen, bijvoorbeeld Parquet — volledig of in blokken?
Vertel over partitionering in Oracle: waarvoor wordt het gebruikt en welke soorten zijn er?