Πώς λειτουργεί ο βελτιστοποιητής ερωτημάτων στην Oracle, τι κοιτάζει και σε ποια κατηγορία ανήκει;
Data Engineer
Ποιος είναι ο σκοπός του διαχωρισμού των δεδομένων σε μπλοκ στο HDFS;
Πώς δούλευες με το Impala;
Πώς διαφέρει το HDFS από τα συνηθισμένα κατανεμημένα συστήματα αρχείων;
Πώς λειτουργεί το MapReduce, ειδικά η φάση Reduce;
Τι είναι το YARN και ποιος είναι ο σκοπός του;
Πώς εργάστηκαν με CI/CD;
Πώς φορτώσατε δεδομένα από το S3 στο Greenplum;
Τι είναι το shuffle στο Spark και γιατί είναι σημαντικό να το ελαχιστοποιήσουμε;
Πώς βλέπετε το σχέδιο εκτέλεσης ενός ερωτήματος στην Oracle; Πώς διαφέρει το EXPLAIN PLAN από το EXPLAIN ANALYZE;
Πείτε μας για τη χρήση των διαδικασιών PL/SQL στην εργασία σας.
Τι είναι η broadcast join στο Spark;
Έχετε εμπειρία στη βελτιστοποίηση εργασιών Spark; Μπορείτε να δώσετε ένα συγκεκριμένο παράδειγμα;
Έχετε εργαστεί με αυξήσεις και πλήρεις φορτώσεις; Πώς αντιμετωπίσατε τα διπλότυπα;
Έχετε χρειαστεί ποτέ να γράψετε πακέτα σε Oracle;
Τι είναι το Hive και πώς διαφέρει από τις παραδοσιακές σχεσιακές βάσεις δεδομένων;
Πώς διαβάζεται ένα αρχείο από το HDFS, π.χ. Parquet — ολόκληρο ή κατά μπλοκ;
Ποια είναι η διαφορά μεταξύ RANK και DENSE_RANK;
Ποιο είναι το πλεονέκτημα της αποθήκευσης κατά στήλη έναντι της αποθήκευσης κατά γραμμή;
Πώς λειτουργεί η διαμέριση στο Hive και πώς παρουσιάζεται φυσικά στο σύστημα αρχείων;