Ποια επιπλέον παραμέτρους DDL/CREATE TABLE γνωρίζετε στο ClickHouse, σε τι επηρεάζουν και σε ποιες περιπτώσεις χρησιμοποιούνται;
Data Engineer
Πώς να υλοποιήσετε την άνιση κατανομή των δεδομένων στη βιτρίνα: 50% στην πρώτη και 25% στις άλλες δύο;
Πώς δημιουργήθηκαν οι πίνακες στο κλασέρ και πώς λύθηκε το πρόβλημα όταν, λόγω του ZooKeeper, έλειπε ένα αντίγραφο σε ένα shard;
Πώς αντιμετωπίσατε τα προβλήματα βελτιστοποίησης όταν το ερώτημα διαρκεί πολύ και πραγματοποιεί πλήρη σάρωση; Πώς θα προσεγγίζατε μια τέτοια νέα εργασία;
Σε ποιες περιπτώσεις μπορεί μια Materialized View στο ClickHouse να παραλείψει δεδομένα ή, αντίθετα, να τα διπλασιάσει;
Πώς ακριβώς διαβάζατε το Parquet;
Πείτε μας περισσότερα για την ανισορροπία δεδομένων μεταξύ των shards: πώς προσδιορίστηκε και πώς χρησιμοποιήθηκε η αντίστοιχη λειτουργία/μηχανισμός;
Έχετε αντιμετωπίσει ποτέ το σφάλμα ClickHouse `Too many parts` κατά την εισαγωγή; Πώς το λύσατε;
Με ποιες βιβλιοθήκες Python εργάστηκες;
Είστε εξοικειωμένοι με τις UDF (Χρησιμοποιημένες Ορισμένες Συναρτήσεις) στο ClickHouse, έχετε εργαστεί με αυτές;
Με ποια παραμέτρους του κινητήρα Distributed στο ClickHouse είστε εξοικειωμένοι;
Πώς διορθώσατε την προκατάληψη των δεδομένων ανά client_id όταν ένας πελάτης ήταν σημαντικά μεγαλύτερος από τους άλλους; Ποιες είναι οι επιλογές;
Πώς θα προχωρούσατε με τη σειρά Materialized View μέσω ενός ενδιάμεσου πίνακα ReplacingMergeTree για να γεμίσετε σωστά τα δεδομένα που υπήρχαν ήδη πριν από την εκκίνηση της νέας MV;
Σε ποια πεδία πραγματοποιήθηκε η συγχώνευση δεδομένων και πώς αφαιρέθηκαν τα διπλότυπα από την βιτρίνα;
Με ποια έκδοση του Airflow εργάστηκες;
Γνωρίζετε το ReplicatedQueue; Έχετε εμπειρία με αυτό;
Πώς οργανώνεται η φόρτωση δεδομένων στο ClickHouse σε έναν μεγάλο πίνακα PostgreSQL, στον οποίο συνεχώς έρχονται νέες εγγραφές με μια μονοτονικά αυξανόμενη πρωτεύουσα κλείδα;