Data Engineer
როგორ ხერხდებოდა ჩვეულებრივ მონაცემთა ბაზის სქემის შექმნა — პირდაპირ ბაზაში ხელით ან სქრიპტებს სადმე ინახავდით, ან საერთოდ იყენებდით Liquibase-ს, რა იყო პროცესი?
რომელი ფიზიკური სტრატეგიები გაქვთ join-ის შესრულებისთვის?
რომელი ფიზიკური JOIN მექანიზმი გამოიყენება ტრანზაქციის ცხრილის და კალენდრის ცხრილის შეუერთებისას არასათანადო პირობით (თარიღი <= თარიღი)?
როგორ მუშაობს Nested Loop Join და რა არის მისი ალგორითმული სირთულე? რა არის ყველა სამი ალგორითმის სირთულე?
Airflow DAG-ის გარდა რა გითქვამ Python-ით?
ტრანზაქციების იზოლაციის დონეები სახელწოდებით არსებობს? ამაზე რა იცით?
Spark-ში repartition და coalesce-ს შორის რა განსხვავებაა?
რა დააბრუნებს find_mode ფუნქცია სიის [1, 2, 3, 3, 4, 5]თვის? ნაბიჯ-ნაბიჯ ახსენი.
ერთეულების ტესტებს დაწერეთ? გაქვთ ასეთი გამოცდილება?
ჩვენ გვაქვს ORDER BY რაოდენობის მიხედვით, და ორი შეკვეთა 5-ია, კიდევ ორი 3-ია. როგორ მოიქცევიან RANK() და DENSE_RANK()?
გაქვს დოკუმენტაციის დაწერის გამოცდილება?
Greenplum-ში არსებობს თუ არა ფუნქციები და შესაძლებლობები, რომლებიც ჩვეულებრივ MySQL-ში და სხვა დიალექტებში არ არის?
რა გამოცდილება და წარმოდგენა გაქვს ვიტრინების გამოთვლის (მონაცემთა დამუშავება) პაიპლაინების მშენებლობაში?
მოყევი მაგალითი, როდესაც შეძლე პროცესების ან ინსტრუმენტების გაუმჯობესება გუნდისთვის.
თქვენ ქმნით audit_logs ცხრილს, სადაც საჭიროა დრო და ზუსტი დრო საათის ზონასთან ერთად. რა მონაცემთა ტიპი არის ყველაზე შესაბამისი? დრო საათის ზონასთან ინტერვალი timestamp საათის ზონასთან თარიღი timestamp საათის ზონას გარეშე
გააზიარეთ ინდექსების გამოყენების საუკეთესო პრაქტიკა - როდის და რამდენად ხშირად უნდა გამოიყენოთ.
გთხოვთ, თქვენი Python-ის დონე აღწერეთ: რა გამოიყენეთ, რამდენად ღრმად იცით ობიექტზე ორიენტირებული პროგრამირება
როგორ შევამციროთ DataFrame-ის მეხსიერების მოხმარება Pandas-ში?
raw.local_transactions ცხრილი შექმენით კლასტერში cluster_4x2 ( transaction_id String, user_id String, amount Float64, created_at DateTime ) მექანიზმი = ReplicatedMergeTree() განყოფილებები გამოიყვანა amount-ზე შესრულება (transaction_id) მიხედვით; raw.transactions ცხრილი შექმენით კლასტერში cluster_4x2 ( transaction_id String, user_id String, amount Float64, created_at DateTime ) მექანიზმი = Distributed('cluster_4x2', 'raw', 'local_transactions', cityHash64(user_id));
როგორ მართოთ shuffle Spark-ში (განაწილება, broadcast join და სხვა)?