გთხოვთ, მოგვიყევით რეპლიკაციის კონფიგურაციის ამოცანაზე, რომელსაც თქვენ გადაჭარით.
Data Engineer
რა არის ნორმალიზაცია და ER მოდელი, რა მიზნით სჭირდება?
როგორ ავიცილოთ/წაშალოთ მონაცემების გადახრა Spark-ში?
რის დროს გამოიყენება ნორმალიზაცია და როდის დენორმალიზაცია?
რა არის დიაგნოსტიკური ალგორითმი და რა უნდა გავაკეთოთ, თუ სერვერი კვლავ ნელი რჩება რამდენიმე ინდექსის დამატების შემდეგ?
გააზიარეთ Kafka-ს ძირითადი კონცეფციები (მომხმარებელთა ჯგუფი, განყოფილებები, თემები).
რელაციური მონაცემთა ბაზაში შეკვეთის ნელა მუშაობის ტიპიური მიზეზები რა არის?
რა გაურკვეველი პრობლემები შეიძლება წარმოიშვას დიდი სვეტების ჩატვირთვისას (გარდა შესრულების)?
შეთავაზეთ რეგულარული ინკრემენტული დატვირთვის გადაწყვეტა დიდი ცხრილისთვის მოქნილი (ცვლილებადი) განახლების სიხშირით Postgres-დან Data Lake-ში.
როგორ არის დაკავშირებული ფანჯრის ფუნქციის შიგნით სორტირება და შეკითხვის საბოლოო ORDER BY სორტირება?
როგორ მართოთ Spark-ის აპლიკაციის რესურსები, რათა არ გადააჭარბოთ მეხსიერებას მონაცემების მოცულობის ცვლილებისას?
როგორ მუშაობთ პარტიციებთან coalesce და repartition-ის საშუალებით?
რომელი Docker სურათები გჭირდებათ და რატომ?
Shuffle- ის მართვის სხვა მექანიზმები არსებობს გარდა coalesce/repartition-ის?
რისთვის გამოიყენებოდა Spark JDBC-ის პარამეტრები წაკითხვის პარალელიზაციისთვის?