რამდენად კარგად იცნობ Linux/Docker-ს?
Data Engineer
რა არის shuffle Spark-ში და რატომ არის ეს საჭირო?
როგორ მართოთ shuffle Spark-ში (განაწილება, broadcast join და სხვა)?
რა სარგებელს მოაქვს Iceberg ფორმატს ჩვეულებრივ Parquet-თან შედარებით?
გიცნობთ საერთო მაგიდის გამოთქმებს (CTE)? მიანიშნეთ გამოყენების მაგალითი.
სტატისტიკა რა არის მონაცემთა ბაზების მართვის სისტემებში და სარეკლამო ოპტიმიზაციაში?
როგორ ვიპოვოთ Linux-ში ლოგ ფაილში კონკრეტულ სვეტში ქვესიტყვა (მაგალითად, მესამე სვეტში თარიღი)?
[isim] სხვადასხვა მონაცემთა ბაზის მართვის სისტემებთან მუშაობის გამოცდილებაზე საუბრობს, რამდენად ღრმად იყო საჭირო ოპტიმიზაციაში და შიდა დეტალებში ჩაღრმავება.
როგორ შევადაროთ თავდაპირველი („ცოცხალი“) და სამიზნე სია, თუ წყარო მუდმივად იცვლება?
როგორ ორგანიზება გავუკეთოთ Kafka-დან ერთიდაიგივე შეტყობინების წაკითხვას რამდენიმე სხვადასხვა მომხმარებლის მიერ (fan-out)?
განმარტეთ ინკრემენტის დაჭერის ალგორითმი წყაროდან, რათა არაფერი დაკარგოს დატვირთვის სიხშირის ცვლილებისას.
როგორ გადავწყვიტოთ პრობლემა, როდესაც წაკითხვის პროცესი შეიძლება ნახოს ცხრილის შუა (არასამართლიანი) მდგომარეობა მრავალსაფეხურიან ETL-ის დროს Iceberg-ში?
რა არის "მკვდარი კორტეჟი" (dead tuple)?
გააზიარეთ ინდექსების გამოყენების საუკეთესო პრაქტიკა - როდის და რამდენად ხშირად უნდა გამოიყენოთ.
რა არის Spark JDBC და როგორ შეიძლება ეფექტურად ატვირთოთ დიდი სია მის მიერ?
როგორ არის დაკავშირებული Spark-ის განყოფილებები და ცხრილების განყოფილებები (მაგალითად, Iceberg-ში)?
როგორ გამოვავლინოთ მონაცემთა გადახრა (data skew) Spark-ში?
რა არის ტრანზაქციის ჟურნალი (WAL) მონაცემთა ბაზის მართვის სისტემაში და რა მიზნით გამოიყენება?
ჩაწერილობების ჰეშების შედარების მეთოდი გამოიყენებოდა წყაროს და სამიზნე სარეგისტრაციოს შორის განსხვავების გამოთვლისთვის?
რატომ არის საჭირო cache და persist Spark-ში?