Data Engineer
რა ნიშნავს UNBOUNDED PRECEDING ფანჯრის ფუნქციის საზღვრებში?
ინდექსები ყოველთვის აუმჯობესებს შესრულებას, თუ შეიძლება დეგრადაცია მოხდეს?
როგორ განვაახლოთ ClickHouse-ის ცხრილი ისე, რომ მომხმარებლები არაფერი იგრძნონ (ატომური შეცვლა)?
თუ ტრანზაქციებს მომხმარებლებთან ერთად client_id და date_start (BETWEEN-ის გარეშე) შეერთებთ, რა მიიღება შედეგში?
რა არის სემანტიკური ვერსიით? როდის უნდა გაიზარდოს major, minor, patch?
როგორ დავყოთ მოთხოვნა ეტაპებად? ამისთვის რა გავაკეთოთ?
გააზიარეთ თქვენი მონაცემების ხარისხის შესახებ გაგება — გაქვთ ამ სფეროში გამოცდილება?
სპეციალური თანმიმდევრობა შექმნილია სახელწოდებით even_sequence, რომელიც მხოლოდ ჯამებს ქმნის. რა უნდა ჩასვათ [...]-ის ადგილზე, რათა თუ even_column-ის მნიშვნელობა არ არის მითითებული შეტანაზე, მნიშვნელობა მიიღოს even_sequence-დან? create table some_table( even_column [...] ); integer computed as nextval('even_sequence') integer generated always as identity (start with 2 increment by 2) integer default nextval('even_sequence') integer unique default nextval('even_sequence') integer generated by even_sequence’
რომელი JOIN ტიპებს იცნობ? ახსენი 2-3 ძირითადს.
როგორ სთავაზობს Git Flow-ს ახალი ვერსიის ოფიციალურად ფორმალიზება? - ახალი issue-შაქრის შექმნით - hotfix-შაქრის შექმნით master-დან - განახლების ცალკე შაქრის შექმნით develop-დან - პირდაპირ commit-ით master-შაქარში - პირდაპირ merge-ით master-შაქარი develop-თან
მონაცემთა გაერთიანება რომელ ველებზე მოხდა და როგორ აღმოფხვრეს დუბლიკატები ვიტრინაში?
როგორ განსხვავდება შენახვის გამოთვლითი ძალის მოთხოვნები ETL და ELT დროს?
გვითხარით თქვენი სამუშაო გამოცდილების შესახებ
გიცნობთ თუ არა Domain Driven Design (DDD) მეთოდოლოგიას? თუ კი, გაუზიარეთ მისი გამოყენების მაგალითები თქვენს პროექტებში.
რომელი ქვემოთ მოცემული განცხადება ასახავს ამგვარი მოქმედებების შედეგებს გაფართოებული Git Flow-ის და ცვლილებების ისტორიის მართვის კუთხით?
[სახელი] იკითხა: რომელი სვეტები უნდა იყოს Nullable და როგორ გამოვხატოთ ეს DDL-ში?
მოკლედ ახსენით, როგორ არის მოწყობილი Spark-ის არქიტექტურა: რა კომპონენტები არსებობს და როგორ ურთიერთქმედებენ SQL-საკითხის შესრულების დროს.
როგორ გამოცდილება გაქვთ SQL და რელაციური მონაცემთა ბაზებთან?
ლოგისტიკის კომპანიისთვის ანგარიში თქვენ ხართ ლოგისტიკური კომპანიის ანალიტიკოსი, რომელიც აკრეფს ოპერაციებს საწყობებში. უნდა მოამზადოთ ანგარიში თითოეული საწყობი ეფექტურობის შესახებ. თითოეული საწყობი გამოითვალეთ: • საერთო ოპერაციების რაოდენობა (count_operations); • საწყობში დამუშავებული საერთო საქონლის რაოდენობა (sum_quantity); • ოპერაციის საშუალო დრო (avg_processing_time), მხოლოდ მითითებული დროის ოპერაციებისთვის (არ NULL), მრგვლივ მთელ რიცხვად; • მაქსიმალური და მინიმალური საქონლის რაოდენობა, რომელიც ერთ ოპერაციაში დამუშავდა (max_quantity, min_quantity); • თითოეული ტიპის ოპერაციების რაოდენობა («მიწოდება», «გაგზავნა», «გადატანა») ცალკე სვეტებში: supply_operations, shipment_operations, transfer_operations. ფილტრეთ საწყობები, რომელთა საერთო ოპერაციების რაოდენობა აღემატება 2-ს და საშუალო დრო არ აღემატება 60 წუთს. შედეგი sort-ით დაალაგეთ საწყობი ID-ის მიხედვით ზრდადობით. შესავალი ფორმატი ოპერაციების სია: • operation_id (int) — ოპერაციის უნიკალური ID • warehouse_id (int) — საწყობის ID • operation_type (text) — ოპერაციის ტიპი: «მიწოდება», «გაგზავნა», «გადატანა»
რა არის CDC და გაქვთ თუ არა ამასთან მუშაობის გამოცდილება?