როგორ დაგეგმავდით მასშტაბურ მონაცემთა ჩატვირთვას მრავალი REST API-დან: მონაცემების მიღებიდან S3-მდე, ანალიტიკოსისთვის ინტერფეისით?
Data Engineer
პროცედურული SQL რა არის?
გვითხარით საკუთარ შესახებ და მონაცემთა ინჟინერიის გამოცდილებაზე.
101 ობიექტი არსებობს: 100 ნული და 1 ერთი. შეფასების მიხედვით სორტირების შემდეგ, პირველ რიგში მოდიან 50 ნული, შემდეგ ერთი, და კიდევ 50 ნული. რა არის მისი ROC AUC და ROC გრაფიკის ფორმა?
ინდექსების უარყოფითი მხარეები გარდა მათი დაკავებული ადგილისა რა არის?
გრადიენტული ბუსტინგში უკვე აშენებულია N ძირითადი ალგორითმების კომპოზიცია. რა იქნება ახალი, N+1-ე ალგორითმის მიზანი?
რატომ არის მორიდებული შეფასებები სასარგებლო?
რა არის data spill Spark-ში და როგორ უნდა თავიდან აიცილოთ იგი, თუ რესურსების მარტივად დამატება შეუძლებელია?
როგორ მართავდით მაღალი დატვირთვის მონაცემთა ტრანსფორმაციებს?
როგორ განსხვავდება Spark-ის ჩატვირთვის რეჟიმები: cluster, client და local?
რა სარგებელი და ნაკლია API ლოდინის განხორციელება როგორც პერსონალიზებული Airflow ოპერატორის/ჰუქის სახით, შედარებით ცალკე ბიბლიოთეკა ან კონტეინერის სერვისთან?
2. არსებობს ცხრილი t, რომელიც ყოველდღიური ტრანზაქციების ჯამს ასახავს: - დაწერეთ შეკითხვა, რომელიც თითოეულ ხაზზე აჩვენებს მომხმარებლის ტრანზაქციებს მიმდინარე და წინა კალენდარული დღისათვის საბოლოო ცხრილი ქვემოთა:
რა არის მორიდებული შეფასებები და როგორ გავიგოთ ისინი?
Airflow-ში რა ტიპის დავალებებს ხსნით?
თარიღი, შეკვეთის ნომერი, თანხა select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
ვარსკვლავის მოდელები და Data Vault რა არის?
გვითხარით საკუთარ შესახებ: სად მუშაობდით ბოლოს, რა გითავდით, რა გსურთ და რატომ?
სად მდებარეობს Driver და Executors კლასტერულ რეჟიმში და რატომ გამოიყენება იგი წარმოებაში?
გრადიენტული ბუსტინგის ალგორითმში, თუ ძირითადი ალგორითმი მარტივი გადაწყვეტილების ხეა, გრადიენტი სად ხდება?
Greenplum და Hadoop HDFS რა კომპონენტებს შეიცავს?