როგორ გამოიყენებთ Python-ს თქვენს მუშაობაში და სად გრძნობთ თავს უფრო თავდაჯერებულად: Python-ში თუ SQL-ში?
Data Engineer
101 ობიექტი არსებობს: 100 ობიექტი კლასი 0 და 1 ობიექტი კლასი 1. პირველი მოდელი ყველა ობიექტს ერთნაირ ქულას აძლევს. რა არის მისი ROC AUC და ROC გრაფიკის ფორმა?
როგორ შევამოწმოთ დროის სერია სტაციონარობისთვის?
ანალიტიკოსმა დაწერა SQL სვეტი. გთხოვთ, გამოავლინოთ სვეტის არასასურველი ეფექტურობა და როგორ უნდა თავიდან აიცილოთ. სვეტი ორი ცხრილს აერთიანებს: - ფაქტობრივი ცხრილი 'events' with key 'event_id' - ტრეფიკის წყაროს რეფერენციული ცხრილი with key 'referer_str' ორივე ცხრილში არის მილიარდობით ჩანაწერი. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
მიზანი არ არის უარყოფითი და ოთხი ალგორითმი: ხაზოვანი რეგრესია, გადაწყვეტილების ხე, შემთხვევითი ტყე და გრადიენტული ბუსტინგი ხეებზე. რომელთაგან შეიძლება გამოიღოს უარყოფითი პროგნოზები?
მონაცემები ჩატვირთულია ReplacingMergeTree ცხრილში; რა მოხდება წაკითხვის დროს, თუ მერჯი ჯერ კიდევ არ მომხდარა, და როგორ მიიღოთ ჩანაწერების უახლესი ვერსია?
დენორმალიზაცია რა არის?
შესაძლებელია დუბლიკაციის და შემდგომი მონაცემების spill-ის გაერთიანება ცალკე სვეტების გამოყენების გარეშე; და თუ კი, როგორ?
რა არის ჰიპოთეზის ტესტირება? რა არის ტიპი I და ტიპი II შეცდომები და p-ფუნქცია?
ინდექსების სტრუქტურები რა არის და როგორ მუშაობენ?
PostgreSQL-ში დავალებების შესრულების სიჩქარის გაზრდის რა გზებს იცნობთ?
რა არის სტაციონარული დროის სერია და რატომ არის სტაციონარობა კლასიკურ მოდელებში მნიშვნელოვანი?
რა არის ბაგინგი და ბუსტინგი, და როგორ განსხვავდებიან?
PostgreSQL/Greenplum-ში ვიტრინების შექმნისას JOIN-ის გამოყენების მახასიათებლები როგორია, შედარებით ClickHouse-თან?
თქვენ გეცოდინებათ uplift მოდელირებაზე? რა იცით ამის შესახებ?
როგორ დავიცვათ ცხრილი ზრდა, თუ მონაცემების შენახვა დროით შეზღუდულია, მაგალითად, ორი წელი?
რა არის ROC AUC?
ტაბლოში უნდა გადაამოწმოთ, თუ მომხმარებლებს რამდენიმე ელფოსტა აქვთ. თუ არიან, წაშალეთ ისინი (მხოლოდ ბოლო ჩანაწერი დარჩეს create_date-ის მიხედვით).
რა არის watermark Spark Structured Streaming-ში?
რა არის ნორმალიზაცია და როდის გამოიყენება?