ჩვენ ჩვეულებრივ რა ძირითადი პარამეტრები ვაყენებთ DAG დავალებებისთვის და რატომ უნდა იყოს გრაფი სწორედ ასეთი (DAG-ის მაღალ დონეზე ლოგიკა)?
Machine Learning / AI
დამუშავებულხარ თუ არა Spark-თან? რა არის შენი ზოგადი წარმოდგენა იმის შესახებ, რა არის ეს?
როდესაც ვსაუბრობთ კლასების დისბალანსზე, რა მეტრიკები არის შესაბამისი და რა არა?
დაწერილია სტრიქონი, რომელიც შეიცავს ასოებს და რიცხვებს. იპოვეთ მაქსიმალური რიცხვი, რომელიც გამოჩნდება სტრიქონში (გათვალისწინებული უწყვეტი რიცხვები ერთ რიცხვად).
Python-ში სტრიქონების კონკატენაციაში რა ხდება (მაგალითად, current += char)? რატომ შეიძლება ეს მიდგომა იყოს ცუდი ამ ამოცანაში და როგორ შეიძლება ოპტიმიზაცია გავაკეთოთ კოდის, რათა თავიდან ავიცილოთ ხშირი სტრიქონების კონკატენაცია?
თქვენ ოდესმე შეხვედრილხართ შემთხვევით ტყეს (სამუშაო ან სკოლაში)? რა ძირითადი განსხვავებებია შემთხვევით ტყესა და ბუსტინგს შორის?
როგორ გადაჭრიდით იგივე პრობლემას ბოლო კლიკის მოძიებაში JOIN-ის გამოყენების გარეშე?
თქვენ მუშაობდით Airflow ან Spark-თან? დაწერეთ, რა არის DAG Airflow-ში, შეგიძლიათ მიაწოდოთ თქვენი გამოცდილებიდან მაგალითი? თქვენ თავად დაწერეთ DAG-ები თუ მხოლოდ გამოიყენეთ/ჩართეთ?
რატომ აჩვენებს კლასების დისბალანსის დროს სიზუსტე არასათანადოდ ხარისხის მნიშვნელობას?
გქონდათ დროის სერიების სამუშაო გამოცდილება? რა მეტრიკები გამოიყენება დროის სერიების პროგნოზირების მოდელების ხარისხის შეფასებისთვის?
მოცემულია logs ცხრილი, სადაც არის მომხმარებლების მოვლენები (user_id, item_id, action_type, timestamp). დაწერეთ SQL სვეტი, რათა თითოეულ მომხმარებელზე იპოვოთ ბოლო დაწკაპუნების პროდუქტის ID.
100 მონეტა არსებობს, რომელთაგან ერთ-ერთი ფალსიფიკატია — ორივე მხარეს ორი არწივი. ჩვენ შემთხვევით ერთ მონეტას ვირჩევთ, ვაგდებთ და არწივი გამოდის. რა არის ფალსიფიკატური მონეტის ალბათობა? ახსენით გადაწყვეტილება (ბეისის ფორმულას გამოყენებით).
თუ მოდელისთვის ოპტიმალური ხეების რაოდენობა 500-ია, მაგრამ შემთხვევით შევასწავლეთ როგორც შემთხვევითი ტყე, ასევე ბუსტინგი 1000 ხით, რომელ მოდელს სავარაუდოდ მეტი გადამეტება აქვს და რატომ?
რატომ შეიძლება Spark-ის ამოცანა გაჩერდეს და ძალიან დიდხანს გაგრძელდეს?