DAG görevleri için genellikle hangi temel parametreleri ayarırız ve neden grafik tam olarak böyle olmalı (DAG'ın üst düzey mantığı)?
Machine Learning / AI
Spark ile çalıştınız mı? Bu nedir hakkında genel bir fikriniz nedir?
Sınıf dengesizliklerinde metriklerden bahsederken, hangileri uygun ve hangileri değil?
Harfler ve rakamlar içeren bir dize verildiğinde. Dizideki en büyük sayıyı bulun (ardışık rakamları tek bir sayı olarak düşünerek).
Python'da dizelerin birleştirilmesi (örneğin, current += char) sırasında ne olur? Bu yaklaşım bu görevde neden kötü olabilir ve kodu, sık sık dize birleştirmeden nasıl optimize edebilirsiniz?
İşte veya okulda rastgele orman ile karşılaştınız mı? Rastgele orman ile boosting arasındaki temel farklar nelerdir?
JOIN kullanmadan aynı tıklama arama problemini nasıl çözerdiniz?
Airflow veya Spark ile çalıştınız mı? Airflow'da DAG nedir anlatın, deneyiminizden bir örnek verebilir misiniz? Kendiniz mi DAG yazdınız yoksa sadece kullandınız/çalıştırdınız mı?
Sınıf dengesizliği durumunda neden doğruluk uygun olmayan bir kalite değeri gösterir?
Zaman serileri ile çalışma deneyiminiz var mı? Zaman serileri tahmin modellerinin kalitesini değerlendirmek için hangi metrikler kullanılır?
100 madeniye var, bunlardan biri sahte — her iki tarafında da kartal olan. Rastgele bir madeniye seçiyoruz, atıyoruz ve kartal çıkıyor. Madeniye sahte olma olasılığı nedir? Çözümü açıklayın (Bayes formülü kullanılarak).
Kullanıcı olayları (user_id, item_id, action_type, timestamp) içeren logs tablosu verildiğinde. Her kullanıcı için tıkladığı son ürünün ID'sini bulmak için bir SQL sorgusu yazın.
Model için en uygun ağaç sayısı 500 ise, ancak yanlışlıkla hem rastgele orman hem de boosting'i 1000 ağaçla eğittiysek, hangisi muhtemelen aşırı öğrenmiş olur ve neden?
Spark'ta bir görev neden takılıp çok uzun sürebilir?