Hogyan terveznéd meg skálázható adatbetöltést több REST API-ból: az adatok beszerzésétől az S3-ig, egy elemző számára interfésszel?
Data Engineer
Mi az a procedurális SQL?
Meséljen magáról és adat engineering területi tapasztalatáról.
101 tárgy van: 100 nulla és 1 egy. A pontszám szerinti rendezés után először 50 nulla, majd egy, aztán még 50 nulla következik. Mi az ROC AUC és az ROC görbe alakja?
Milyen hátrányai vannak az indexeknek azon kívül, hogy helyet foglalnak?
A gradiens boostingban már felépült egy N alap algoritmusból álló összetétel. Mi lesz az új, N+1-edik algoritmus célja?
Miért hasznosak a lusta értékelések?
Mi az adatspill Spark-ben, és hogyan lehet elkerülni, ha nem lehet egyszerűen erőforrásokat hozzáadni?
Hogyan kezelnéd a nagy terhelésű adattranszformációkat?
Hogyan különböznek a Spark indítási módjai: cluster, client és local?
Mik az előnyei és hátrányai annak, ha egy API betöltőt egyedi Airflow operátorként/hook-ként valósítunk meg, összehasonlítva egy külön könyvtárral vagy konténeres szolgáltatással?
2. Van egy t nevű táblázat, amely felsorolja az ügyfelek napi tranzakcióinak összegét: - Írjon egy lekérdezést, amely minden sor esetében megmutatja az ügyfél tranzakcióit a jelenlegi és az előző naptári napon Az utolsó táblázat alább található:
Mi azok a lusta értékelések, és hogyan értelmezzük őket?
Milyen tipikus feladatokat oldottál meg az Airflow-ben?
Dátum, rendelési szám, összeg select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Mi az a csillagmodell és a Data Vault?
Meséljen magáról: hol dolgozott utoljára, mit csinált, mit keres és miért?
Hol találhatók a Driver és az Executors a cluster módban, és miért használják ezt a gyártásban?
Hol fordul pontosan a gradiens a gradient boosting algoritmusban, ha az alap algoritmus egy egyszerű döntési fa?
Milyen összetevőkből áll a Greenplum és a Hadoop HDFS?