Data Engineer
Kas kirjutas üksustestid? Kas teil on selline kogemus?
Miks te praegu tööpakkumisi kaalute?
Kas olete töötanud parameetrite ja hintidega, mis määravad Broadcast Join kasutamise?
Meil on ORDER BY tellimuste arvust, ja on kaks tellimust 5, veel kaks 3. Kuidas käituvad RANK() ja DENSE_RANK()?
Kuidas sa tavaliselt andmebaasi skeemi koostasid — kas tegid seda käsitsi otse andmebaasis või hoidsid skripte kuskil või kas üldse kasutasid Liquibase'i? Mis oli protsess?
Kas teil on kogemusi dokumentatsiooni kirjutamisel?
Kas Greenplumil on funktsioone ja võimalusi, mis puuduvad tavalises MySQL-s ja teistes dialektides?
Millised on sinu plaanid järgmise 5 aasta jooksul? Millistes valdkondades sooviksid areneda?
Milline füüsiline JOIN-mehhanism kasutatakse transaktsioonide tabeli ühendamisel kalendritabeliga ebavõrdsustingimuse (kuupäev <= kuupäev) alusel?
Mida sa veel Pythonis kirjutasid, välja arvatud Airflow DAG?
Rääkige mulle oma Python tasemest: mida olete kasutanud, kui sügavalt teate objektorienteeritud programmeerimist
Kuidas vähendada DataFrame mälu kasutust Pandas?
Kas tead üldtabeli avaldisi (CTE)? To kasutamise näide.
Kuidas hallata shuffle Sparkis (partitsioneerimine, broadcast join jne.)?
Milliseid jälgimisvahendeid kasutati? Spring Boot 2 ja Spring Boot 3?
Kas teil on kogemusi Spark ülesannete optimeerimisel? Kas saaksite anda konkreetse näite?
Mida sa tead spill kohta Sparkis?
Milline on sinu kogemus ja arusaam vitriinide arvutamiseks mõeldud torujuhtmete (andmetöötlus) ehitamisel?
Mis on LEFT SEMI JOIN ja LEFT ANTI JOIN Spark SQL-is, kas te olete kunagi kasutanud?
Kui me seame tingimuse filtri jaoks tehingu kuupäeva WHERE (pärast LEFT JOIN), kas piirab esimese tabeli (klientide) tulemust?