Data Engineer
Milyen típusú típusosítás van Pythonban: statikus vagy dinamikus?
Van egy ügyfél táblánk (azonosító, név, cím stb.), termékek (azonosító, név stb.), termékmozgás (itt van ügyfél azonosító, termék, dátum, mennyiség, összeg), meg kell találni, mely termékeket adták el január 1-jén, csak az egyedi, és meg kell mutatni a vásárló nevét és...
Hogyan hasonlítsuk össze az eredeti („élő”) és a cél táblázatot, ha a forrás folyamatosan változik?
Hogyan kapcsolódnak a Spark partíciók és a táblák (például Iceberg) partíciói?
Mi az a shuffle a Sparkben és miért fontos minimalizálni?
Milyen feladatot oldottál meg legutóbb Pythonban a termelésben?
Mikor használhatjuk a CSV-formátumcsaládot?
Hogyan oldja meg a problémát, amikor az olvasási folyamat láthatja a táblázat közbenső (inkonzisztens) állapotát több lépéses ETL (delete+insert) során az Iceberg-ben?
Hogyan alkalmazhatok egy függvényt az összes sorra vagy elemre pandasban?
Mire kell figyelni a memória, a sebesség és a pontosság szempontjából nagy XML-ek parsolásakor?
Hogyan olvastad pontosan a Parquet-et?
Milyen esetekben hagyhat ki adatokat vagy duplikálhatja azokat a ClickHouse Materialized View?
Mi az a Materializált Nézet és miben különbözik egy normál Nézettől?
Szeretsz inkább egyedül, szakértőként dolgozni, vagy fejlesztői csapatban?
Mi az a partícionálás? Mi az a sharding? Mi az a replikáció?
Hogyan szervezik a kiadások a DBT-ben? Használod az Airflow-t?
Milyen adatforrásokkal tudott dolgozni? Hogyan zajlott az interakció a forrásokkal?
Feladat #3 Olyan ügyfeleket kell találni, akiknél a rendeléseik közötti különbség nagyobb, mint 60 nap. Ezeknél az ügyfeleknél mutassa meg a maximális különbséget (gap_days). Rendelési tábla: | order_id | customer_id | order_dt | |----------|-------------|------------| | 1 | 1 | [phone] | | 2 | 1 | [phone] | | 3 | 1 | [phone] | | 4 | 1 | [phone] | | 5 | 2 | [phone] | | 6 | 2 | [phone] | | 7 | 3 | [phone] | Végső eredmény: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 |
Mit lehet mondani a következő lekérdezés helyességéről? select * from sessions where ended_at is null and status != 'pending';
[név] kérdezte: Mit kell hozzáadni a táblamotorhoz, hogy az adatok minden csomóponton naprakészek maradjanak a klaszterben?