Data Engineer
## mód kérdés # Van egy számokból álló lista. Írjon egy függvényt, amely megtalálja ennek a listának a módját. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Mit ad vissza a find_mode függvény a [1, 2, 3, 3, 4, 5] listára? Magyarázd el lépésről lépésre.
Dolgozott adatüveg (DWH réteg) rendszerrel?
Miért fontolgat most állásajánlatokat?
Dolgozott már olyan paraméterekkel és hint-ekkel, amelyek meghatározzák a Broadcast Join használatát?
Hogyan szoktad megtervezni az adatbázis sémáját — kézzel a adatbázisban, vagy tároltad a szkripteket valahol, vagy egyáltalán a Liquibase-t használtad, mi volt a folyamat?
Lehet, volt tapasztalat a Data Science területén — modellekkel, statisztikákkal való munka?
Milyen fizikai stratégiákat ismer a join végrehajtásához?
Hogyan biztosítható a globális egyediség az elsődleges kulcsban PostgreSQL-ben sharding esetén?
Milyen fizikai JOIN mechanizmust fog használni a tranzakciók táblájának összekapcsolásakor a naptár táblával az egyenlőtlenség feltételével (dátum <= dátum)?
Hogyan működik a Nested Loop Join, és mi az algoritmikus összetettsége? Mekkora az összes három algoritmus összetettsége?
Mit írtál még Pythonban az Airflow DAG mellett?
Milyen fizikai JOIN algoritmusok működnek az adatbázisokban?
Mesélj a Python szintedről: mit használtál, milyen mélyen ismered az OOP-t
Mikor adhatsz visszacsatolást, és vannak-e ajánlataid?
Hogyan működik a Hash Join?
Hogyan optimalizálták a táblákat és lekérdezéseket: partíciók, indexek, kiválasztási logika?
Milyen típusú típusosítás van Pythonban: statikus vagy dinamikus?
Hogyan találhatunk meg egy al-szöveget egy adott oszlopban lévő log fájlban Linux alatt (például a dátum a harmadik oszlopban)?
Mi az a shuffle a Sparkben és miért fontos minimalizálni?