Data Engineer
Mi történik fizikailag az INSERT, UPDATE és DELETE során a Greenplumban; miért nem szabadul fel a hely a lemezen DELETE után, és miben különbözik a DELETE a TRUNCATE-tól?
Hogyan írnád le kódban, hogy egy érték jelentősen eltér a normál (várt) eloszlástól?
Miért veszhetnek el az adatok? Adj néhány okot.
Hogyan kapcsolódik a rendezés az ablakfüggvényen belül és a végső ORDER BY rendezéshez a lekérdezésben?
Milyen Python könyvtárakkal dolgozott?
Mi az a partícionálás és a dstribúció (sharding)?
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
Mesélj egy érdekes feladatról a cégnél az elmúlt 2,5 évben, például a ClickHouse-szal kapcsolatban.
Mondj egy példát arra, mikor használtál mesterséges intelligenciát rutinszerű folyamatok automatizálására.
Mit csinál a depends_on_past paraméter az Airflow-ban?
Mi a különbség az ACID és a CAP-tétel között?
Hasonlítsa össze az ETL és ELT megközelítéseket: mi a különbség, és mikor alkalmazza mindegyiket?
Hogyan dolgoztak a 1C-vel: közvetlenül az adatbázisból szereztek adatokat, vagy egy buszon keresztül vagy más módon?
Előfordult már, hogy a ClickHouse `Too many parts` hibával találkozott beszúrás közben? Hogyan oldotta meg?
Milyen technikai mezőket használtak a satellites, links és hubs Data Vault-ban?
Kérdés #1 Hány rekordot ad vissza a lekérdezés az inner, left, right, full join segítségével két tábla összekapcsolásakor az id attribútum szerint? t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Tárolták az eredményeket táblázatos nézetekből Parquet vagy más módon az S3-ban?
Mennyit dolgozott összesen Spark-kal, és milyen mélyen merült el benne?
Miért vannak az S3-ban "mappák"/előtagok a kényelem mellett?
Mi történik a PostgreSQL-ben, miután végrehajtottál egy SELECT * FROM [tábla] lekérdezést?