Érvényesül az ACID a Greenplum-ban?
Data Engineer
A Data Vault egy kényelmes eszköz, de sok objektum van. Meg tudnád magyarázni a különbséget a hubok, linkek és szatelitek között?
Milyen folyamatok indulnak el, amikor törlünk vagy módosítunk rekordokat a ClickHouse-ban?
Hogyan bontjuk szakaszokra a kérdést? Mit teszünk ezért?
Ismersz olyan Rustban írt, több szálon futó, nagyon gyors könyvtárat, ami helyettesítheti a Pandas-t Data Science és Big Data esetén?
Mi a különbség a CTE és az al-lekérdezés között?
Milyen technológiákat használtál az adatok Parquet-be töltéséhez, és milyen mechanizmusokat használtak az adatok beszerzéséhez és betöltéséhez?
Töltöttél adatokat Sparkból S3-be Parquet formátumban, majd Parquetből Greenplumba — hogyan zajlik a betöltési folyamat?
Függőségekkel a munkák között, DAG-ok között — használtál szenzorokat, hogy egymás után több munkát indítsanak?
Dolgozott már Git-tel? Mit tárolt Git-ben?
Hogyan szoktad megtervezni az adatbázis sémáját — kézzel a adatbázisban, vagy tároltad a szkripteket valahol, vagy egyáltalán a Liquibase-t használtad, mi volt a folyamat?
A streaminggel működött az Iceberg, hallottad? Ez egy szemét fájltároló.
Hogyan töltötték be a külső táblából származó adatokat a cél táblákba?
Hogyan írtad az Airflow DAG-ot és a feladatokat: kézzel vagy sablonokkal?
Ér-e értelme CTE-t használni, ha csak egyszer használják a lekérdezésben?
Ez valós idejű, hogyan valósítsuk meg a Kafka és a ClickHouse Spark között?
Közvetlenül a Spark-kal dolgozott? Mi a hátránya?
Szükségünk van egy pipeline motorra — egy mechanizmusra, amely lehetővé teszi nagyon gyors folyamatok létrehozását szerződések és paraméterek bemenetével. Hogyan valósítanád ezt magasabb szinten?
JSON-t fogunk parse-olni — ki fogja parse-olni a JSON-t? Tudomásom szerint a ClickHouse-ban nincsenek függvények.
Az Iceberg egy olyan motor, amely lehetővé teszi az S3 adatbázissá alakítását, még az ACID-et is betartja. Mi a hátránya?