Data Engineer
Povedz o zaujímavej úlohe v spoločnosti za posledných 2,5 roka, napríklad súvisiacej s ClickHouse.
Ako pridať kĺzavý priemer súčtu objednávok za aktuálny a predchádzajúce dva dni na používateľa?
Čo je rozdelenie údajov a ako pomáha vyhnúť sa úplnému prehľadávaniu tabuľky?
Čo robí parameter depends_on_past v Airflow?
Ako funguje hash join pre tabuľky s 1 000 a 1 000 000 riadkami?
Na čo ste vôbec potrebovali Data Vault?
Povedzte nám o úlohe s nastavením replikácie, ktorú ste riešili.
Bola použitá metóda porovnávania hashov záznamov na výpočet rozdielu medzi zdrojom a cieľovou tabuľou?
Stretli ste sa chybou ClickHouse `Too many parts` pri vkladaní? Ako ste ju riešili?
S akými formátmi súborov ste pracovali?
Aké typy fyzických JOIN-ov existujú v Spark?
Čo sa fyzicky deje pri INSERT, UPDATE a DELETE v Greenplum; prečo po DELETE nie je uvoľnené miesto na disku a v čom sa DELETE líši od TRUNCATE?
Prečo môžu byť údaje stratené? Uveďte niekoľko dôvodov.
Prečo teraz zvažuješ nové ponuky?
Povedzte nám o sebe: skúsenosti, úlohy, funkcie alebo úspechy, na ktoré ste hrdí.
Máte skúsenosti s FastAPI?
Ako ste pracovali s datotekami pri znova zagonu DAG po njegovem padcu, da ne bi prepisali podatke u S3 nepotpunim podatkov?
S akými knižnicami Python ste pracovali?
Čo sú to lenivé operácie v Spark a na čo slúžia?
V akej situácii môže vyhľadávanie v slovníku degradovať na najhorší prípad?