Data Engineer
Ce tipuri de tabele ai folosit în Greenplum? În ce cazuri s-a folosit heap și în care Append-Optimized?
Ce ai dori să faci în echipa noastră?
Cum se pot transfera datele din Greenplum și Trino către ClickHouse?
Iceberg este un motor care permite transformarea S3 într-o bază de date, respectând chiar ACID. Care este dezavantajul său?
Cu ce se deosebește HDFS de sistemele de fișiere distribuite obișnuite?
Spune-mi mai multe despre Spark: ce anume a fost implementat concret, ce metode au fost folosite
Indecșii îmbunătățesc întotdeauna performanța sau pot cauza degradare?
Ce sunt rândurile moarte în baza de date?
Avem nevoie de un motor de pipeline — un mecanism care să permită crearea foarte rapidă a fluxurilor prin furnizarea de contracte și parametri la intrare. Cum ai implementa acest lucru la un nivel superior?
Se respectă ACID în Greenplum?
Ce avantaje și dezavantaje ale ACID pot fi menționate, în afară de viteza de citire?
Care este diferența dintre generatori și liste în Python?
Este în timp real, cum se implementează între Kafka și ClickHouse Spark?
Cum să nu ucizi Jupyter sau Pandas din cauza memoriei?
Ce este GIL (Global Interpreter Lock)?
Cum se vizualizează planul de execuție al unei interogări în Oracle? În ce constă diferența dintre EXPLAIN PLAN și EXPLAIN ANALYZE?
Care este scopul împărțirii datelor în blocuri în HDFS?
La CTE se consumă multă memorie — când avem un consum mare de memorie, ce se întâmplă cu datele?
Cât de bine cunoști Python?
Ce operatori Airflow ai folosit? Cum ai interacționat cu dbt prin Airflow?