Data Engineer
Dotas divas tabulas t1 un t2. Uzdevums ir uzskaitīt visas zināmās apvienošanas (join) tipus un to rezultātu select * from t1 <join> t2 on t1.t = t2.t. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null cross 1 1 - null null - INNER JOIN [phone] LEFT JOIN 1 - 1 2 - NULL 4 - NULL NULL - NULL RIGHT JOIN [phone] NULL - 3 NULL - NULL NULL - NULL FULL JOIN [phone] - NULL 4 - NULL NULL - 3 null - NULL null - NULL null - NULL
Ko darāt, ja saskaraties ar problēmām ražošanas līnijā?
Kādi ir MPP arhitektūras trūkumi Greenplum?
Kā atjaunot darbu no attālās zara, ja, mēģinot `git checkout hotfix/missing-footer`, saņemat kļūdas ziņojumu, ka zars nav atrasts?
Kādi ir jūsu algu gaidījumi?
Kāda ir atšķirība starp UNION un UNION ALL? Kādi nosacījumi jāievēro?
Kā tiek lasīts HDFS fails, piemēram, Parquet — pilnībā vai pa blokiem?
Kā darbojās analītiskās funkcijas (logu funkcijas)?
Kā HDFS atšķiras no parastajām izplatītajām failu sistēmām?
Vai trases ir tikai REST pieprasījumi vai arī kaut kas cits?
Kādus tabulu tipus jūs izmantojāt Greenplum? Kādās gadījumos tika izmantots heap, un kādos - Append-Optimized?
Kādi ir ACID plusi un mīnusi, izņemot lasīšanas ātrumu?
Kādēļ ir nepieciešami indeksi, kādas ir to priekšrocības un trūkumi?
Tas ir reāllaikā, kā to īstenot starp Kafka un ClickHouse Spark?
Pastāsti par sevi — darba pieredze, tehnoloģiju steks
Kā pārsūtīt datus no Greenplum un Trino uz ClickHouse?
Mums nepieciešams pipeline dzinējs — mehānisms, kas ļauj ļoti ātri veidot plūsmas, ievadot līgumus un parametrus. Kā tu to realizētu augstākā līmenī?
Kā darbojas sadalīšana Hive un kā tā ir fiziski attēlota failu sistēmā?
Kādi ir fizisko savienojumu veidi (savienojuma metodes)?
Kādi Airflow operatorus jūs izmantojāt? Kā jūs sadarbojāties ar dbt caur Airflow?