Pastāstiet par replikācijas konfigurācijas uzdevumu, kuru jūs risinājāt.
Data Engineer
Kā izvairīties/noņemt datu izliekumu Spark?
Kas ir normalizācija un ER modelis, kam tie ir nepieciešami?
Kādos gadījumos tiek piemērota normalizācija, bet kādos - denormalizācija?
Kāds ir diagnostikas algoritms un ko darīt, ja pieprasījums joprojām ir lēns pēc vairāku indeksu pievienošanas?
Pastāstiet par Kafka pamatjēdzieniem (patērētāju grupa, daļas, tēmas).
Kādi ir biežākie iemesli tam, ka vaicājums relāciju datu bāzē darbojas lēni?
Kādi neacīmredzami problēmas var rasties, ielādējot lielas tabulas (izņemot veiktspēju)?
Priekšlikums regulārai inkrementālai lielas tabulas ielādei ar elastīgu (maināmu) atjaunināšanas biežumu no Postgres uz Data Lake.
Kā ir saistīta rūkošana loga funkcijas iekšienē un galīgā ORDER BY kārtošana vaicājumā?
Kā pārvaldīt Spark lietojumprogrammas resursus, lai neizlietotu pārāk daudz atmiņas, mainot ievades datu apjomu?
Kā strādāt ar partīcijām, izmantojot coalesce un repartition?
Kādus Docker attēlus jums nācās būvēt un kāpēc?
Kādi Spark JDBC parametri tika izmantoti lasīšanas paralelizācijai?
Vai ir vēl kādi shuffle pārvaldības mehānismi, izņemot coalesce/repartition?