Data Engineer
Pastāstiet par labākajām praksēm indeksu izmantošanā – kad un cik bieži tos izmantot.
Pastāsti par savu Python līmeni: ko esi izmantojis, cik dziļi pazīsti objektorientēto programmēšanu
Kā samazināt DataFrame atmiņas patēriņu Pandas?
Kā pārvaldīt shuffle Spark (particionēšanu, broadcast join utt.)?
Kuras izseko rīkus izmantojāt? Spring Boot 2 un Spring Boot 3?
Vai tika izmantota ierakstu hash salīdzināšanas metode, lai aprēķinātu starpību starp avotu un mērķa tabulu?
Kas notiks, ja piemērosiet `s ** 2` sarakstam `s = [1, 2, 3]`?
Aprakstiet datu arhivēšanas procesu no Oracle uz Parquet (HDFS) pēc daļām un atpakaļejošo datu atjaunošanas pipeline. Kā risināt atkārtotu arhivēšanu atjaunotajiem datiem?
Kā parasti organizējat savu darbu uzdevumos un kā sekojat līdzi progresam?
Kopējais lejupielāžu skaits — augstākās līmeņa darbi, pavedieni?
Vai esat strādājis ar feature store-iem?
LeetCode #? — PostgreSQL ir tabula [tabula] ar vienu kolonnām id un vērtībām 1, 1, 2. Uzrakstiet DELETE vaicājumu, kas fiziski noņems vienu dublikātu.
Kādi bija datu patērētāji un kā tika būvētas vitrīnas?
Vai jums ir pieredze pipeline konfigurēšanā CI/CD, piemēram, GitLab?
Kāda ir atšķirība starp WHERE un HAVING SQL?
Kas notika un kā atgūt darbu?
Ar straumēšanu Iceberg darbojās, dzirdēji? Tā ir atkritumu failu glabātuve.
Kura darba forma jums ir ērtāka — birojs, hibrīds vai attālināts darbs? Mums ir divi biroji, Kutuzovskaja un Tula.
Kā nodrošināt, lai mobilais klients piekļūtu tiem pašiem pasūtījumiem, bet ar mazāku lauku kopumu? Kas ir BFF?
Kāda ir atšķirība starp Greenplum un PostgreSQL?