Data Engineer
Kaip aptikti duomenų iškraipymą (data skew) Spark?
Kas vykdavo, kai duomenų kokybės apribojimas įvykdavo: įspėjimas, kritimas, perkrovimas?
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Kaip paprastai kūrei duomenų bazės schemą — ar tai darydavai rankomis tiesiai duomenų bazėje, ar saugodavai skriptus kažkur, ar visai naudoji Liquibase? Koks buvo procesas?
Kokiose technologijose pastatytas jūsų lakehouse ir kokios problemos kyla dirbant su Apache Iceberg?
Prašome papasakoti apie savo patirtį per pastaruosius metus: kokia komanda, kokie uždaviniai, kokia rolė ir kas buvo įdomiausias uždavinys.
Koks fizinis JOIN mechanizmas bus naudojamas jungiant sandorių lentelę su kalendoriaus lentele pagal nelygybės sąlygą (data <= data)?
Kaip skiriasi reikalavimai saugyklos skaičiavimo galioms ETL ir ELT?
Papaskink apie savo Python lygį: ką naudojote, kaip giliai žinote objektinio programavimo
Kaip valdyti shuffle Spark'e (particionavimas, broadcast join ir kt.)?
Kokius sekimo įrankius naudojote? Spring Boot 2 ir Spring Boot 3?
Papaskokite apie sunkiausią ar įdomiausią užduotį, kurią jums teko spręsti
Ar rašėte vienetinius testus? Ar turite tokią patirtį?
Kokios duomenų paskirstymo strategijos egzistuoja?
Kokia tvarka vykdomos pagrindinės SQL operacijos: SELECT, FROM ir kt.?
Turime ORDER BY pagal užsakymų skaičių, ir yra du užsakymai po 5, dar du po 3. Kaip elgsis RANK() ir DENSE_RANK()?
Kokios yra įprastos priežastys, kodėl užklausa reliacinėje duomenų bazėje veikia lėtai?
Ar Greenplum turi funkcijų ir galimybių, kurių nėra įprastame MySQL ir kituose dialektuose?
LeetCode #? — PostgreSQL yra lentelė [lentelė] su vienu stulpeliu id ir reikšmėmis 1, 1, 2. Parašykite DELETE užklausą, kuri fiziškai pašalins vieną dublikatą.
Kokia tavo patirtis ir supratimas apie pultinių statybą vitrinų skaičiavimui (duomenų apdorojimas)?