Data Engineer
Kā parasti apstrādājāt kļūdas un brīdinājumus pipeline'os?
# ko izvada s = 'abracadabra' print(s[5][0][0][0]) print(s[::-2]) s = [1, 2, 3] print(s * 2)
Kas notiek PostgreSQL pēc vaicājuma SELECT * FROM [tabula] izpildes?
# ko izvada s = 'Abracadabra' print(s[5][0]) b = 'a' b[0] print(s[::2]) s = [1, 2, 3] print(s * 2)
Ar kādiem Distributed motora parametriem jūs esat iepazinies ClickHouse?
Kā tu raksturotu kodā pārbaudi, vai vērtība būtiski atšķiras no normālas (gaidāmās) sadalījuma?
Kā novērst nepareizus datus, kas ielādēti vitrinā vai starpposma tabulā, nonākšanu augstākajos pipeline'os?
Vai veicāt statistiskas pārbaudes?
Ar kādām problēmām jūs saskārāties, strādājot ar Greenplum?
Kas fiziski notiek, veicot INSERT, UPDATE un DELETE Greenplum; kāpēc pēc DELETE diska vieta netiek atbrīvota un kāda ir atšķirība starp DELETE un TRUNCATE?
Kā atšķiras uzglabāšanas aprēķinu jaudas prasības ETL un ELT?
Rādīt pasūtījumu skaitu un "vajadzīgās kategorijas preču skaitu" par 2021. gadu kategorijās "Apģērbi" un par 2022. gadu kategorijā "Apavi" (galīgais skats: 2 rindas. Lauki: gads, preču skaits, pasūtījumu skaits)
Kas ir RDD Apache Spark un kā tas atšķiras no citām Spark abstrakcijām?
Kāpēc jūs nolēmāt atdalīt reitingu atsevišķā CTE? Kāpēc to nevarēja izmantot tieši pirmajā CTE?
Kas ir dekoratori Python?