Data Engineer
Ի՞նչ խնդիրների եք հանդիպել Greenplum-ով աշխատելիս։
Ի՞նչն է տարբերությունը list comprehension-ի և սովորական ցիկլի միջև Python-ում։
Ինչպե՞ս սովորաբար կառավարում էիք սխալներն ու զգուշացումները պայպլայններում:
# ինչ է ցույց տալիս s = 'abracadabra' print(s[5][0][0][0]) print(s[::-2]) s = [1, 2, 3] print(s * 2)
Ինչ է տեղի ունենում PostgreSQL-ում, երբ կատարվում է SELECT * FROM [սեղան] հարցումը?
# ինչ է տպում s = 'Abracadabra' print(s[5][0]) b = 'a' b[0] print(s[::2]) s = [1, 2, 3] print(s * 2)
Ի՞նչ պարամետրերով եք ծանոթ Distributed շարժիչի մեջ ClickHouse-ում։
Ինչպե՞ս կպատմեիր կոդում, որ արժեքը զգալիորեն տարբերվում է նորմալ (պահանջվող) բաշխումից։
Ինչպե՞ս կանխել սխալ տվյալների բեռնումը վիտրինա կամ միջնակարգ աղյուսակում և նրանց բարձրագույն պայպլայններին հասցնելը։
Կատարե՞լ եք վիճակագրական ստուգումներ:
Ինչպես են տարբերվում ETL և ELT ժամանակ պահեստավորման հաշվարկային հզորության պահանջները:
Ցուցադրել պատվերների քանակը և "պահանջվող կատեգորիայի ապրանքներ պատվերում" 2021 թվականին՝ «Հագուստ» կատեգորիաներում և 2022 թվականին՝ «Կոշիկներ» կատեգորիայում (վերջնական տեսքը՝ 2 տող։ դաշտեր՝ տարի, ապրանքների քանակ, պատվերների քանակ)
Ինչու եք որոշել առանձնացնել ռեյթինգը որպես առանձին CTE? Ինչու չէիք կարող անմիջապես օգտագործել այն առաջին CTE-ում?
Ի՞նչ է RDD-ը Apache Spark-ում և ինչպե՞ս է այն տարբերվում մյուս Spark-ի ամփոփումներից։
Ինչ են դեկորատորները Python-ում?