Data Engineer
Որ դեպքերում է կիրառվում նորմալիզացիան և որ դեպքերում՝ դենորմալիզացիան:
Կարող եք հիշել ձեր փորձը հարցումների օպտիմալացման ոլորտում? Ինչպես գործել եք, վերլուծել եք?
[անուն] հարցրեց: Ինչպես իրականացնել տվյալների պահպանումը միայն 2 տարի՝ում ClickHouse?
Ինչ եք գիտակցում spill- ի մասին Spark-ում?
Ի՞նչ գործառույթների համար չի հարմար է ClickHouse և ինչ եք ընտրել դրա փոխարեն։
git submodule update --init
Ամեն դեպքում, EXPLAIN-ի կատարողական պլանը համապատասխանում է իրականում կատարվողին:
Կանխատեսում կա՝ տրանզակցիոն անջատման մակարդակներ։ Ինչ գիտեք այդ մասին։
Դուք ունեք հարցում, որը վատ է աշխատում, դանդաղ է կամ ընկնում է — ինչպես օպտիմալացնել այն؟
ստեղծեք raw.local_transactions աղյուսակը cluster_4x2 խմբում ( transaction_id String, user_id String, amount Float64, created_at DateTime ) շարժիչ = ReplicatedMergeTree() բաժանարար ըստ amount վերևում ըստ (transaction_id); ստեղծեք raw.transactions աղյուսակը cluster_4x2 խմբում ( transaction_id String, user_id String, amount Float64, created_at DateTime ) շարժիչ = Distributed('cluster_4x2', 'raw', 'local_transactions', cityHash64(user_id));
Պատմիր տվյալների որակի մասին քո ըմբռնման մասին — արդյոք ունե՞ս այդ ոլորտում փորձառություն։
Ինչպե՞ս եք մատակարարում DAG-ների կոդը արտադրական փուլում:
Ի՞նչ կլինի, եթե կիրառեք `s ** 2` ցանկին `s = [1, 2, 3]`։
Որ կարգ կամ սեղմման տեսակ է օգտագործվում Parquet-ում?
Ի՞նչ տվյալների բաշխման ռազմավարություններ կան։
Դու աշխատե՞լ եք feature store-ների հետ։
Ի՞նչ է ձեզ համար կարևոր ապագա աշխատանքի մեջ։
Ինչու օգտագործվեց Parquet՝ փոխարեն ORC-ի?
# ինչ է ցույց տալիս s = 'Abracadabra' print(s[5][0][0]) b = 'a' print(b[0][0]) print(s[::-2]) #Arcd s = [1, 2, 3] print(s ** 2) def foo(*args, **kwargs): print(args) print(kwargs)
Ի՞նչ է տարբերությունը repartition և coalesce-ի միջև Spark-ում։