Data Engineer
Mis on LEFT SEMI JOIN ja LEFT ANTI JOIN Spark SQL-is, kas te olete kunagi kasutanud?
Hive'is aeglane analüütiline päring. Kuidas mõista, mis sellega juhtus ja kuidas seda parandada?
Mis on CROSS JOIN? Kas olete sellega töötanud?
Mis vahe on == ja is Pythonis?
Mis on jälgimine? Kas teil on sellega kogemusi?
Millised on JOIN tüübid SQL-is (loogilised ja füüsilised)?
Füüsilise aktiivsuse klubide külastuste analüüs Te töötate fitness klubide võrgustikus analüütikuna. Teil on teavet kasutajate külastuste ja nende ostetud liikmelisuste kohta. On vaja analüüsida liikmelisuste tõhusust. Arvutage iga liikmelisuse tüübi kohta: • selle liikmelisuse kasutavate kasutajate koguarv. Arvesse võtke ainult unikaalseid user_id-sid; • selle liikmelisusega tehtud külastuste koguarv. Arvesse võtke kõiki selle liikmelisusega kasutajate külastusi; • selle liikmelisuse kasutajate osakaal kogu kasutajate arvust protsentides (ühe kümnendiku täpsusega). Kasutajate osakaalu arvutamiseks kasutage suhteid selle liikmelisusega kasutajate arv ja kõigi unikaalsete kasutajate arv. Iga kasutaja võib omada ainult ühte liikmelisust. Tulemused sorteerige liikmelisuse tüübi järgi tähestikulises järjekorras. Sisendvorming Tabel memberships: • membership_id (int) — liikmelisuse unikaalne ID • user_id (int) — kasutaja unikaalne ID • membership_type (text) — liikmelisuse tüüp Tabel visits:
Milline väljend asendusel [...] automaatselt loob indeksi? Mobiilplatvormil on horisontaalne koodi kerimine create table some_table( col_name [...] ); unique references other_table(col_name) not null serial integer check (col_name > 0)
Kas olete kunagi töötanud Pythonis dekoratiividega? Mis need on ja kus neid kasutatakse?
Kuidas lahendasite optimeerimisprobleeme, kui päring kestab kaua ja teostab täieliku skannimise? Kuidas läheneksite sellisele uuele ülesandele?
Mis on shuffle Sparkis ja milleks see vajalik on?
Milliseid täiendavaid DDL/CREATE TABLE parameetreid ClickHouse'is teate, millele need mõjuvad ja millal neid kasutatakse?
Kuidas mõjutavad vahetusfailid jõudlust? Millal muul ajal võivad vahetusfailid tekkida?
Kas teil on olnud vaja töötada Oracle Data Integrator (ODI) abil?
Kas teil on kogemusi Spark ülesannete optimeerimisel? Kas saaksite anda konkreetse näite?
Kuidas uuendada ClickHouse'i tabelit nii, et kasutajad ei märkaks midagi (atomaarsed asendamine)?
Palun rääkige meile, miks see töökoht teid huvitab.
Rääkige Kafka põhikontseptsioonidest (tarbijarühm, jaotised, teemad).
Rääkige oma kogemusest Airflow (orkestrator) kasutamisel. Mida kasutasite?
Kas olete andmeid Sparkist S3-ile Parquet-formaadis üles laadinud ja seejärel Parquetist Greenplumisse — kuidas laadimisprotsess toimub?