Data Engineer
Неге жаңа жұмыс іздеп жүрсіз?
Spark-те қандай физикалық JOIN түрлері бар?
Деректер неге жоғалуы мүмкін? Кейбір себептерін келтір.
Қазіргі уақытта жаңа ұсыныстарды неге қарастырып жатырсың?
Өзіңіз туралы, тәжірибеңіз, тапсырмалар, ерекшеліктер немесе мақтан тұтатын жетістіктеріңіз туралы айтыңыз.
FastAPI-мен жұмыс тәжірибеңіз бар ма?
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
Компанияда соңғы 2,5 жылда орындалған қызықты тапсырма туралы айтыңыз, мысалы ClickHouse-қа байланысты.
Қандай жағдайда сөздік бойынша іздеу ең нашар жағдайға дейін нашарлауы мүмкін?
Қалайша сіз ұзақ жұмыс істейтін және толық скан жүргізетін сұраулар кезінде оңтайландыру мәселелерін шештіңіз? Мұндай жаңа тапсырмаға қалай қарайсыз?
def extract_from_s3(**kwargs): df = pd.read_csv("s3://my-bucket/data/transactions_{}.csv".format(datetime.now().strftime("%Y-%m-%d"))) kwargs["ti"].xcom_push(key="df", value=df.to_dict()) def load_to_raw_table(**kwargs): df = pd.DataFrame(kwargs["ti"].xcom_pull(task_ids="extract", key="df")) rows = [tuple(r) for r in df[["transaction_id", "user_id", "amount", "created_at"]].to_numpy()] CLICKHOUSE_CLIENT.execute( "INSERT INTO raw.transactions (transaction_id, user_id, amount, created_at) VALUES", rows ) def build_aggregate_view(): query = """ INSERT INTO datamarts.daily_revenue_per_country SELECT toDate(r.created_at) as event_date, u.country, sum(r.amount) as total_revenue FROM raw.transactions r LEFT JOIN core.userMetadata u ON r.user_id = u.UserId WHERE toDate(r.created_at) = '{}' GROUP BY event_date, u.country """.format(datetime.now().strftime("%Y-%m-%d")) CLICKHOUSE_CLIENT.execute(query) transactions_sensor = S3KeySensor( task_id="transactions_sensor", bucket_key="data/transactions_{}.csv".format(datetime.now().strftime("%Y-%m-%d")), bucket_name="my-bucket", aws_conn_id="aws_default", timeout=600, poke_interval=30, mode="poke" ) extract = PythonOperator( task_id="extract", python_callable=extract_from_s3, provide_context=True ) load = PythonOperator( task_id="load", python_callable=load_to_raw_table, provide_context=True ) aggregate = PythonOperator( task_id="aggregate", python_callable=build_aggregate_view ) transactions_sensor >> extract >> load >> aggregate
Airflow-те depends_on_past параметрі не істейді?
Жалпы алғанда, сізге Data Vault не үшін керек болды?
Репликацияны орнату тапсырмасы туралы айтыңыз.
Деректердің хэштерін салыстыру әдісі көзден және мақсатты кестелер арасындағы айырмашылықты есептеу үшін қолданылды ма?
`s ** 2` қолданғанда `s = [1, 2, 3]` тізіміне не болады?
ETL және ELT тәсілдерін салыстырыңыз: айырмашылықтары қандай және қай кезде қолданылатыны?
1С-пен қалай жұмыс істедіңіз: деректерді тікелей дерекқордан алдыңыз ба, автобус арқылы ма, әлде басқа әдіспен бе?
Қандай дерекқорлармен жұмыс жасадыңыз? MongoDB қалай құрылымдалған және қалай масштабталады?
Жазба бұрыннан бар екенін және оны қайта жазудың қажеті жоқ екенін қалай анықтайсыз?