Data Engineer
ClickHouse `Too many parts` xatosi bilan qanday muomala qildingiz? Uni qanday hal qildingiz?
Qaysi fayl formatlari bilan ishladingiz?
S3 da jadval ko'rinishlarining natijalarini Parquet yoki boshqa usulda saqladilarmi?
Sparkda qanday fizik JOIN turlari mavjud?
Ma'lumotlar nima uchun yo'qolishi mumkin? Bir nechta sabablarni keltiring.
Nima uchun hozir yangi takliflarni ko'rib chiqyapsiz?
O'zingiz haqida gapiring: tajriba, vazifalar, xususiyatlar yoki g'ururlanadigan yutuqlar.
FastAPI bilan tajribangiz bormi?
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
Qaysi holatda lug'at bo'yicha qidiruv eng yomon holatga tushishi mumkin?
So'rov uzoq davom etganda va to'liq skanerlash amalga oshirilganda optimallashtirish muammolarini qanday hal qildingiz? Yangi shunday vazifaga qanday yondashardingiz?
def extract_from_s3(**kwargs): df = pd.read_csv("s3://my-bucket/data/transactions_{}.csv".format(datetime.now().strftime("%Y-%m-%d"))) kwargs["ti"].xcom_push(key="df", value=df.to_dict()) def load_to_raw_table(**kwargs): df = pd.DataFrame(kwargs["ti"].xcom_pull(task_ids="extract", key="df")) rows = [tuple(r) for r in df[["transaction_id", "user_id", "amount", "created_at"]].to_numpy()] CLICKHOUSE_CLIENT.execute( "INSERT INTO raw.transactions (transaction_id, user_id, amount, created_at) VALUES", rows ) def build_aggregate_view(): query = """ INSERT INTO datamarts.daily_revenue_per_country SELECT toDate(r.created_at) as event_date, u.country, sum(r.amount) as total_revenue FROM raw.transactions r LEFT JOIN core.userMetadata u ON r.user_id = u.UserId WHERE toDate(r.created_at) = '{}' GROUP BY event_date, u.country """.format(datetime.now().strftime("%Y-%m-%d")) CLICKHOUSE_CLIENT.execute(query) transactions_sensor = S3KeySensor( task_id="transactions_sensor", bucket_key="data/transactions_{}.csv".format(datetime.now().strftime("%Y-%m-%d")), bucket_name="my-bucket", aws_conn_id="aws_default", timeout=600, poke_interval=30, mode="poke" ) extract = PythonOperator( task_id="extract", python_callable=extract_from_s3, provide_context=True ) load = PythonOperator( task_id="load", python_callable=load_to_raw_table, provide_context=True ) aggregate = PythonOperator( task_id="aggregate", python_callable=build_aggregate_view ) transactions_sensor >> extract >> load >> aggregate
Airflow'da depends_on_past parametri nima qiladi?
Umuman olganda, Data Vault sizga nima uchun kerak edi?
Siz hal qilgan replikatsiya sozlash vazifasi haqida gapiring.
`s ** 2` ni `s = [1, 2, 3]` ro'yxatiga qo'llash natijasida nima bo'ladi?
ETL va ELT yondashuvlarini solishtiring: farqi nima va qachon har biri qo'llaniladi?
1C bilan qanday ishlashdi: ma'lumotlarni to'g'ridan-to'g'ri ma'lumotlar bazasidan oladimi, yoki shina orqali yoki boshqa usul bilanmi?
Qaysi ma'lumotlar bazalari bilan ishladingiz? MongoDB qanday ishlaydi va qanday kengaytiriladi?
Qanday qilib yozuv allaqachon mavjudligini va uni takror yozish shart emasligini aniqladingiz?