Data Engineer
-- İki veya daha fazla gün ardışık seyahat eden tüm yolcuları bulun
Nested Loop Join'da en çok hangi kaynak tüketilir?
CREATE TABLE core.localUserMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = ReplikasyonluReplacingMergeTree() ORDER BY (UserId); CREATE TABLE core.userMetadata ON CLUSTER cluster_4x2 ( UserId String, Country String, LastLoginDate DateTime ) ENGINE = Dağıtılmış('cluster_4x2', 'core', 'localUserMetadata', cityHash64(LastLoginDate));
RANK ile DENSE_RANK arasındaki fark nedir?
Müşterilerle client_id ve date_start (BETWEEN olmadan) ile işlemleri birleştirirseniz, sonuçta ne yakalanır?
Oracle'da paketler yazmak zorunda kaldınız mı?
ORDER BY, ClickHouse tablosunu nasıl etkiler ve hangi anahtarlar daha iyi seçilir?
Beş Git komutunu söyle.
Genellikle ETL ve ELT süreçlerini nasıl yaklaşıyorsunuz? Bu süreçler arasındaki fark nedir?
PENCERELİK SINIRSIZ ÖNCE NE ANLAMA GELİR?
[isim] farklı veritabanı yönetim sistemleriyle çalışma deneyiminden, optimizasyon ve iç detaylarda ne kadar derinlemesine inceleme yapmak zorunda kaldığından bahsetti.
Projede hangi mimariyi kullandınız? DWH mi yoksa başka bir şey mi?
from interview.utils import get_clickhouse_client from airflow import DAG from airflow.operators.python import PythonOperator from airflow.sensors.external_task import ExternalTaskSensor from datetime import datetime import pandas as pd import clickhouse_driver import os CLICKHOUSE_CLIENT = get_clickhouse_client() default_args = { "start_date": datetime(2024, 1, 1) } with DAG( dag_id="datamarts.daily_revenue_per_country", default_args=default_args, schedule_interval="@daily", catchup=False ) as dag: transactions_sensor = S3KeySensor( task_id="transactions_sensor", bucket_key="data/transactions_{}.csv".format(datetime.now().strftime("%Y-%m-%d")), bucket_name="my-bucket", aws_conn_id="aws_default", timeout=600, poke_interval=30, mode="poke" ) def extract_from_s3(**kwargs): df = pd.read_csv("s3://my-bucket/data/transactions_{}.csv".format(datetime.now().strftime("%Y-%m-%d"))) kwargs["ti"].xcom_push(key="df", value=df.to_dict()) def load_to_raw_table(**kwargs): df = pd.DataFrame(kwargs["ti"].xcom_pull(task_ids="extract", key="df")) rows = [tuple(r) for r in df[["transaction_id", "user_id", "amount", "created_at"]].to_numpy()] CLICKHOUSE_CLIENT.execute( ... )
Docker süreçlerinden bahsettin, bu sizin organizasyonunuzda nasıl düzenlenmiş detaylı anlatabilir misin?
Kafka'dan aynı mesajın birkaç farklı tüketici tarafından okunmasını nasıl organize edilir (fan-out)?
Spark'ta shuffle nedir ve neden minimize edilmesi önemlidir?
dict1 = {(1,2, [3,4]): 0} var = 1,
ClickHouse'ta Table Engine Join ile çalışma deneyiminiz var mı?
PostgreSQL'den ClickHouse'a bir terabayt veri taşımak için yapılandırmayı nasıl değerlendirilir?
Parquet'e veri yüklerken hangi teknolojileri kullandınız ve verileri almak ve yüklemek için hangi mekanizmalar kullanıldı?