In welche Richtung wäre eine Entwicklung interessant – Schaufenster, Entwicklung, Analyse, vielleicht KI?
Data Engineer
Wenn wir eine Filterbedingung nach Transaktionsdatum in WHERE (nach LEFT JOIN) setzen, wird das Ergebnis in der ersten Tabelle (Kunden) eingeschränkt?
Wie funktioniert der Nested Loop Join und wie ist seine algorithmische Komplexität? Wie ist die Komplexität aller drei Algorithmen?
Wofür ist die Zeilengruppe in der Struktur der Parquet-Datei verantwortlich?
Was ist der Unterschied zwischen Partitionierung und Sharding?
Erzählen Sie auf hoher Ebene, wie die Architektur von Spark aufgebaut ist: Welche Komponenten gibt es und wie interagieren sie bei der Ausführung einer SQL-Anfrage.
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [Telefon] null null 5 AUSWÄHLEN a.num ALS a_num, b.num ALS b_num VON t1 a LINKS JOIN t2 b ON a.num = b.num;
Erzähle mir, wo du als Systemanalytiker gearbeitet hast und welche Aufgaben du ausgeführt hast?
SELECT client_id, ФИО, SUM(сумма) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
## Modus-Aufgabe # Es gibt eine Liste von Zahlen. Schreiben Sie eine Funktion, die den Modus dieser Liste findet. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Was ist der Unterschied zwischen dem Speicherformat Parquet und CSV?
Was ist der Auslöser für die Erstellung eines neuen Jobs in Spark, und wie wird ein Job in Stages und Tasks unterteilt?
Haben Sie die Datenqualitätsprüfungen selbst durchgeführt oder kamen die Anforderungen vom Business/Kunden?
Welche Methoden (Typen) der Speicherung von Datenhistorie kennst du? Wie wird die Historie in Tabellen aufgebaut?
Was bedeutet UNBOUNDED PRECEDING in den Grenzen des Fensterfunktion?
Welcher physische JOIN-Mechanismus wird beim Verbinden der Transaktionstabelle mit der Kalendertabelle unter der Bedingung der Ungleichheit (Datum <= Datum) verwendet?
Wie man den letzten vollständigen Namen für jeden Kunden ermittelt, wenn nur das Startdatum bekannt ist (Enddatum ist unbekannt)?
Wie bestimmt man das Distributionsfeld in Greenplum richtig? Was passiert bei Motion?
Warum suchst du eine neue Stelle und was möchtest du in Zukunft machen?
Haben Sie schon einmal mit dem AQE-Optimierer (Adaptive Query Execution) in Spark gearbeitet? Wissen Sie, wie er funktioniert?