Wie wurde der PostgreSQL-Cluster organisiert? Replikationsschema und Ausfallsicherheit?
DBA / Database
Stellen Sie eine interessante Aufgabe vor, die Sie an Ihrem vorherigen Arbeitsplatz gelöst haben.
Aufgabe 5: EXPLAIN zeigt type: ALL, rows: 200000, Using temporary; Using filesort. Was bedeutet das und wie kann man es optimieren?
Aufgabe 1: Finden Sie die Top-5-Routen (Abfahrtsstation, Ankunftsstation) nach Anzahl der Aufgaben im Januar 2025 aus der Tabelle harvester_tasks_queue.
Welche Überwachungstools haben Sie verwendet?
Wurde das Datenschema in Ihrem Projekt normalisiert? Wie sind Sie an die Normalisierung herangegangen?
Aufgabe 3: Doppelte Aufgaben (nach departure_station, arrival_station, departure_date, crawler_id) finden und einen sicheren Löschplan aus der Tabelle harvester_tasks_queue vorschlagen.
Aufgabe 4: Optimieren Sie die Abfrage WHERE DATE(tep.available_from_departure_date) = departureDate. Erklären Sie das Problem und schlagen Sie eine Lösung vor.
Wie schützt man die Zieltabelle vor Duplikaten beim Einfügen von Daten aus einer temporären Tabelle? Wie aktualisiert man bestehende Datensätze mit neueren Daten (upsert)?
Wie sind Sie mit Deadlocks in einem hochbelasteten System umgegangen? Was haben Sie bei deren Entdeckung getan?
Wie überprüfen Sie die Ergebnisse eines gespeicherten Verfahrens oder einer Abfrage? Methoden und Ansätze.
Aufgabe 2: Finden Sie Routen mit aktiven Aufgaben (Status = 'Bereit zum Start'), aber ohne Aktualisierungen seit mehr als 30 Tagen. Schemata: harvester_tasks_queue und station__crawler_mapping_with_crawler_ids.
Wie man die Architektur einer Tabelle organisiert, die wächst, um nur mit aktuellen Daten schnell zu arbeiten? Wie man alte Daten effektiv löscht?
Hatten Sie Fälle von Upgrade der Datenbankproduktversion? Wie haben Sie sich vorbereitet und welche Probleme traten auf?
Erzählen Sie mir von Ihrer aktuellen Position: Verantwortlichkeiten, Team, Infrastruktur, Werkzeuge.