Jak byl organizován cluster PostgreSQL? Schéma replikace a odolnost vůči výpadkům?
DBA / Database
Uveďte zajímavý úkol, který jste řešili na předchozím místě práce.
Úkol 5: EXPLAIN ukazuje type: ALL, rows: 200000, Using temporary; Using filesort. Co to znamená a jak optimalizovat?
Úkol 1: Najděte top-5 tras (odjezdová stanice, příjezdová stanice) podle počtu úkolů za leden 2025 z tabulky harvester_tasks_queue.
Byl ve vašem projektu normalizován datový schéma? Jak jste přistupovali k normalizaci?
Jaké nástroje pro sledování jste použili?
Úkol 3: Najděte duplicitní úkoly (podle departure_station, arrival_station, departure_date, crawler_id) a navrhněte plán bezpečného odstranění z tabulky harvester_tasks_queue.
Úkol 4: Optimalizujte dotaz WHERE DATE(tep.available_from_departure_date) = departureDate. Vysvětlete problém a navrhněte řešení.
Jak chránit cílovou tabulku před duplicitami při vkládání dat z dočasné tabulky? Jak aktualizovat stávající záznamy novějšími daty (upsert)?
Jak jste řešili deadlocky ve vysoce zatíženém systému? Co jste dělali při jejich zjištění?
Jak kontrolujete výsledky uložené procedury nebo dotazu? Metody a přístupy.
Jak zorganizovat architekturu tabulky, která se rozrůstá, aby se s ní dalo rychle pracovat pouze s čerstvými daty? Jak efektivně odstraňovat stará data?
Úkol 2: Najděte trasy s aktivními úkoly (stav = 'Připravit ke spuštění'), ale bez aktualizací více než 30 dní. Schémata: harvester_tasks_queue a station__crawler_mapping_with_crawler_ids.
Měli jste případy aktualizace verze produktu databáze? Jak jste se na to připravili a jaké problémy se vyskytly?
Povězte mi o své současné pozici: povinnosti, tým, infrastruktura, nástroje.