V Pandas je stĺpec typu int, ale v jednom riadku chýba hodnota (NULL). Aký bude dátový typ tohto stĺpca?
Python
Použili ste MyPy na kontrolu typov?
Čo je rýchlejšie: read_sql v Pandas alebo priame pripojenie k databáze?
Kto mení kontext v asynchrónnom prístupe?
Aké frameworky ste použili na písanie kódu v Pythone?
Existuje 5 inštancií služby s cron úlohou. Ako zabezpečiť, aby sa úloha vykonala iba raz, a nie 5-krát?
Môžete opísať kroky pipeline nasadenia? Začínajúc s commitom kódu — čo sa deje potom?
Na čo je potrebná normalizácia databázy? Ako určiť, do akej miery má byť schéma normalizovaná?
Ako overiť vstupný súbor CSV/Parquet vo FastAPI (prítomnosť požadovaných stĺpcov, rozsahy hodnôt)?
V čom sa líši zoznam Python od poľa NumPy?
V čom spočíva rozdiel medzi synchronnou a asynchrónnou interakciou medzi službami? Ako sú realizované?
Povedzte stručne o sebe: kto ste, aké máte skúsenosti, prečo ste prišli?
Je možné v DAG-u Airflow vytvoriť cyklus: úloha 3 vracia vykonanie späť na úlohu 1 pri nedostatočnom množstve dát?
V Pandas je 5 miliónov riadkov dát — čo robiť, ak 100 tisíc fungovalo správne, ale 5 miliónov nie?
Dizajn systému: tri výpočtové služby, každá pristupuje k službe údajov, výsledky musia byť uložené a rýchlo zobrazené vo webovom rozhraní. Ako postaviť takýto systém so zárukou vykonania výpočtu?
Na čo sú potrebné indexy v relačných databázach (PostgreSQL)? Kedy pomáhajú a kedy škodia?
Prečo musela vzdelávacia spoločnosť GetPositive napísať bankové úložisko dát?
V čem spočívajú rozdiely medzi funkcionálnym programovaním a objektovo orientovaným? Čo používate vo svojom prístupe?
Akého správcu balíkov používate?
Ako prenášať veľké objemy dát (milióny riadkov) medzi úlohami v Airflow?