Stell dir vor, du arbeitest mit einem Modell in PyTorch und nach dem Umschalten in den Evaluierungsmodus eval() stellst du fest, dass die Metriken auf einem festen Testset von 10.000 Beispielen bei jedem Lauf variieren. Du fixierst den Anfangszustand der Zufallsgeneratoren für Reproduzierbarkeit: Wo könnte sonst die Quelle der Änderungen verborgen sein? Erkläre die Rolle von Dropout, BatchNorm und torch.no_grad() und nenne Metriken mit Schwellenwerten, anhand derer du die Stabilität der Ergebnisse überprüfst.