Während der Sicherung meldet der Cluster, ein Cluster Shared Volume sei nicht mehr direkt erreichbar. Ist das ein Problem? Wie Sie Hardware-VSS-Provider und CSV-Verhalten richtig bewerten.
Die Ausgangslage: Ein Hyper-V-Cluster mit vier Knoten unter Windows Server 2008 R2 SP1, die VMs liegen auf einem Cluster Shared Volume (CSV) eines SAN. Damit mehrere VMs gleichzeitig gesichert werden können, ist der VSS-Hardware-Provider des Speicherherstellers installiert. Beim Start einer Sicherung erstellt das SAN automatisch einen Snapshot, weist ihn dem DPM-Server zu, und die VM wird gesichert.
Trotzdem erscheinen während der Sicherung Fehler im Ereignisprotokoll:
Event ID 5121, Failover Clustering:
Cluster Shared Volume 'Volume1' ('Cluster Disk 2') is no longer directly accessible from this cluster node.
Event ID 304, hpeaadsm: An unrecoverable path failure occurred on SCSI address (0.0.0.1)
Was hier passiert
Bei der Sicherung einer VM auf einem CSV wechselt das Volume für die Dauer des Snapshots in den Redirected-I/O-Modus: Schreibzugriffe der anderen Knoten laufen über das Netzwerk zum Besitzerknoten. Genau das meldet Ereignis 5121.
- Mit Software-Snapshots (ohne Hardware-Provider) bleibt das CSV für die gesamte Dauer der Sicherung im Redirected-Modus – bei großen VHDs kann das lange dauern und die Leistung aller VMs auf diesem CSV spürbar beeinträchtigen.
- Mit einem funktionierenden Hardware-Provider dauert der Redirected-Modus nur wenige Sekunden – so lange, bis der Snapshot auf dem SAN erstellt ist.
Wie Sie das prüfen
Beobachten Sie während einer Sicherung im Failover-Cluster-Manager den Status des CSV. Ist es nur einige Sekunden im Zustand „Sicherung läuft / umgeleiteter Zugriff“, arbeitet der Hardware-Provider korrekt, und das Ereignis kann als Begleiterscheinung bewertet werden. Bleibt das CSV minutenlang umgeleitet, wird der Software-Provider verwendet – dann stimmt mit der Hardware-Provider-Konfiguration etwas nicht.
Tipp
Für Überwachungssysteme wie SCOM lohnt sich eine Anpassung: Statt jedes Ereignis 5121 zu alarmieren, nur dann warnen, wenn ein CSV länger als einige Minuten im Redirected-Modus bleibt.
Heute
Seit Windows Server 2012 wurde die CSV-Sicherung grundlegend überarbeitet: Ein eigener CSV-VSS-Writer und verteilte Snapshots machen den langen Redirected-Modus bei Software-Snapshots überflüssig, und mit Windows Server 2016 kam Resilient Change Tracking hinzu. Hardware-VSS-Provider sind heute vor allem für sehr große Umgebungen relevant. Die Bewertung von Ereignis 5121 – kurz ist normal, lang ist ein Problem – gilt weiterhin.