Seminar AI-Infrastruktur für Administratoren: Hochverfügbarkeit, Backup und Wiederanlauf

Eine AI-Plattform besteht aus Komponenten mit sehr unterschiedlichem Schutzbedarf. Containerimages und öffentliche Modellgewichte lassen sich häufig reproduzierbar wiederherstellen, während feinabgestimmte Modelle, Vektordaten, Zugriffspolicies, Schlüssel und betriebliche Konfigurationen einmalig sein können. Ein pauschales Vollbackup ist deshalb weder ausreichend noch wirtschaftlich.

Das Seminar entwickelt eine belastbare Schutz- und Wiederanlaufstrategie aus Geschäftsanforderungen, Fehlerdomänen und technischen Abhängigkeiten. Neben Redundanz stehen überprüfbare Sicherungen, geordnete Startreihenfolgen, Kapazitätsreserven und regelmäßige Wiederherstellungstests im Mittelpunkt.

Zielgruppe

System- und Plattformadministratoren, Backup-Verantwortliche, Kubernetes-Administratoren, IT-Service-Manager und technische Notfallverantwortliche.

Voraussetzungen

Erfahrung im Betrieb von Server-, Speicher- oder Kubernetes-Umgebungen. Grundkenntnisse zu AI-Infrastruktur oder der vorherige Besuch des Grundlagenseminars werden empfohlen.

Seminarinhalte

Schutzbedarf und Wiederanlaufziele

  • Dienste, Daten, Modelle, Adapter, ModelCaches, Konfigurationen, Geheimnisse und Protokolle inventarisieren
  • Kritikalität, Wiederbeschaffbarkeit, RPO, RTO und maximal tolerierbare Leistungseinbuße festlegen
  • Abhängigkeiten zwischen Identitätsdienst, Registry, Modellablage, Cluster, Inferenz und Monitoring erfassen
  • Notbetrieb mit reduziertem Modellangebot oder geringerer Kapazität als eigene Betriebsart definieren

Fehlerdomänen und Hochverfügbarkeit

  • Ausfall von Prozess, Pod, Knoten, Rack, Storage-System, Netzwerkzone und Standort unterscheiden
  • Redundanz für Control Plane, Registries, Modellobjektspeicher, Datenbanken und Inferenz-Gateways planen
  • Beschleunigerknappheit, lange Modellladezeiten und große Artefakte bei Failover berücksichtigen
  • Health Checks, Pod Disruption Budgets, Antiaffinität und geordnete Wartung sinnvoll kombinieren

Sicherung von AI-Plattformen

  • Deklarative Rekonstruktion und Sicherung für Linux, Kubernetes, Operatoren, Policies und Gateways trennen
  • Versionierte Sicherung von Modellartefakten, Adaptern, Promptvorlagen, Vektorindizes und Metadaten
  • Volume Group Snapshots, applikationskonsistente Sicherung, Replikation und unveränderbare Kopien abgrenzen
  • Schlüssel, Zertifikate und Geheimnisse mit getrennten Schutz- und Wiederherstellungsverfahren behandeln

Disaster Recovery und Wiederinbetriebnahme

  • Wiederanlaufreihenfolge von Basisdiensten über Modellablage und Cache-Aufbau bis zu Endpunkten festlegen
  • Cold-, Warm- und Hot-Standby anhand von Kosten, RTO und Hardwareverfügbarkeit vergleichen
  • Abweichende Hardware, Treiberstände und Netzparameter am Ersatzstandort einplanen
  • DNS, Zertifikate, API-Endpunkte, Warteschlangen und Clientverhalten beim Umschalten berücksichtigen

Tests und Nachweise

  • Restore-Tests von bloßer Job-Erfolgsmeldung trennen und fachliche Funktionsprüfungen definieren
  • Tabletop-Übung, Komponententest, Teilausfall und vollständigen Standorttest staffeln
  • Zeitmessung, Abweichungen, manuelle Schritte und fehlende Berechtigungen protokollieren
  • Runbooks nach Tests aktualisieren und offene Risiken mit Verantwortlichen und Fristen versehen

Störungsbetrieb und Kommunikation

  • Ausfallbilder priorisieren, Zuständigkeiten aktivieren und Veränderungen während der Störung kontrollieren
  • Technische Diagnose von Kapazitätsentscheidungen und Servicekommunikation trennen
  • Rückkehr vom Notbetrieb in den Normalbetrieb mit Datenabgleich und kontrollierter Lastzuschaltung planen
  • Nachbereitung mit Ursachenanalyse, Maßnahmenverfolgung und erneutem Wirksamkeitstest durchführen

Praktische Übungen

  • Schutzklassen und Wiederanlaufziele für eine beispielhafte On-Premises-AI-Plattform festlegen
  • Eine Abhängigkeitsmatrix und geordnete Wiederanlaufsequenz erstellen
  • Sicherungsumfang für Kubernetes-Konfigurationen, Modelle, Vektordaten und Geheimnisse definieren
  • Den Ausfall eines GPU-Knotens und eines Modellobjektspeichers anhand eines Runbooks bearbeiten
  • Einen Restore-Test mit technischen und funktionalen Abnahmekriterien planen

Methodik

Bewährte Verfahren aus Hochverfügbarkeit und Backup werden auf die besonderen Eigenschaften großer Modelle und beschleunigter Plattformen übertragen. Szenarien, Checklisten und Wiederanlaufpläne werden in Gruppen erstellt und anhand messbarer Ziele geprüft.

Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner

Seminardetails

   
Dauer: 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr
Preis: Öffentlich oder Live Stream: € 1.198 zzgl. MwSt.
Inhaus: € 3.400 zzgl. MwSt.
Teilnehmeranzahl: min. 2 - max. 8
Teilnehmer: Administratoren, Backup- und Notfallverantwortliche
Voraussetzungen: Betriebserfahrung; AI-Infrastruktur-Grundlagen empfohlen
Standorte: Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg
Methoden: Vortrag, Demonstrationen, praktische Übungen am System
Seminararten: Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht
Durchführungsgarantie: ja, ab 2 Teilnehmern
Sprache: Deutsch - bei Firmenseminaren ist auch Englisch möglich
Seminarunterlage: Dokumentation auf Datenträger oder als Download
Teilnahmezertifikat: ja, selbstverständlich
Verpflegung: Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch)
Support: 3 Anrufe im Seminarpreis enthalten
Barrierefreier Zugang: an den meisten Standorten verfügbar
  Weitere Informationen unter + 49 (221) 74740055

Seminartermine

Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.

Seminar Startdatum Enddatum Ort Dauer
Bremen 2 Tage
Berlin 2 Tage
Mainz 2 Tage
Erfurt 2 Tage
Darmstadt 2 Tage
Frankfurt 2 Tage
Paderborn 2 Tage
Essen 2 Tage
Konstanz 2 Tage
Freiburg 2 Tage
Potsdam 2 Tage
Flensburg 2 Tage
Leipzig 2 Tage
Hamm 2 Tage
Rostock 2 Tage
Hamburg 2 Tage
Luxemburg 2 Tage
Hannover 2 Tage
Stuttgart 2 Tage
Dresden 2 Tage
Madgeburg 2 Tage
Regensburg 2 Tage
Jena 2 Tage
Trier 2 Tage
München 2 Tage
Friedrichshafen 2 Tage
Kassel 2 Tage
Ulm 2 Tage
Münster 2 Tage
Nürnberg 2 Tage
Köln 2 Tage
Wuppertal 2 Tage
Mainz 2 Tage
Erfurt 2 Tage
Bremen 2 Tage
Berlin 2 Tage
Paderborn 2 Tage
Essen 2 Tage
Darmstadt 2 Tage
Frankfurt 2 Tage
Nach oben
Seminare als Stream SRI zertifiziert
© 2026 www.seminar-experts.de All rights reserved. | Kontakt | Impressum | Nach oben