Produktiver Speicherbetrieb benötigt Messwerte für Kapazität, Replikatgesundheit, Sicherung, Datenpfad und Komponentenstatus.
Die Schulung integriert Longhorn-Metriken in Prometheus und Grafana. Dashboards und Alarmregeln werden aus konkreten Betriebsfragen abgeleitet und mit Events, Conditions und Disk-Health-Informationen verbunden.
Inhaltsübersicht
- Monitoring-Ziele definieren
- Metrikpfad verstehen
- Prometheus anbinden
- Rancher Monitoring integrieren
- Grafana-Dashboards
- Alarmregeln
- Kapazität und Disk Health
- Störung korrelieren
Zielsetzung
Die Schulung verfolgt folgende fachliche und betriebliche Ziele:
- Longhorn-Metriken vollständig erfassen und fachlich interpretieren.
- Prometheus-Scraping und Grafana-Dashboards reproduzierbar einrichten.
- Alarmregeln nach Dringlichkeit und Auswirkung gestalten.
- Kapazitäts- und Störungsanalysen anhand korrelierter Daten durchführen.
Lernmodule und praktische Übungen
1. Monitoring-Ziele definieren
Messwerte werden aus Servicezielen und Betriebsrisiken abgeleitet.
- Schritt 1: Verfügbarkeit, Latenz, Kapazität und Schutzstatus festlegen.
- Schritt 2: SLOs und Eskalationsschwellen für kritische Volumes bestimmen.
- Schritt 3: Rollen für Alarmannahme und Analyse definieren.
- Schritt 4: Aufbewahrungsdauer und Labelstruktur planen.
2. Metrikpfad verstehen
Herkunft und Bedeutung der Daten werden vor dem Dashboardbau geklärt.
- Schritt 1: Longhorn-Metrikendpunkte und Kubernetes-Services identifizieren.
- Schritt 2: Metriken für Nodes, Disks, Volumes, Replicas und Backups gruppieren.
- Schritt 3: Kubelet-Volume-Metriken und Longhorn-Metriken unterscheiden.
- Schritt 4: Label-Kardinalität und Abfragekosten bewerten.
3. Prometheus anbinden
Scraping und Erreichbarkeit werden technisch sauber eingerichtet.
- Schritt 1: ServiceMonitor oder alternative Scrape-Konfiguration erstellen.
- Schritt 2: Namespace-, Label- und RBAC-Voraussetzungen prüfen.
- Schritt 3: Targets und Scrape-Fehler kontrollieren.
- Schritt 4: Referenzabfragen für Gesundheit und Kapazität validieren.
4. Rancher Monitoring integrieren
Vorhandene Rancher-Überwachung wird ohne Parallelstruktur genutzt.
- Schritt 1: Installierten Monitoring-Stack und Selektoren erfassen.
- Schritt 2: Longhorn-ServiceMonitor in die Auswahl einbinden.
- Schritt 3: Zugriff auf Prometheus und Grafana über Rancher prüfen.
- Schritt 4: Berechtigungen für mehrere Cluster abgrenzen.
5. Grafana-Dashboards
Dashboards werden nach Betriebsaufgaben statt nach beliebigen Metriken strukturiert.
- Schritt 1: Übersicht für Clusterzustand und kritische Volumes anlegen.
- Schritt 2: Kapazität nach Knoten, Datenträger und Reserve darstellen.
- Schritt 3: Rebuild-, Backup- und Fehleransicht ergänzen.
- Schritt 4: Variablen und Drill-down-Pfade konfigurieren.
6. Alarmregeln
Alarme müssen handlungsfähig und rauscharm sein.
- Schritt 1: Degradierte Volumes und fehlgeschlagene Rebuilds abdecken.
- Schritt 2: Knappe Datenträger und ausbleibende Backups erkennen.
- Schritt 3: Warnung und kritisch mit passenden Haltezeiten trennen.
- Schritt 4: Runbook-Hinweise und Zuständigkeit hinterlegen.
7. Kapazität und Disk Health
Speicherengpässe werden vor dem Ausfall sichtbar gemacht.
- Schritt 1: Gesamt-, belegte, reservierte und planbare Kapazität vergleichen.
- Schritt 2: Snapshot- und Replikatwachstum im Zeitverlauf auswerten.
- Schritt 3: Anomalien einzelner Datenträger erkennen.
- Schritt 4: Forecast und Wartungsbedarf aus Wachstumsdaten ableiten.
8. Störung korrelieren
Metriken, Logs und Ereignisse werden in einer gemeinsamen Zeitachse genutzt.
- Schritt 1: Künstliche Replikatdegradierung erzeugen und Alarmweg beobachten.
- Schritt 2: Dashboardwerte mit Conditions und Events vergleichen.
- Schritt 3: Ursache, Auswirkung und Wiederherstellungszeit dokumentieren.
- Schritt 4: Dashboard und Alarmregel gezielt verbessern.
Zielgruppe
Kubernetes- und Storage-Betrieb, Monitoring-Teams, Site Reliability Engineering, DevOps und technische Betriebssteuerung.
Voraussetzungen
Grundkenntnisse in Longhorn und Kubernetes sowie praktische Erfahrung mit Prometheus-Abfragen und Grafana sind hilfreich.
Methodik
Die Inhalte werden durch fachliche Einordnung, Live-Demonstrationen, angeleitete Schrittfolgen und eigenständige Laborübungen vermittelt. Jeder Themenblock endet mit einer technischen Kontrolle anhand definierter Sollzustände.
Fachbereichsleitung und Trainerteam
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Kubernetes- und Storage-Betrieb, Monitoring-Teams, Site Reliability Engineering, DevOps und technische Betriebssteuerung. |
| Voraussetzungen: | Grundkenntnisse in Longhorn und Kubernetes sowie praktische Erfahrung mit Prometheus-Abfragen und Grafana sind hilfreich. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Fachvortrag, Demonstrationen, angeleitete Schrittfolgen und praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - alle Präsenzformate mit Trainer vor Ort, Webinar nur bei ausdrücklicher Festlegung |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja |
| Verpflegung: | Kalt- und Warmgetränke, Mittagessen, wahlweise vegetarisch |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
