Zielsetzung
Das Seminar entwickelt semantische Such- und KI-Anwendungen mit der FerretDB-Vektorsuche. Embeddings, Datenmodell, HNSW- und IVF-Indizes, Ähnlichkeitsmaße, Aggregationsabfragen, Qualitätsmessung und die Einbindung in Retrieval- und Empfehlungsszenarien werden praktisch erarbeitet.
Inhaltsübersicht
- Zielsetzung und Lernziele
- Teilnehmerkreis und Voraussetzungen
- Semantische Suche und Embeddings
- Datenmodell und Vorverarbeitung
- Ähnlichkeitsmaße
- HNSW-Index
- IVF-Index
- Vektorsuche ausführen
- Qualitätsmessung
- Retrieval- und Empfehlungsszenarien
- Betrieb, Leistung und Sicherheit
- Praxisübungen und Methodik
Lernziele
- Embeddings und Ähnlichkeitsmaße für semantische Suche fachlich einordnen
- HNSW- und IVF-Indizes mit passenden Parametern erstellen
- Vektorabfragen über die Aggregationspipeline ausführen und auswerten
- Suchqualität, Leistung, Datenpflege und Sicherheitsrisiken eines KI-Szenarios bewerten
Teilnehmerkreis
Softwareentwickler, Data Engineers, KI- und Machine-Learning-Teams, Suchspezialisten, Architekten und Datenbankentwickler.
Voraussetzungen
Gute FerretDB- und Aggregationskenntnisse, grundlegendes Verständnis von Vektoren und APIs. Programmiererfahrung ist erforderlich.
Seminarinhalte
Kapitel 1: Semantische Suche und Embeddings
Inhaltsübersicht des Kapitels: Klassische Schlüsselwortsuche von semantischer Ähnlichkeit unterscheiden; Text, Bild oder Audio in numerische Vektorrepräsentationen überführen; Einheitliches Embedding-Modell und feste Dimensionen für Daten und Anfragen festlegen.
- Schritt 1: Klassische Schlüsselwortsuche von semantischer Ähnlichkeit unterscheiden
- Schritt 2: Text, Bild oder Audio in numerische Vektorrepräsentationen überführen
- Schritt 3: Einheitliches Embedding-Modell und feste Dimensionen für Daten und Anfragen festlegen
Kapitel 2: Datenmodell und Vorverarbeitung
Inhaltsübersicht des Kapitels: Fachdokument, Quelltext und Embedding gemeinsam modellieren; Chunking, Metadaten und Aktualisierungszeitpunkte definieren; Ungültige Dimensionen, fehlende Vektoren und Modellwechsel behandeln.
- Schritt 1: Fachdokument, Quelltext und Embedding gemeinsam modellieren
- Schritt 2: Chunking, Metadaten und Aktualisierungszeitpunkte definieren
- Schritt 3: Ungültige Dimensionen, fehlende Vektoren und Modellwechsel behandeln
Kapitel 3: Ähnlichkeitsmaße
Inhaltsübersicht des Kapitels: Kosinusähnlichkeit, euklidische Distanz und inneres Produkt vergleichen; Metrik passend zum Embedding-Modell und zur Normalisierung auswählen; Erwartete Nachbarschaften mit Referenzbeispielen prüfen.
- Schritt 1: Kosinusähnlichkeit, euklidische Distanz und inneres Produkt vergleichen
- Schritt 2: Metrik passend zum Embedding-Modell und zur Normalisierung auswählen
- Schritt 3: Erwartete Nachbarschaften mit Referenzbeispielen prüfen
Kapitel 4: HNSW-Index
Inhaltsübersicht des Kapitels: HNSW als graphbasierten Index für schnelle Suche einordnen; Dimension, Verbindungsgrad und Konstruktionsaufwand konfigurieren; Speicherbedarf, Aufbauzeit und Suchqualität mit Testdaten messen.
- Schritt 1: HNSW als graphbasierten Index für schnelle Suche einordnen
- Schritt 2: Dimension, Verbindungsgrad und Konstruktionsaufwand konfigurieren
- Schritt 3: Speicherbedarf, Aufbauzeit und Suchqualität mit Testdaten messen
Kapitel 5: IVF-Index
Inhaltsübersicht des Kapitels: IVF als Cluster- und Listenstruktur erklären; Anzahl der Listen aus Datenmenge und Suchanforderung ableiten; Aufbauzeit, Speicher und Trefferqualität mit HNSW vergleichen.
- Schritt 1: IVF als Cluster- und Listenstruktur erklären
- Schritt 2: Anzahl der Listen aus Datenmenge und Suchanforderung ableiten
- Schritt 3: Aufbauzeit, Speicher und Trefferqualität mit HNSW vergleichen
Kapitel 6: Vektorsuche ausführen
Inhaltsübersicht des Kapitels: Suchvektor mit demselben Modell wie die Bestandsdaten erzeugen; Vektor, Pfad, Trefferzahl und Suchparameter in der Aggregationsstufe setzen; Quelldokumente, Scores und Metadaten passend projizieren.
- Schritt 1: Suchvektor mit demselben Modell wie die Bestandsdaten erzeugen
- Schritt 2: Vektor, Pfad, Trefferzahl und Suchparameter in der Aggregationsstufe setzen
- Schritt 3: Quelldokumente, Scores und Metadaten passend projizieren
Kapitel 7: Qualitätsmessung
Inhaltsübersicht des Kapitels: Goldstandard mit relevanten und irrelevanten Treffern erstellen; Precision, Recall, Rangfolge und fachliche Akzeptanz bewerten; Index- und Suchparameter mit reproduzierbaren Experimenten abstimmen.
- Schritt 1: Goldstandard mit relevanten und irrelevanten Treffern erstellen
- Schritt 2: Precision, Recall, Rangfolge und fachliche Akzeptanz bewerten
- Schritt 3: Index- und Suchparameter mit reproduzierbaren Experimenten abstimmen
Kapitel 8: Retrieval- und Empfehlungsszenarien
Inhaltsübersicht des Kapitels: Semantische Suche mit Metadatenfiltern und fachlichen Regeln kombinieren; Retrieval-Schritt für eine generative Anwendung vorbereiten; Empfehlungen und Ähnlichkeitssuche mit erklärbaren Ausgaben versehen.
- Schritt 1: Semantische Suche mit Metadatenfiltern und fachlichen Regeln kombinieren
- Schritt 2: Retrieval-Schritt für eine generative Anwendung vorbereiten
- Schritt 3: Empfehlungen und Ähnlichkeitssuche mit erklärbaren Ausgaben versehen
Kapitel 9: Betrieb, Leistung und Sicherheit
Inhaltsübersicht des Kapitels: Embedding-Neuberechnung und Indexpflege bei Datenänderungen planen; Latenz, Speicher, Datenwachstum und Modellversion überwachen; Sensible Inhalte, Prompt-Injection und unzulässige Datenrückgabe im Gesamtsystem berücksichtigen.
- Schritt 1: Embedding-Neuberechnung und Indexpflege bei Datenänderungen planen
- Schritt 2: Latenz, Speicher, Datenwachstum und Modellversion überwachen
- Schritt 3: Sensible Inhalte, Prompt-Injection und unzulässige Datenrückgabe im Gesamtsystem berücksichtigen
Praxisübungen
- Dokumente mit vorbereiteten Embeddings importieren und ein Vektordatenmodell prüfen
- HNSW- und IVF-Index erstellen und Suchergebnisse vergleichen
- Eine kleine semantische Suche mit Metadatenfilter und Qualitätsbewertung entwickeln
Methodik
Theorie zu Embeddings und Indexstrukturen wird mit einem durchgängigen Suchprojekt verbunden. Parameteränderungen werden anhand von Qualität, Laufzeit und Ressourcenbedarf verglichen.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weiterer Tag 09:00 Uhr |
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Entwickler, Data Engineers, KI-/ML-Teams, Suche und Architekten |
| Voraussetzungen: | Gute FerretDB-, Aggregations- und Programmierkenntnisse |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, angeleitete Laborübungen, Fallstudien und praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhouse, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
