Das Seminar führt von einer freigegebenen Audioaufnahme zu einem überprüften Transkript und dessen kontrollierter Weiterverarbeitung. Untersucht werden verständliche Sprache, schwierige Aufnahmebedingungen und fachliche Begriffe. Fehler in der Erkennung werden getrennt von Fehlern einer späteren Zusammenfassung oder Aufgabenextraktion bewertet.
Dateibasierte Verarbeitung und laufende Transkription werden als unterschiedliche Betriebsfälle behandelt. Sprecherzuordnung, Zeitinformationen und unterstützte Parameter hängen vom eingesetzten Modell und Betriebsmodus ab. Sprachsynthese und vollständige Sprachagenten werden architektonisch eingeordnet; die praktische Entwicklung konzentriert sich auf Transkription und nachgelagerte Textverarbeitung.
Inhaltsübersicht
- Audiodaten und Modellwahl
- Dateien transkribieren
- Qualität messen
- Transkripte weiterverarbeiten
- Echtzeitprinzipien
- Integration und Datenkontrolle
Seminarinhalte
Audiodaten und Modellwahl
- Audioformat, Länge, Kanäle und Aufnahmequalität vor der Verarbeitung prüfen.
- Dateitranskription, Audioverständnis, Echtzeitverarbeitung und Sprachsynthese unterscheiden.
- Geeignete Modelle, bereitgestellte Funktionen und Kostenrahmen für den Übungsfall auswählen.
Dateien transkribieren
- Vorbereitete Aufnahmen über den vorgesehenen API-Zugang verarbeiten.
- Sprach- und Kontextoptionen entsprechend dem gewählten Modell einsetzen.
- Zeitinformationen und verfügbare Sprechersegmente auswerten und am Original prüfen.
Qualität messen
- Ein manuell geprüftes Referenztranskript für ausgewählte Ausschnitte erstellen.
- Erkennungsfehler, fehlende Passagen und falsch wiedergegebene Fachbegriffe getrennt bewerten.
- Einfluss von Störgeräuschen, Aufnahmequalität und Kontextbegriffen systematisch untersuchen.
Transkripte weiterverarbeiten
- Zusammenfassungen und Aufgabenlisten aus dem Transkript mit einem Textmodell erzeugen.
- Personennamen, Termine und Aufgaben nur übernehmen, wenn sie im geprüften Material enthalten sind.
- Sprecher- und Zeitzuordnungen in einer kontrollierbaren Ausgabe erhalten.
Echtzeitprinzipien
- Audiostream, Zwischenergebnis und endgültiges Segment in einem vorbereiteten Beispiel unterscheiden.
- Verbindungsabbrüche, Pufferung und doppelte Segmente anhand eines Testfalls betrachten.
- Modellgrenzen berücksichtigen; insbesondere Echtzeittranskription nicht mit einer automatisch verfügbaren Sprechertrennung gleichsetzen.
Integration und Datenkontrolle
- Verarbeitungsstatus, Dateikennung und begrenzte Wiederholungen in einen kleinen Ablauf integrieren.
- Zugriff und Löschung von Aufnahme, Transkript und Folgeartefakten getrennt festlegen.
- Einen Freigabeschritt vor der Übernahme in die weitere Dokumentation einbauen.
Praktische Übungen
- Drei freigegebene kurze Aufnahmen mit unterschiedlichen Qualitätsmerkmalen untersuchen.
- Die Dateien transkribieren und für einen Ausschnitt Zeit- beziehungsweise Sprecherinformationen kontrollieren.
- Fehler anhand eines Referenztextes messen und einen geeigneten Kontextparametervergleich durchführen.
- Einen Protokollentwurf erzeugen und Aufgaben sowie Termine am Transkript verifizieren.
- Ein vorbereitetes Echtzeitbeispiel starten, eine Unterbrechung untersuchen und Regeln zur Nachbearbeitung festlegen.
Schulungsumgebung
Der Kunde stellt die Schulungsumgebung einschließlich der benötigten Zugänge, Nutzungsrechte und vereinbarten Ressourcen bereit. Erforderlich sind Python, ein geeigneter Voxtral-API-Zugang, Kopfhörer und freigegebene Audioaufnahmen. Für die Echtzeitdemonstration werden ein vorbereiteter Client und der passende Dienstzugang benötigt. Stimmenklonen und die Verarbeitung realer vertraulicher Gespräche sind nicht Bestandteil der Übungen.
Passende Vertiefungen
Die Auswahl richtet sich nach den jeweiligen Voraussetzungen der Folgeseminare.
Fachbereichsleiter / Leiter der Trainer / Ihre Ansprechpartner
-

Lucas Beich
Telefon: + 49 (221) 74740055
E-Mail: lucas.beich@seminar-experts.de -

Paul Goldschmidt
Telefon: + 49 (221) 74740055
E-Mail: paul.goldschmidt@seminar-experts.de
Seminardetails
| Dauer: | 2 Tage ca. 6 h/Tag, Beginn 1. Tag: 10:00 Uhr, weitere Tage 09:00 Uhr |
|---|---|
| Preis: |
Öffentlich oder Live Stream: € 1.198 zzgl. MwSt. Inhaus: € 3.400 zzgl. MwSt. |
| Teilnehmeranzahl: | min. 2 - max. 8 |
| Teilnehmer: | Entwickler, Integrationsspezialisten, technische Verantwortliche für Sprach- und Dokumentationsprozesse |
| Voraussetzungen: | Python-, HTTP- und API-Grundkenntnisse; erste Erfahrung mit Mistral oder vergleichbaren Modellaufrufen. |
| Standorte: | Stream Live, Inhaus/Firmenseminar, Berlin, Bremen, Darmstadt, Dresden, Erfurt, Essen, Flensburg, Frankfurt, Freiburg, Friedrichshafen, Hamburg, Hamm, Hannover, Jena, Kassel, Köln, Konstanz, Leipzig, Luxemburg, Magdeburg, Mainz, München, Münster, Nürnberg, Paderborn, Potsdam, Regensburg, Rostock, Stuttgart, Trier, Ulm, Wuppertal, Würzburg |
| Methoden: | Vortrag, Demonstrationen, praktische Übungen am System |
| Seminararten: | Öffentlich, Webinar, Inhaus, Workshop - Alle Seminare mit Trainer vor Ort, Webinar nur wenn ausdrücklich gewünscht |
| Durchführungsgarantie: | ja, ab 2 Teilnehmern |
| Sprache: | Deutsch - bei Firmenseminaren ist auch Englisch möglich |
| Seminarunterlage: | Dokumentation auf Datenträger oder als Download |
| Teilnahmezertifikat: | ja, selbstverständlich |
| Verpflegung: | Kalt- / Warmgetränke, Mittagessen (wahlweise vegetarisch) |
| Support: | 3 Anrufe im Seminarpreis enthalten |
| Barrierefreier Zugang: | an den meisten Standorten verfügbar |
| Weitere Informationen unter + 49 (221) 74740055 |
Seminartermine
Die Ergebnissliste kann durch Anklicken der Überschrift neu sortiert werden.
