Voice-Modelle ermöglichen Sprach-zu-Text (Transkription) und Text-zu-Sprache (Sprachausgabe) in VARIOS AI. Jedes Voice-Modell wird einem Modelltyp zugewiesen, der die verfügbaren Konfigurationsoptionen und Kostenfelder bestimmt.
Modelltypen
Grunddaten (beide Typen)
Kosten nach Modelltyp
Transkriptions-Modell Kosten
Transkriptionsmodelle verarbeiten Audio-Eingaben und erzeugen Text-Ausgaben.
Sprach-Modell Kosten
Sprachmodelle verarbeiten Text-Eingaben und erzeugen Audio-Ausgaben.
Die Token-Kosten für Voice-Modelle unterscheiden sich je nach Modelltyp.
Transkriptionsmodelle haben drei Kostenfelder (Text-Input, Text-Output,
Audio-Input), während Sprachmodelle nur zwei Kostenfelder benötigen
(Text-Input, Audio-Output).
Voice-Modelle verfügen nicht über DLP-Sicherheitseinstellungen, da die
Datenverarbeitung über die zugehörigen Chat- und Embedding-Modelle abgesichert wird.