Skip to main content
Voice-Modelle ermöglichen Sprach-zu-Text (Transkription) und Text-zu-Sprache (Sprachausgabe) in VARIOS AI. Jedes Voice-Modell wird einem Modelltyp zugewiesen, der die verfügbaren Konfigurationsoptionen und Kostenfelder bestimmt.

Modelltypen

Grunddaten (beide Typen)

Kosten nach Modelltyp

Transkriptions-Modell Kosten

Transkriptionsmodelle verarbeiten Audio-Eingaben und erzeugen Text-Ausgaben.

Sprach-Modell Kosten

Sprachmodelle verarbeiten Text-Eingaben und erzeugen Audio-Ausgaben.
Die Token-Kosten für Voice-Modelle unterscheiden sich je nach Modelltyp. Transkriptionsmodelle haben drei Kostenfelder (Text-Input, Text-Output, Audio-Input), während Sprachmodelle nur zwei Kostenfelder benötigen (Text-Input, Audio-Output).
Voice-Modelle verfügen nicht über DLP-Sicherheitseinstellungen, da die Datenverarbeitung über die zugehörigen Chat- und Embedding-Modelle abgesichert wird.