Der natürlichste Weg mit einer Website zu sprechen ist die Stimme. Die Herausforderung: Verständnis und Denken sollen im Haus bleiben — trotzdem schnell und flüssig.
Herausforderung
Cloud-Sprachdienste schicken jede Aufnahme an Dritte. Ziel war ein Voice-Agent, dessen Spracherkennung und KI-Antwort auf eigener Hardware laufen — ohne die zähen Wartezeiten, die man von langsamen lokalen Setups kennt.
Lösung
- Spracherkennung (Whisper large-v3) läuft lokal auf eigener GPU — Transkription in rund 0,6 Sekunden.
- Das KI-Gehirn ist dasselbe lokale Sprachmodell wie im Text-Chat — kein Cloud-LLM.
- Die Antwort wird satzweise gestreamt: Der Agent beginnt zu sprechen, während der Rest noch entsteht — ein Telefon-Gefühl, das sich unterbrechen lässt.
- Für die Sprachausgabe stehen zwei Wege bereit: eine natürliche Stimme sowie eine vollständig lokale Variante mit Stimm-Cloning direkt auf der GPU.
Warum lokal
Spracherkennung und KI-Antwort laufen komplett auf eigener Hardware — die Sprache-zu-Text-Verarbeitung verlässt das Haus nicht. Für die Sprachausgabe steht zusätzlich eine lokale GPU-Variante zur Verfügung, wenn maximale Datenhoheit gefragt ist.
Ein Voice-Agent, der Anrufe annimmt, berät und qualifiziert — auf eurer Infrastruktur, in eurer Stimme.