Voice AI · Lokale KI

Sprich mit der Website — lokaler KI-Voice-Agent

Freihändiges Gespräch mit Ada: Spracherkennung und KI-Antwort laufen auf eigener GPU, satzweise gestreamt.

Der natürlichste Weg mit einer Website zu sprechen ist die Stimme. Die Herausforderung: Verständnis und Denken sollen im Haus bleiben — trotzdem schnell und flüssig.

Herausforderung

Cloud-Sprachdienste schicken jede Aufnahme an Dritte. Ziel war ein Voice-Agent, dessen Spracherkennung und KI-Antwort auf eigener Hardware laufen — ohne die zähen Wartezeiten, die man von langsamen lokalen Setups kennt.

Lösung

  • Spracherkennung (Whisper large-v3) läuft lokal auf eigener GPU — Transkription in rund 0,6 Sekunden.
  • Das KI-Gehirn ist dasselbe lokale Sprachmodell wie im Text-Chat — kein Cloud-LLM.
  • Die Antwort wird satzweise gestreamt: Der Agent beginnt zu sprechen, während der Rest noch entsteht — ein Telefon-Gefühl, das sich unterbrechen lässt.
  • Für die Sprachausgabe stehen zwei Wege bereit: eine natürliche Stimme sowie eine vollständig lokale Variante mit Stimm-Cloning direkt auf der GPU.

Warum lokal

Spracherkennung und KI-Antwort laufen komplett auf eigener Hardware — die Sprache-zu-Text-Verarbeitung verlässt das Haus nicht. Für die Sprachausgabe steht zusätzlich eine lokale GPU-Variante zur Verfügung, wenn maximale Datenhoheit gefragt ist.

~0,6 s (lokal)
Transkription
~1,8 s
Erste Antwort
lokal, eigene GPU
KI-Gehirn
freihändig, streaming
Bedienung

Ein Voice-Agent, der Anrufe annimmt, berät und qualifiziert — auf eurer Infrastruktur, in eurer Stimme.

Zum Live-AgentenProjekt besprechen