Sprache & Bild

Voice Agents

Das Modell spricht, der Server entscheidet

Ein strukturiertes Gespräch – ein Nutzerinterview, eine Bedarfsanalyse, eine Erstaufnahme im Support – kostet eine qualifizierte Fachkraft eine Stunde pro Teilnehmer, Terminfindung nicht eingerechnet. Mit unserer Voice-Interview-Plattform wird daraus ein Link: öffnen, sprechen, fertig. Kein Konto, keine App, auf Deutsch oder Englisch. Die KI-Stimme hört zu, geht auf Rückfragen ein und übersteht Unterbrechungen ebenso wie Abschweifungen.

Die entscheidende Frage ist aber nicht, wie gut die Stimme klingt, sondern wer das Interview führt. Unsere Antwort: Das Modell führt das Gespräch, der Server führt das Interview. Welche Frage kommt, wann nachgehakt wird, wann Schluss ist – das entscheidet eine getestete Zustandsmaschine in der Anwendung, nicht die Tagesform des Modells. Und zwar strukturell erzwungen: Der Sprachagent kann nach jeder Antwort nur ein einziges Werkzeug aufrufen, und dessen Ergebnis ist seine nächste Anweisung. Jeder Teilnehmer durchläuft nachweisbar denselben Prozess.

Diese Architektur hat einen Praxistest hinter sich. Den naheliegenden ersten Ansatz – die Sprachverbindung als reine Audioleitung, alle Steuerung im Server – haben wir gebaut und an realen Bedingungen scheitern sehen: Schon Hintergrundgeräusche brachten den Gesprächsfluss aus dem Takt. Die heutige Aufgabenteilung ist das Ergebnis dieses Tests.

Auch der Datenschutz steckt in der Architektur: Audio läuft per WebRTC direkt zwischen Browser und Sprachanbieter und berührt unsere Server nie. Der Browser erhält nur kurzlebige Zugangstoken; signierte Links, Widerrufsprüfung und Ratenbegrenzung sichern jeden öffentlichen Endpunkt. Wer nicht sprechen kann oder will, nimmt den Text-Chat – durch dieselbe Interview-Logik.

Was Voice Agents für euer Projekt bedeuten

Skalierbare Gespräche

Nutzerinterviews, Bedarfsanalysen, Erstaufnahmen: Was bisher Kalender und Fachkräfte band, wird ein Link – beliebig viele Gespräche, konsistent geführt, automatisch dokumentiert.

Regeln statt Laune

Der Agent kann Fragen weder überspringen noch umdichten – die Interview-Logik läuft als getestete Zustandsmaschine im Server. Auditierbar, wiederholbar, fair.

Praxiserprobte Architektur

Die Aufgabenteilung – Modell spricht, Server entscheidet – hat sich gegen reale Störfälle durchgesetzt: Hintergrundlärm, Unterbrechungen, Verbindungsabbrüche. Genau dafür ist sie gebaut.

Highlights

  • Natürliche Sprachgespräche: Teilnehmer öffnen einen Link und sprechen
  • Gesprächsführung durch getestete Geschäftslogik – nicht durch das Modell
  • Jeder Teilnehmer bekommt nachweisbar denselben strukturierten Prozess
  • Audio berührt unsere Server nie – direkte, abgesicherte Verbindung
  • Zweisprachig (DE/EN), mit Text-Chat als gleichwertigem Zugangsweg
  • Wiederverwendbare Sammel-Links und fortsetzbare Sitzungen

Aus dem AI Spotlight

Softwareentwicklung in Hamburg!

Starten Sie ein neues Projekt mit uns oder verbessern Sie ein bestehendes auf das nächste Level