Aanduiding voor het werkingsmodel van voicebots waarbij spraak via een spraakherkenningsoplossing wordt omgezet in tekst, wordt geanalyseerd door een LLM, en daarna de respons tot stand komt door tekst weer om te zetten naar spraak via een spraakgenerator. Naast de twee omzettingsslagen is ook tijd nodig voor het bepalen van het moment waarop de spreker is uitgesproken, zodat de voicebot de input kan verwerken en een respons kan formuleren, bijvoorbeeld door een kennisbank te raadplegen. De verschillende omzettingen kosten verwerkingstijd, wat aan latency bijdraagt. Daarnaast gaat bij de omzetting naar tekst de auditieve informatie uit de conversatie verloren, zoals snelheid, toonhoogte en volume.
Zie ook speech-to-speech, voicebot, spraakherkenning, voice activity detection
Terug naar startpagina woordenboek
