Warum Fehlerfreiheit nicht überzeugt. Und was eine KI uns über echte Sprechwirkung lehrt.

Google hat für sein KI-Tool Gemini Notebook (vormals NotebookLM) öffentlich bestätigt, dass die computergenerierten Podcast-Stimmen absichtlich mit Stottern, Füllwörtern und kleinen Verzögerungen ausgestattet werden, weil reine, fehlerfreie Sprache unglaubwürdig und roboterhaft wirkt.
Mit diesem Artikel werde ich nun aus sprechwissenschaftlicher Sicht einordnen, warum diese sogenannten Disfluencies keine Schwäche sind, sondern ein zentraler Baustein echter Wirkung, und was Sie für Ihre eigene Kommunikation daraus lernen können.

„Sprich möglichst fehlerfrei.“
„Vermeide Füllwörter.“
„Klinge glatt und souverän.“
Diese Regeln begegnen mir ständig, in Präsentationstrainings, in Bewerbungsratgebern, in den Köpfen meiner Kundschaft vor dem ersten Kamera-Take. Sie klingen einleuchtend. Wer kompetent wirken will, spricht doch bitte durchgestylt, oder?
Ausgerechnet eine künstliche Intelligenz widerspricht dem gerade sehr deutlich.
Was Google zugegeben hat
Googles Gemini Notebook erzeugt aus hochgeladenen Dokumenten kleine KI-Podcasts: Zwei Stimmen, die sich locker über Ihre Inhalte unterhalten.
Im offiziellen Interview „Inside NotebookLM“ erklärt Steven Johnson, Editorial Director bei Google Labs, wie dieser Eindruck entsteht (Google DeepMind):
„The instructions take the script that is generated, and they add noise to the script. So they add what are called disfluencies, so all the stammers, and the ‘likes,’ and the interjections that humans actually have when they speak. And it turns out you need that because if you don’t have that noise, it sounds too robotic.“
Auf Deutsch: Das Team nimmt ein fertiges, glattes Skript und baut nachträglich Stottern, Füllwörter und Zwischenrufe ein. Ohne dieses Rauschen, sagt Johnson, klingen zwei KI-Stimmen im Dialog schlicht unerträglich. Bereits Monate zuvor beschrieb er im Podcast „Hard Fork“ der New York Times denselben Schritt und nannte ihn seinen „liebsten neuen Fachbegriff“ (zitiert bei Simon Willison):
„You cannot listen to two robots talking to each other.“
Ein Software-Konzern investiert also gezielt in Entwicklungsressourcen, um seine KI-Stimmen unperfekter klingen zu lassen. Als Sprechwissenschaftlerin überrascht mich das nicht. Es bestätigt etwas, das in meinem Fach seit Jahrzehnten erforscht wird.
Was die Sprechwissenschaft längst weiß
Die Psycholinguisten Herbert Clark und Jean Fox Tree zeigten schon 2002 in einer mittlerweile viel zitierten Studie, dass „äh“ und „ähm“ keine Fehler sind, sondern eigenständige Signalwörter mit klarer Funktion (Clark & Fox Tree, 2002). Sprechende kündigen damit an, dass gleich eine kurze oder eine längere Denkpause folgt. Zuhörende registrieren dieses Signal, meist unbewusst, und richten ihre Aufmerksamkeit entsprechend aus.
In der deutschen Sprechwissenschaft heißen diese Phänomene Häsitationen oder Verzögerungsphänomene. Sie umfassen Füllwörter, Wortwiederholungen, Dehnungen und stille Pausen, alles Spuren des Sprechdenkens, also des Formulierens in Echtzeit (Uni Hildesheim). Genau dieses Sprechdenken fehlt reinem, glattgebügeltem Text komplett. Deshalb liest sich ein auswendig gelernter Satz oft seltsam steif, sobald er gesprochen wird.
Eine Studie der Universität Trier fand sogar heraus, dass unser individuelles Häsitationsverhalten über die Zeit erstaunlich konstant bleibt, so konstant, dass es sich forensisch zur Identifikation von Sprechenden nutzen lässt (idw-online). Unsere kleinen Unregelmäßigkeiten sind also kein Ausrutscher. Sie sind Teil unseres authentischen und individuellen Sprechens.
Wenn nun selbst ein Weltkonzern wie Google seine künstlichen Stimmen mühsam mit genau diesen Unregelmäßigkeiten ausstatten muss, um menschlich zu wirken, zeigt das etwas Bemerkenswertes: Perfektion ist nicht das Ziel gelungener Kommunikation. Sie ist eher ein Warnsignal.
Warum das für Ihre Wirkung relevant ist
Viele meiner Kundinnen und Kunden kommen mit dem gleichen Anspruch ins Training: fehlerfrei sprechen, keine Füllwörter, keine Versprecher, am liebsten wie vorgelesen. Genau das führt in der Praxis oft zum Gegenteil von Überzeugungskraft.
Ein paar Beobachtungen aus der Sprechwirkungsforschung, die sich mit der Gemini Notebook-Erkenntnis decken:
Zuhörende vertrauen einer Stimme mit natürlichen Denkpausen eher als einer Stimme, die im Vortrags-Modus abläuft.
Vollständig glatte Sprache wirkt vorbereitet, distanziert und manchmal sogar unehrlich, weil sie kein sichtbares Denken zeigt.
Kleine Verzögerungen lenken die Aufmerksamkeit des Publikums genau dorthin, wo gleich etwas Wichtiges kommt.
Menschen, die bewusst mit Pausen arbeiten, statt sie zu vermeiden, wirken präsenter, nicht unsicherer.
Das bedeutet nicht, dass Sie sich künftig Füllwörter angewöhnen sollten. Es bedeutet, dass die Jagd nach völliger Fehlerfreiheit die falsche Zielrichtung ist. Wirkung entsteht nicht durch Glätte, sondern durch die Fähigkeit, im Moment präsent zu bleiben und genau das hörbar zu machen.
Fazit für die Praxis
Eine KI muss ihre Stimmen künstlich mit Unregelmäßigkeiten ausstatten, weil echte menschliche Sprache genau davon lebt.
Sie müssen sich diese Unregelmäßigkeiten nicht künstlich aneignen. Sie haben sie bereits.
Die eigentliche Aufgabe im Training ist eine andere: Nicht Fehler eliminieren, sondern lernen, mit dem eigenen Sprechdenken souverän umzugehen, Pausen bewusst zu setzen, Unsicherheit nicht zu verstecken, sondern zu steuern.
Das unterscheidet auswendig gelernte Glätte von echter Wirkung.
Sie wollen lernen, mit Ihrer natürlichen Sprechweise zu wirken?
Dann sind Sie hier genau richtig.
Herzlich willkommen im Institut für Wirkungskompetenz.
Quellenverzeichnis
Braun, A., Elsässer, N., & Willems, L. (2023). Disfluencies revisited: Are they speaker-specific? Languages, 8(3), Artikel 155. https://doi.org/10.3390/languages8030155
Clark, H. H., & Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73–111. https://doi.org/10.1016/S0010-0277(02)00017-3
Google DeepMind. (2024, 26. November). Inside NotebookLM | Raiza Martin and Steven Johnson [Video]. YouTube. https://www.youtube.com/watch?v=mccQdu5afZw
Informationsdienst Wissenschaft. (2023, 4. Juli). Jeder sagt anders „ähm“. idw-online. https://idw-online.de/de/news817192
Lenz, F., Frobenius, M., & Klattenberg, R. (2021). „Ähm. Stop.“ – Häsitationsphänomene als Merkmal pragmatischer Kompetenz von Englischlehrkräften. In K. Glaser & H. Limberg (Hrsg.), Pragmatische Kompetenzen im schulischen Fremdsprachenunterricht (S. 364–392). Peter Lang.
Willison, S. (2024, 29. September). NotebookLM’s automatically generated podcasts are surprisingly effective. Simon Willison’s Weblog. https://simonwillison.net/2024/Sep/29/notebooklm-audio-overview/



Kommentare