Frequenzbereich der Sprache
Der Frequenzbereich der Sprache reicht ungefähr von 100 bis 8.000 Hertz. Im unteren Teil liegt der Grundton der Stimme. Darüber folgen dann die Vokale. Viele Konsonanten gehen bis in die hohen Frequenzen hinauf. Die meiste Schallenergie steckt dabei im tiefen und mittleren Bereich.
Viele Konsonanten haben ihre wichtigsten Anteile zwischen etwa 1.000 und 4.000 Hertz und sind deutlich leiser als die Vokale. Für das Verstehen sind sie trotzdem wichtiger, weil man an ihnen erkennt, welches Wort gemeint ist. Beim Fernsehen gehen gerade die Konsonanten leicht unter, wenn Musik und Geräusche im selben Frequenzbereich liegen oder die Lautsprecher den Ton nicht in Richtung Sofa abgeben.
Was ist der Frequenzbereich der Sprache
Die Frequenz beschreibt, wie oft eine Schallwelle pro Sekunde schwingt. Die Einheit dafür ist Hertz. Tiefe Töne haben eine niedrige Frequenz, hohe Töne eine hohe. Die menschliche Stimme besteht nicht aus einem einzelnen Ton, sondern aus dem Grundton, seinen Obertönen und den Formanten. Zusammen bilden sie den Frequenzbereich der Sprache.
Grundton der Stimme
Beim Sprechen schwingen die Stimmlippen im Kehlkopf und erzeugen den Grundton. Er bestimmt, wie hoch oder tief eine Stimme klingt. Bei Männern liegt er im Mittel um 120 Hertz, bei Frauen um 210 Hertz. Bei Kindern liegt er noch einmal höher.
Der Grundton bleibt allerdings nicht gleich. Innerhalb eines Satzes steigt und fällt er, etwa am Ende einer Frage oder bei einer Betonung. Diese Sprachmelodie hilft beim Verstehen. Um einzelne Wörter zu unterscheiden, ist der Grundton jedoch weniger wichtig.
Obertöne und Klangfarbe
Zusammen mit dem Grundton entstehen Obertöne. Das sind Vielfache der Grundfrequenz, die bis weit nach oben reichen. Ihre Stärke unterscheidet sich von Mensch zu Mensch und gibt jeder Stimme ihre eigene Klangfarbe. An der Klangfarbe erkennt man z.B. bekannte Stimmen im Fernsehen, auch wenn der Schauspieler oder Moderator gerade nicht im Bild ist.
Formanten und Vokale
Auf dem Weg nach außen geht der Schall durch Rachen und Mund, bei manchen Lauten auch durch die Nase. Diese Räume verstärken einzelne Frequenzbereiche, die man Formanten nennt. Je nachdem, wie Zunge, Kiefer und Lippen stehen, verschieben sich die Formanten. So entsteht ein A, ein I oder ein U.
Um die meisten Vokale zu unterscheiden, reichen die ersten zwei bis drei Formanten aus. Diese Formanten liegen zwischen einigen hundert Hertz und etwa 3.000 Hertz. Bei offenen Vokalen wie A liegt der erste Formant höher, bei geschlossenen Vokalen wie I oder U tiefer.
Konsonanten in den hohen Frequenzen
Viele Konsonanten entstehen nicht durch die Stimmlippen, sondern durch Luft, die an einer Engstelle im Mund vorbeiströmt oder kurz gestoppt wird. Das erzeugt ein Rauschen, das höher liegt als die Vokale. Diese Laute sind leiser als die Vokale, tragen aber einen großen Teil der Information, an der man ein Wort vom anderen unterscheidet.
| Anteil der Sprache | Typischer Bereich | Bedeutung für das Verstehen |
|---|---|---|
| Grundton | Männer um 120 Hz, Frauen um 210 Hz | Tonhöhe und Sprachmelodie |
| meiste Schallenergie | etwa 250 bis 500 Hz | Fülle und Lautstärke der Stimme |
| Formanten der Vokale | einige hundert bis etwa 3.000 Hz | Unterscheidung der Vokale |
| Sch | um 2.500 bis 3.000 Hz | Unterscheidung von S und Sch |
| S | um 4.000 bis 5.000 Hz | kräftiges Rauschen, Unterscheidung von S und Sch |
| F | ohne klare Spitze, breit verteilt | leise, wird leicht verdeckt |
Die meiste Energie steckt im tiefen Bereich, die für das Verstehen wichtigen Anteile liegen höher.
Zisch-, Reibe- und Verschlusslaute
Laute wie S, Sch und F nennt man Reibelaute, weil die Luft durch eine schmale Öffnung gedrückt wird. Beim S liegt der stärkste Anteil um 4.000 bis 5.000 Hertz, das Rauschen reicht aber noch weiter nach oben. Beim Sch liegt er etwas tiefer, um 2.500 bis 3.000 Hertz. An diesem Unterschied hört man z.B., ob im Film von einer „Tasse“ oder einer „Tasche“ die Rede ist.
Das F ist wesentlich leiser und verteilt seine Energie gleichmäßiger über einen breiten Bereich. Es geht deshalb besonders leicht verloren, wenn gleichzeitig andere Geräusche zu hören sind. Ähnlich geht es Lauten wie T, K und P. Man nennt sie Verschlusslaute, weil die Luft kurz gestoppt und dann wieder freigegeben wird. Dabei entsteht nur ein kurzes Geräusch.
Stimmhafte und stimmlose Laute
Viele Konsonanten gibt es in zwei Varianten. Beim W schwingen die Stimmlippen mit, beim F nicht. Genauso ist es beim weichen S in „reisen“ und beim scharfen S in „reißen“. Bei den stimmhaften Lauten kommen deshalb tiefe Anteile im Bereich des Grundtons dazu, meist unter 500 Hertz.
Dieser Unterschied im tiefen Bereich hilft dabei, Wörter wie „Wein“ und „fein“ auseinanderzuhalten. Ein großer Teil der Information steckt aber auch hier im Rauschen an der Engstelle und damit in den höheren Frequenzen.
Leise Anteile mit großer Wirkung
Die meiste Schallenergie der Sprache liegt zwischen etwa 250 und 500 Hertz, also im Bereich von Grundton und ersten Formanten. Um 3.000 Hertz ist Sprache im Mittel deutlich leiser. Trotzdem versteht man einzelne Wörter vor allem über diese oberen Frequenzen.
Wenn dem Ton die hohen Anteile fehlen, klingt eine Stimme zwar noch laut genug, die Wörter verschwimmen aber. „Tisch“ und „Fisch“ lassen sich dann schwerer unterscheiden. Umgekehrt bleibt Sprache auch dann verständlich, wenn die tiefen Frequenzen schwach sind, etwa bei einem kleinen Lautsprecher.
Sprache im Fernsehton
Im Fernsehen sind Stimmen selten allein zu hören. Musik, Geräusche und Raumklang laufen gleichzeitig mit und liegen oft in denselben Frequenzbereichen wie die Konsonanten. Hinzu kommt, wie der Fernseher den Ton abgibt und wie weit das Sofa entfernt ist.
Musik und Geräusche im selben Bereich
Ein lauter Ton verdeckt leisere Töne mit ähnlicher Frequenz. Wenn Filmmusik oder Geräusche im Bereich zwischen 1.000 und 4.000 Hertz liegen, überdecken sie genau die Konsonanten, die für das Verstehen wichtig sind. Die Vokale bleiben dabei oft noch hörbar, deshalb wirkt die Stimme laut, aber undeutlich. In Nachrichten und Talkshows läuft meist keine Musik unter den Stimmen. Die Konsonanten werden dann nicht überdeckt, deshalb ist Sprache dort oft leichter zu verstehen als in einem Film.
Mit dem Equalizer des Fernsehers kann man den Bereich der Konsonanten etwas lauter stellen. Dann werden allerdings auch Musik und Geräusche in diesem Bereich lauter. Bei einem TV-Sprachverstärker wie OSKAR löst ein Algorithmus die Stimmen aus dem übrigen Fernsehton heraus, bevor sie hervorgehoben werden. Weil das Gerät neben dem Sofa stehen kann, kommen auch die leisen Konsonanten ohne langen Umweg durch den Raum an.
Lautsprecher und Abstrahlung
Lautsprecher geben hohe Frequenzen stärker gebündelt ab als tiefe. Die hohen Töne kommen deshalb vor allem dort an, wohin der Lautsprecher zeigt. Bei vielen flachen Fernsehern sitzen die Lautsprecher an der Unterseite oder an der Rückseite des Geräts. Gerade die Konsonanten treffen dann zuerst auf die Wand oder auf Möbel.
Tiefe Anteile wie der Grundton breiten sich dagegen gleichmäßiger in alle Richtungen aus. Auf dem Sofa klingt die Stimme deshalb oft noch laut genug, obwohl die hohen Anteile fehlen.
Eine Soundbar vor dem Fernseher gibt den Ton meist nach vorn ab, also in Richtung Sofa. Wenn sie in einem Regal oder hinter einer Leiste des Fernsehmöbels steht, kann trotzdem ein Teil der hohen Töne verloren gehen. Die Konsonanten kommen deshalb besser an, wenn zwischen Lautsprecher und Sofa nichts im Weg steht.
Abstand und Nachhall
Je weiter das Sofa vom Fernseher entfernt ist, desto mehr Schall kommt auf Umwegen über Wände, Decke und Boden an. Diese Reflexionen treffen etwas später ein als der direkte Ton. Sie verwischen vor allem kurze Laute wie T und K, weil ein lauter Vokal noch im Raum nachklingt, wenn der leise Konsonant folgt.
Wenn das Sofa näher am Fernseher steht, kommt mehr direkter Ton an. Die Konsonanten sind dann klarer zu hören, weil sich weniger Nachhall darüberlegt.
Häufig gestellte Fragen
Gesprochene Sprache nutzt Frequenzen von etwa 100 bis 8.000 Hertz. Am unteren Ende liegen tiefe Anteile wie der Grundton einer Männerstimme, am oberen Ende Zischlaute wie das S. Dazwischen findet man die Obertöne und die Formanten, an denen man die Vokale erkennt.
Beim Flüstern schwingen die Stimmlippen nicht mit, deshalb fehlt der Grundton. Mund und Rachen formen trotzdem die Formanten der Vokale. Stimmlose Konsonanten wie S, F oder T entstehen wie beim normalen Sprechen. Weil diese Anteile für das Verstehen wichtiger sind als der Grundton, bleibt Geflüstertes verständlich, solange es im Raum ruhig genug ist.
Gesang nutzt im Wesentlichen dieselben Bereiche, reicht in der Tonhöhe aber oft höher und tiefer als Sprache. Beim Singen hält man außerdem die Vokale länger als beim Sprechen. Konsonanten treten dadurch etwas zurück, weshalb Liedtexte manchmal schwerer zu verstehen sind als gesprochene Sätze.
Die menschliche Stimme hat keine einzelne Frequenz. Als Tonhöhe nimmt man den Grundton wahr, der bei Frauen knapp eine Oktave höher liegt als bei Männern. Beim Sprechen wandert er ständig nach oben und unten. Gleichzeitig klingen Obertöne und Formanten mit, die bis in mehrere tausend Hertz reichen.
Für Sprache kommt es vor allem auf den Bereich zwischen etwa 1.000 und 4.000 Hertz an. Ein Lautsprecher sollte ihn sauber und ohne Einbrüche wiedergeben. Tiefe Frequenzen unter 100 Hertz braucht man für Stimmen kaum, sie geben vor allem Musik und Geräuschen Volumen. Die Frequenzangabe im Datenblatt verrät allerdings nicht, wie gleichmäßig ein Gerät diese Frequenzen wiedergibt und in welche Richtung es den Ton abgibt.
