При воспроизведении аудио, отправленного самому себе, например в WhatsApp, многие люди замечают, что голос звучит иначе, часто выше, что вызывает вопросы о том, как его воспринимают другие. Причина этого расхождения заключается в том, что опыт прослушивания живой речи отличается от опыта прослушивания записанного голоса.
Когда мы говорим, наш голос проходит по двум различным путям. Один из них — это распространение звука по воздуху, когда звуковые волны достигают барабанных перепонок, которые вибрируют и посылают нервные сигналы в мозг для слуховой интерпретации. Второй путь включает вибрации, передаваемые через кости головы. Череп действует как резонатор, заставляя внутреннее ухо, особенно улитки, вибрировать напрямую.
Эта костная передача изменяет кажущийся спектр голоса, приводя к большему относительному вкладу низких частот, что придает воспринимаемому тембру более глубокие и насыщенные характеристики. Таким образом, когда мы говорим, мы слышим сумму этих двух одновременных передач: воздушной и костной, формируя голос, который мы считаем своим.
Однако, прослушивая запись собственного голоса, мы получаем доступ только к звуковой передаче по воздуху. Поскольку информация, получаемая ушами, не соответствует комбинации двух факторов, присутствующих в естественной речи, воспринимаемый голос отличается. Кроме того, записывающее оборудование не идеально; оно обрабатывает и сжимает аудио, уменьшая динамический диапазон, из-за чего голос теряет нюансы и звучит более однородно.
Для профессионалов, использующих голос в своей работе, таких как певцы, существуют специальные методы и упражнения, которые помогают настроить интонацию, стремясь приблизить голос, который слышит публика, к тому, который слышит сам человек.

