A voz ouvida em uma gravação tende a parecer mais aguda e menos encorpada do que aquela percebida durante a fala. A diferença ocorre porque, ao falar, a pessoa recebe o próprio som por duas vias ao mesmo tempo.
Uma delas é a transmissão pelo ar. As ondas sonoras chegam aos tímpanos, que vibram, e a cóclea transforma essas vibrações em sinais neurais interpretados pelo cérebro como sons. Esse é o caminho também presente quando a fala é reproduzida por um áudio.
A outra via depende das vibrações nos ossos da cabeça. O crânio funciona como uma caixa de ressonância e conduz o som diretamente ao ouvido interno, com efeito especialmente relevante sobre a cóclea. Essa transmissão modifica o espectro percebido da voz e aumenta a contribuição relativa das frequências baixas.
Por isso, a voz que uma pessoa identifica como sua durante a fala resulta da combinação entre o som que viaja pelo ar e aquele transmitido pelos ossos. O timbre percebido fica mais grave e encorpado do que no registro feito por um dispositivo.
Por que o áudio também pode soar achatado
Ao ouvir uma gravação, o ouvido recebe somente a parcela do som que percorreu o ar. Como essa informação é diferente daquela captada durante a fala, a voz parece não corresponder à experiência habitual de quem a produz.
Há ainda uma característica dos equipamentos de gravação: eles processam e, muitas vezes, comprimem o áudio. Esse procedimento reduz a faixa dinâmica, que é o intervalo entre os sons mais suaves e os mais intensos. Como resultado, parte das nuances se perde e a voz pode parecer mais achatada.
Cantores e outras pessoas que usam a voz profissionalmente podem recorrer a exercícios e técnicas para ajustar a própria entonação. O objetivo é aproximar a voz percebida pelo público daquela que esses profissionais escutam ao falar ou cantar.







