VoiceLab Article
Mapa de Frecuencias de la Voz Humana: La guía definitiva para mezclar voces
Un mapa psicoacústico completo de la voz humana, del peso subsónico al aire ultrasónico, diseñado para productores que mezclan con intención.
Resumen ejecutivo
Enciclopedia premium de VoiceLab para productores sobre bandas de frecuencia vocal, función emocional, EQ, saturación, compresión, plugins y entrenamiento auditivo.
Cómo esta investigación orienta la producción
Esta publicación está escrita para productores, directores creativos, equipos de voz IA y responsables de marca que necesitan evaluar una voz antes de comprometer una campaña, un dataset o una narración larga.
Su valor práctico no es la distancia académica. Es una conversación de producción más clara: qué puede sostener la voz, cuánta intimidad o autoridad ofrece, dónde el mastering debe mantenerse transparente y qué condiciones de grabación protegen la firma vocal.
Para publicidad, documental, comunicación corporativa, lujo y voz IA, este enfoque convierte observaciones acústicas en decisiones útiles de casting, briefing, grabación, aprobaciones y entrega final.
- Útil para casting, briefing, dirección de grabación y revisión de postproducción.
- Relevante para locución comercial, narración corporativa, documental, datasets de voz IA y sistemas conversacionales.
- Escrito para que productores, directores creativos y equipos de tecnología vocal conviertan los hallazgos en decisiones prácticas de grabación.
Índice
Cómo usar este mapa de frecuencias
Un mapa de frecuencias vocales no es un recetario. Es una arquitectura de escucha. El mismo movimiento de 3 dB puede volver una voz íntima, otra agresiva y otra completamente artificial. El productor debe leer a la vez la banda, la fuente, el micrófono, la sala, la interpretación y el formato de entrega. La mezcla vocal premium empieza cuando la frecuencia se convierte en psicología.
Esta guía divide la voz humana en siete zonas de trabajo: 20-80 Hz, 80-250 Hz, 250-800 Hz, 800 Hz-2.5 kHz, 2.5-6 kHz, 6-12 kHz y 12-20 kHz. En cada banda, la pregunta importante no es solo cómo suena, sino qué cree el oyente a causa de ella. ¿La voz parece fiable, demasiado cerca, cara, nerviosa, presente, cansada, sintética o viva? Ese es el mapa real.
Usa los rangos como territorios solapados, no como fronteras rígidas. Una voz grave, una voz femenina brillante, una locución comercial española, un audiolibro catalán, una narración cinematográfica inglesa y una voz TTS no colocan la emoción exactamente en el mismo punto. Aun así, la lógica psicoacústica se repite: los graves dan suelo, los medios bajos dan carne, los medios dan lenguaje, la presencia da contacto, el aire da acabado y la octava superior da halo.
20-80 Hz
Esta banda no contiene el significado del habla, pero cambia el suelo emocional de una grabación. En voz profesional suele sentirse como movimiento de sala, vibración mecánica, ruido de pie de micro, plosivas, rumble de transporte y energía baja de escenario. Un poco de profundidad controlada puede hacer que un narrador cinematográfico parezca más grande que los altavoces. Demasiada convierte la voz en pesada antes de volverla íntima. Técnicamente, en voiceover, podcast, audiolibro y TTS conviene filtrar casi siempre esta zona porque consume headroom sin mejorar inteligibilidad. Usa un filtro paso alto con intención: a menudo 60-80 Hz para voz hablada, más bajo para una voz cinematográfica profunda, más alto para reproducción móvil. El exceso produce boom, pumping del limitador, falsa proximidad y reverbs turbias. El defecto rara vez importa, salvo en narración trailer o cinematográfica donde quitarlo todo puede separar la voz del espacio.
Ajustes típicos: high-pass de 12 o 18 dB por octava entre 55 y 80 Hz, con automatización si las plosivas cambian. La saturación debe ser mínima; si se usa, mejor color de transformador que genere armónicos por encima del fundamental y no más subgrave. La compresión no debería reaccionar a esta zona salvo como efecto. Filtra el detector del compresor con sidechain high-pass para que el subgrave no baje toda la voz.
- Peso subsónico y control de rumble
80-250 Hz
El rango 80-250 Hz da confianza física a la voz. Es pecho, masa, gravedad, calidez y la sensación de que hay una persona con cuerpo detrás de las palabras. En voiceover comercial puede crear autoridad sin gritar. En podcast aporta proximidad y confianza. En audiolibro permite que el narrador acompañe durante horas. En narración cinematográfica puede hacer que una frase parezca inevitable. Técnicamente contiene fundamentales graves, proximity effect y parte de la firma de sala. El exceso genera boom, tono de almohada, boca demasiado pegada al micrófono, transitorios lentos y una mezcla grande pero poco clara. El defecto vuelve la voz fina, nerviosa, de papel o desconectada de la imagen.
Ajustes típicos: shelves o campanas pequeñas entre 100 y 180 Hz, muchas veces con control dinámico cuando la proximidad cambia entre frases. La saturación puede ser de válvula, cinta o transformador, pero ligera, porque el enriquecimiento armónico aquí se convierte en barro muy rápido. La compresión funciona bien con ataque lento y release medio cuando quieres preservar movimiento de pecho; para podcast, usa nivelación suave antes del control final. Evita aplastar esta zona con compresión rápida porque la voz pierde respiración y escala.
- Cuerpo, pecho y suelo emocional
250-800 Hz
Esta es la banda más malinterpretada de la voz. Emocionalmente contiene calidez, madera, humanidad y la sensación de un tracto vocal real. Técnicamente también contiene caja, acumulación de sala, tono de cabina, resonancia nasal baja y el velo que hace que una voz fuerte parezca tapada. Muchos productores piden más presencia cuando el problema real no está en 3 kHz, sino en demasiado 350-600 Hz. El exceso crea cartón, congestión, dicción apagada, fatiga de medios bajos y una voz cercana pero no íntima. El defecto crea una voz vaciada, espectacular en solo pero pobre en contexto, sin continuidad.
Ajustes típicos: EQ sustractiva en 300-500 Hz para barro, cortes más estrechos cerca de 550-750 Hz para caja o resonancia de tubo, y EQ dinámica si la acumulación aparece solo en ciertas vocales. La saturación debe elegirse con cuidado: la cinta puede suavizar esta zona, pero la saturación de válvula densa puede engordarla demasiado. La compresión debe ser transparente y sensible a frecuencia. La compresión multibanda puede contener el bloom de medios bajos sin aplanar toda la interpretación. En audiolibro y podcast, esta banda decide si el oyente se relaja o se cansa.
- Calidez, madera, caja y densidad
800 Hz-2.5 kHz
Este rango es la arquitectura del lenguaje. Emocionalmente da dirección, intención y la sensación de que el hablante elige palabras, no solo produce sonido. Técnicamente contiene definición de vocales, tono frontal, soporte de consonantes y la forma que permite leer una frase en altavoces pequeños. El exceso crea honk, empuje nasal, dureza telefónica y una voz que parece dar una lección. El defecto vuelve la voz educada pero distante, brillante pero vaga, o enterrada bajo guitarras, sintes y ambiente.
Ajustes típicos: preparación amplia de presencia entre 1 y 2 kHz, cortes cautos en nodos nasales y automatización cuando una frase necesita avanzar. La saturación puede funcionar muy bien aquí si es armónica y no quebradiza: consola, cinta o color de triodo sutil pueden hacer que las palabras se lean sin subir EQ. La compresión debe preservar microfraseo. Demasiada compresión rápida hace que todas las sílabas parezcan igual de urgentes. EQ dinámica o control multibanda suele ser más elegante que un boost estático.
- Forma de palabra e inteligibilidad
2.5-6 kHz
Este es el corredor de presencia. Contiene ataque consonántico, articulación, borde labial, mordida, primera sensación de proximidad y la zona donde una voz atraviesa un arreglo denso sin más fader. Alrededor de 3.3 kHz suele vivir el Presence Anchor, el punto donde la voz empieza a aparecer emocionalmente delante del oyente. El exceso crea agresividad, presión publicitaria barata, fatiga auditiva, dolor en auriculares y sensación de que el locutor empuja. El defecto vuelve la voz apagada, lenta, detrás de la música y emocionalmente indecisa.
Ajustes típicos: realces anchos y pequeños entre 3 y 4 kHz solo después de limpiar 250-800 Hz; cortes dinámicos entre 3.5 y 5 kHz cuando ciertas palabras pinchan; de-essing cuidadoso si consonantes y sibilancia se solapan. La saturación debe ser contenida y de calidad, porque el clipping duro aquí se convierte rápido en lija. La compresión debe seguir la frase. Usa EQ dinámica, de-essing split-band o compresión multibanda que se mueva solo cuando la voz se vuelve cortante. Para TTS y voces de interfaz repetidas, esta zona debe ser clara pero nunca punitiva.
- Presencia, ataque y verdad frontal
6-12 kHz
La banda 6-12 kHz aporta aire, pulido, respiración, saliva, intimidad, brillo moderno y resolución percibida. Emocionalmente puede hacer que una voz parezca premium, limpia y cara, pero también puede revelar ansiedad, sequedad, artefactos de edición y textura sintética. Técnicamente contiene sibilancia, ruido de labios, comportamiento del de-esser, artefactos de compresión en agudos y el sheen final que coloca la voz en una producción terminada. El exceso crea sibilancia, cristal, fatiga, consonantes frágiles y una voz que parece brillante pero menos humana. El defecto genera una voz tapada, vieja, con manta o demasiado castigada por de-essing.
Ajustes típicos: de-ess antes de añadir aire, shelf suave solo si la boca y la grabación lo permiten, y comprobación en auriculares, móvil y escucha baja. La saturación puede ser útil si crea armónicos superiores suaves en vez de fizz; cinta y excitadores refinados funcionan, potenciadores agresivos rompen la ilusión. La compresión debe ser muy cuidadosa. La compresión broadband rápida suele exagerar sibilancia. Control split-band entre 6 y 9 kHz y shaping de aire por separado suelen ser más limpios.
- Aire, brillo, detalle de boca y acabado
12-20 kHz
La mayor parte de la información del habla está por debajo de esta banda, pero 12-20 kHz afecta la sensación de apertura. Emocionalmente es halo, espacio, cristal limpio y la sugerencia de que la grabación tiene aire alrededor. Técnicamente contiene la parte más alta de la respiración, tono de conversor, noise shaping, artefactos de oversampling, hiss y el pulido de cadenas de mastering. El exceso rara vez ayuda en voz larga. Puede crear hiss, lujo falso, encodes frágiles y fatiga aunque el medidor parezca tranquilo. El defecto suele ser aceptable en podcast o audiolibro, pero en publicidad premium y voz pop una ausencia total puede hacer que la voz parezca pequeña o antigua.
Ajustes típicos: shelves muy suaves por encima de 12 o 14 kHz, solo después de resolver sibilancia. La saturación debe ser elegante y con oversampling; si no, el aliasing convierte el halo en grano. La compresión casi nunca es necesaria aquí salvo para controlar hiss o aire exagerado con EQ dinámica. Compara siempre después de conversión a codec, porque algunos masters brillantes se desmoronan al codificar.
- Halo, apertura e ilusión ultrasónica
Ejemplos por formato de producción
El voiceover comercial suele necesitar grave limpio, medios bajos controlados y un Presence Anchor deliberado. Una campaña de automóvil puede usar 100-180 Hz para confianza y 3-4 kHz para mando, mientras que un spot de perfume de lujo quizá reduzca densidad de medios bajos, mantenga sedosa la zona 2.5-6 kHz y añada solo un shelf de respiración controlado. El error es hacer que todos los anuncios sean altos, brillantes y comprimidos. La publicidad premium suena cara porque tiene contención.
El podcast pide comodidad antes que espectáculo. Filtra 20-80 Hz, controla proximidad en 120-220 Hz, quita caja alrededor de 300-600 Hz y evita un pico estático en 4 kHz que se vuelve agotador después de veinte minutos. El audiolibro es todavía más conservador: el oyente necesita continuidad durante horas, así que una presencia áspera y un aire artificial en 12 kHz son más peligrosos que un agudo algo modesto. La narración debe desaparecer como tecnología y permanecer como persona.
TTS y sistemas de voz requieren consistencia sin castigo. La banda 2.5-6 kHz debe sostener inteligibilidad, pero los prompts repetidos convierten una pequeña dureza en fatiga real. Usa EQ dinámica en presencia, de-essing suave, control de 6-12 kHz y casi nada de realce dramático en graves. La canción pop es distinta: acepta más saturación, compresión paralela y aire porque compite con batería, bajo y sintes. Incluso ahí, la voz debe conservar verdad de vocales y no convertirse solo en objeto brillante.
La narración cinematográfica usa todo el mapa. Puede conservar más cuerpo en 80-250 Hz, menos agresividad en 3-5 kHz, silencio profundo entre frases y un halo 12-20 kHz cuidadosamente diseñado. La voz debe sentirse más grande que el habla ordinaria pero no separada de la boca humana. Cuando la narración sostiene imagen, la mejor decisión de EQ suele ser la que vuelve creíble la escena, no la que impresiona en solo.
Diagramas explicados en texto
Diagrama 1: imagina la voz como un edificio. 20-80 Hz es la vibración del suelo bajo el edificio. 80-250 Hz es la losa de cimentación. 250-800 Hz es la estructura de madera. 800 Hz-2.5 kHz es el pasillo que permite moverse al lenguaje. 2.5-6 kHz es la puerta de entrada donde el oyente encuentra al hablante. 6-12 kHz es el cristal y la luz. 12-20 kHz es el cielo sobre el tejado. Si la cimentación es demasiado grande, la puerta desaparece. Si el cristal brilla demasiado, nadie confía en la habitación.
Diagrama 2: imagina una línea horizontal de izquierda a derecha: peso, cuerpo, palabra, presencia, aire, halo. Una buena mezcla vocal no es una curva sonriente; es una frase equilibrada. El oyente debe viajar del cuerpo al significado sin notar el camino técnico. Cuando realces una banda, pregunta qué palabra de ese diagrama se vuelve más fuerte emocionalmente.
Diagrama 3: imagina tres capas verticales. La capa inferior es estabilidad: 80-250 Hz más 250-500 Hz controlados. La capa media es identidad: 500 Hz a 2.5 kHz. La capa superior es contacto: 2.5 kHz hacia arriba. Si mezclas la capa superior antes de limpiar la inferior, la voz se convierte en suciedad brillante. Si eliminas la inferior antes de entender la identidad, la voz se vuelve cara pero vacía.
Recomendaciones de plugins por tarea
Para EQ quirúrgica, FabFilter Pro-Q 3, Kirchhoff-EQ, DMG Equilibrium y TDR Nova son opciones sólidas. Úsalos para high-pass, limpieza de medios bajos, nodos nasales y control dinámico de presencia. Para gestión de resonancias, oeksound soothe2, Waves Silk Vocal o EQ dinámica inteligente pueden ayudar, pero el objetivo no es borrar personalidad. Quita lo que bloquea la frase, no lo que hace humana a la voz.
Para saturación, Soundtoys Decapitator, FabFilter Saturn 2, UAD Studer, Softube Tape, Black Box HG-2 y emulaciones de consola con transformador pueden añadir densidad. Úsalos distinto por banda: soporte armónico en 80-250 Hz, calidez prudente en 250-800 Hz, densidad de articulación en 800 Hz-2.5 kHz y casi ninguna distorsión agresiva por encima de 6 kHz. El oversampling importa cuando el agudo está expuesto.
Para compresión, un control tipo 1176 puede aportar urgencia, una nivelación tipo LA-2A puede suavizar narración, herramientas tipo R-Vox pueden resolver consistencia broadcast rápida, y Pro-MB o C6 pueden contener regiones concretas. Para de-essing, FabFilter Pro-DS, Oxford SuprEsser, Weiss Deess y RX son fiables cuando se ajustan escuchando, no mirando medidores. La mejor cadena suele ser sencilla: EQ de limpieza, saturación ligera, compresión de frase, control dinámico de presencia, de-ess y tono final.
Cómo escuchar frecuencias y entrenar el oído
El entrenamiento auditivo para voz empieza por la sustracción. Toma una grabación hablada limpia y crea siete bandas de EQ. Realza una banda 6 dB durante diez segundos, nombra el cambio emocional, vuelve a cero y recorta la misma banda 6 dB. No empieces memorizando números. Empieza nombrando percepción: suelo, pecho, barro, palabra, mordida, aire, halo. Cuando la palabra está clara, el número se vuelve útil.
Practica en tres niveles de monitorización. A bajo volumen, presencia e inteligibilidad se revelan con honestidad. A volumen medio, cuerpo y medios bajos son más fáciles de juzgar. A volumen alto, dureza y sibilancia se vuelven obvias, pero no tomes decisiones finales ahí porque el oído se protege. Repite el ejercicio en monitores, auriculares cerrados, earbuds y altavoz de móvil. La banda que sobrevive a todos los sistemas suele ser el problema real.
Usa ruido rosa y referencias solo como calibración, no como gusto. Compara una voz de podcast en la que confías, un audiolibro que puedas escuchar una hora, una voz pop que atraviese sin dolor, una locución comercial de lujo y una narración cinematográfica. Barre frecuencias lentamente, pero no mezcles mientras barres. El barrido exagera problemas. Las decisiones reales vienen de comparar con bypass, igualar nivel y hacer una pregunta: ¿la voz se vuelve más creíble?
Un ejercicio semanal útil es el diario de siete bandas. Para cada mezcla, escribe una frase por banda antes de tocar plugins. 20-80 Hz: ¿qué ruido existe? 80-250 Hz: ¿el cuerpo sostiene o infla? 250-800 Hz: ¿hay calidez o velo? 800 Hz-2.5 kHz: ¿las palabras se leen? 2.5-6 kHz: ¿el hablante está presente o afilado? 6-12 kHz: ¿el aire es humano o cosmético? 12-20 kHz: ¿el halo ayuda o solo hay hiss? Este hábito convierte la EQ en disciplina de escucha, no reacción.
Hallazgos clave
- Cada banda de frecuencia tiene una función emocional y una función técnica.
- La presencia depende de la relación entre cuerpo, lenguaje, ataque y aire, no de un realce aislado.
- El entrenamiento auditivo funciona cuando los números se convierten en nombres perceptivos: suelo, calidez, palabra, contacto, aire y halo.
Conclusiones técnicas
El mapa definitivo de frecuencias de la voz no es una lista de realces y recortes. Es una forma de conectar frecuencia con creencia humana. Una mezcla vocal premium da al oyente cuerpo, lenguaje, presencia, aire y verdad en la proporción correcta para cada formato.
Preguntas de producción resueltas
¿Cómo debería usar un productor este artículo de Voice Lab?
Como referencia de dirección vocal antes de casting o grabación. Aclara identidad acústica, decisiones de mastering, relevancia para voz IA y el tipo de briefing que JOIA necesita para entregar tomas útiles.
¿Los hallazgos sirven para planificar voz IA o datasets?
Sí. Ayudan a definir consistencia, identidad vocal, diseño de prompts, uso con consentimiento y criterios de revisión antes de una sesión TTS, clonación de voz o IA conversacional.
¿Cuál es el valor comercial de la investigación?
Da a agencias, marcas y productoras un lenguaje compartido sobre tono, calidez, claridad, autoridad, intimidad y acabado broadcast, reduciendo feedback ambiguo durante la grabación.
Aplicar esta investigación a un proyecto de voz
Envía un guion, contexto de campaña o necesidad de voz IA y solicita dirección vocal, disponibilidad de grabación u orientación de uso. Para presupuesto, disponibilidad o sesión dirigida, incluye duración del guion, uso, mercado y fecha de entrega.
Hablar de un proyecto de voz