Saltar al contenido principal
Voz y acapellas

Mezcla de voz: EQ, compresión, de-essing, saturación, reverb y delay

Cadena de mezcla de voz paso a paso: EQ, compresión, de-essing, saturación, reverb, delay, throws, dobles y ad-libs.

  • Intermedio
  • DJ · Técnico
  • 6 min de lectura
  • Revisado el 30/09/2026

La voz es el elemento que más atención concentra en cualquier mezcla, y por eso es donde más procesadores se apilan sin un plan. El resultado típico es una cadena heredada de otro tema: un EQ que aclara, una compresión que no se sabe por qué está ahí, un de-esser que alguien puso porque sí y una reverb que deja la voz flotando.

Una cadena de voz útil se entiende por lo que resuelve, no por los números. Esta guía recorre la secuencia habitual: corrección si procede, EQ sustractivo, compresión, de-essing, saturación y espacio con reverb y delay, y cierra con cómo tratar throws, dobles y ad-libs para que apoyen sin tapar la principal. Si la toma de origen está bien, todo esto es más fácil: conviene venir de la grabación vocal con niveles sanos.

La cadena de la voz, paso a paso

El orden no es dogma, pero sí tiene una lógica: primero se corrige lo que no se puede arreglar más tarde, después se equilibra el tono, luego se doma la dinámica, se controlan los efectos secundarios de esa dinámica y solo al final se añade color y espacio. Cada etapa condiciona la siguiente: si comprimes sin haber quitado una resonancia, el compresor trabajará sobre ella todo el rato.

Antes de encadenar nada, fija el nivel: que la pista de voz entre en la mezcla con margen y sin que los medidores se disparen. El marco de niveles está explicado en gain staging y en la guía de medidores dBFS y LUFS; procesar con la señal demasiado alta hace que cada plugin trabaje peor.

Comparativa
Eslabón Problema que resuelve Cuándo se toca
Corrección de tono Notas que desentonan o titubeanAntes de todo, solo si hace falta
EQ sustractivo Frecuencias opacas o resonancias molestasPrimer paso de la cadena
Compresión Frases que suben y bajan de nivelDespués de limpiar con EQ
De-essing Sibilancias duras tras aclarar y comprimirJusto después de la compresión
Saturación Voz delgada, sin cuerpo ni integraciónAntes de mandar al espacio
Reverb y delay Voz seca, sin sitio en la mezclaAl final, normalmente por envío

Tabla con seis eslabones de la cadena de voz, el problema que resuelve cada uno y el momento habitual de uso, desde la corrección de tono hasta la reverberación y el delay.

EQ: quitar antes de añadir

El primer movimiento es sustractivo. Busca con un barrido estrecho las frecuencias que estorban: caja en la zona baja, nasales en las medias altas, silbidos puntuales. Corta lo que sobra antes de subir nada, porque cada refuerzo paga un coste en claridad y en espacio para el resto de pistas.

Un corte de graves alrededor de los 80-150 Hz quita el ruido de fondo y el exceso de cuerpo sin tocar la voz; un corte ancho y suave en medias puede abrir la frase; un filtro de corte de graves por debajo de 80-100 Hz es casi siempre beneficioso en voces cantadas. Los refuerzos llegan después: brillo con un shelf en agudos si la voz lo pide, presencia puntual si la voz se pierde entre instrumentos.

El orden importa aquí: un EQ corregido antes de la compresión hace que el compresor reaccione a la voz y no a sus defectos. Después de comprimir suele hacer falta un segundo EQ, más fino, porque la dinámica modificada revela frecuencias que antes no molestaban.

Compresión: domar sin aplastar

La compresión existe para que las frases se escuchen al mismo nivel sin que la voz principal desaparezca en los pasajes suaves. El objetivo auditivo es simple: que la última palabra de la frase tenga el mismo peso que la primera, y que las respiraciones y las consonantes no salten.

Como punto de partida, iZotope recomienda buscar entre 3 y 7 dB de reducción en la voz principal; por encima de ese rango, la voz empieza a sonar exprimida. El umbral marca cuánto de la frase trabaja, el ratio cuánto, el ataque decide si dejan pasar los transitorios de las consonantes y la liberación si la compresión respira o se queda pegada. Ajustes lentos de umbral con ganancia de recuperación moderada suenan más naturales que un control agresivo.

Si una sola compresión no llega sin exagerar, se encadenan dos suaves: la primera doma los picos grandes, la segunda asienta el conjunto. Y si la voz es muy dinámica de origen, casi siempre conviene volver atrás antes que apretar más.

De-essing: controlar la sibilancia

El de-essing ataca el efecto secundario de todo lo anterior: al aclarar con EQ y comprimir, las eses se destacan más. Un de-esser es, en la práctica, un compresor con detector filtrado: escucha un rango concreto y baja el nivel solo cuando aparece sibilancia.

La colocación lógica es después del EQ que aclara y de la compresión, para que reaccione sobre el sonido ya asentado. FabFilter documenta los controles que comparten casi todos: umbral, rango máximo de reducción y filtros de la cadena lateral para definir la ventana de detección, situando las eses normales de la voz alrededor de 8 a 10 kHz y permitiendo buscar entre 2 y 20 kHz. El modo Single Vocal distingue sibilancia de no sibilancia; en material complejo se recurre al modo general por rango de frecuencia.

La prueba de escucha es filtrar solo la señal de detección y comprobar que solo contiene eses. Si se oye la palabra, el filtro está mal ubicado. Y conviene dosis bajas: demasiado de-essing convierte la voz en algo turbio y consonante, como si al intérprete le faltara aire.

Saturación: cuerpo y presencia

La saturación añade armónicos y densidad: es lo que hace que una voz delgada se sienta integrada en la pista en lugar de colocada encima. Se usa en dosis pequeñas, normalmente sobre el canal principal o en un envío corto.

El criterio es el resultado, no el tipo de circuito: un preamp saturado da calidez, un tape suaviza los picos, un modo más agresivo aporta grit. En todos los casos vale la máxima de menos es más: si la saturación se oye como distorsión, ya está alta de más. También es una buena aliada de los dobles, porque los despega de la principal sin tener que subir su volumen.

Reverb y Delay: profundidad sin ensuciar

El reverb y el delay colocan la voz en un sitio. La reverberación suaviza y da tamaño; el delay da movimiento y repite información que ayuda a sostener las frases largas. Los dos riesgos son los mismos: demasiado tiempo de cola compite con la inteligibilidad y contenido de graves ahoga la voz.

Las palancas habituales son la pre-delay, que separa la voz de la cola y la mantiene delante; el barrido de graves y agudos de la propia reverberación, para que no compita con el cuerpo ni con las consonantes; y la cantidad, que casi siempre es menor de lo que parece en solitario. En lugar de insertar el espacio en el canal, lo habitual es mandarlo por envío: así se comparte entre voces y se automatiza sin tocar la pista principal.

Throws, dobles y ad-libs

Throws. Es un delay disparado en una sola palabra o frase, casi siempre al final de un bloque, que se corta antes de la siguiente entrada. Dan un detalle de arreglo que la cama constante de eco no consigue, y se automatizan sin más que abrir el envío en el punto exacto.

Dobles. Son una segunda interpretación del mismo texto: engordan el estribillo y dan ancho. Para que funcionen necesitan su propio espacio, con nivel más bajo, algo de estereofonía y, a veces, un tratamiento distinto al de la principal; si suenan igual que la principal a nivel idéntico, producen combado en lugar de cuerpo.

Ad-libs. Son las frases de apoyo, las exclamaciones y los guiños que se lanzan por encima. Se tratan como elementos aparte: más procesados, con más espacio y con huecos claros para que no se solapen con el verso. La regla común de los tres recursos es que apoyan, no compiten: si el oído no sabe qué escuchar primero, sobran.

Siguiente paso

Cuando la voz ya está montada y mezclada, toca llevarla al escenario digital: acapellas para DJs con stems, de-noise, de-reverb, chops y stutters.

Preguntas frecuentes

¿Qué va primero, el EQ o la compresión?

El orden depende del problema. Si hay frecuencias que estorban o resonancias, primero un EQ sustractivo para que el compresor no reaccione a basura; si la toma está equilibrada y solo hay que domar la dinámica, se puede comprimir directo y corregir después lo que la compresión de a la vista.

¿Cuánta compresión es normal en una voz?

La referencia práctica habitual está entre 3 y 7 dB de reducción en la voz principal, con la reducción visible pero no obvia. Más allá, la voz empieza a sonar aplastada y las respiraciones y la sibilancia se hacen más evidentes.

¿Dónde va el de-esser en la cadena?

Tras el EQ que aclara y la compresión, que es donde la sibilancia aparece con más fuerza. Un de-esser es básicamente un EQ y un compresor trabajando a la vez sobre un rango concreto: detecta la sibilancia y baja su nivel cuando aparece.

¿La reverb ensucia la voz?

Puede. Añade profundidad y suaviza, pero si es larga o está llena de graves compite con la inteligibilidad. La práctica habitual es cortar graves y agudos de la propia reverberación y usar poca cantidad; la voz se mantiene delante y el espacio, detrás.

¿Qué es un throw de delay?

Un delay que solo aparece en una palabra o frase concreta, normalmente al final de un bloque, y que se corta antes de la siguiente entrada. Evita la cama constante de eco y convierte el efecto en un recurso de arreglo.

Continúa aprendiendo

Siguiente lecciónAcapellas para DJs: stems, de-noise, de-reverb, chops y stutters

Cómo preparar acapellas para DJs: separación por stems, de-noise, de-reverb, ajuste de tono y tempo, chops y stutters en cabina.

Fuentes

  1. Crafting a basic vocal chain Documentación oficial iZotope · consultado el 30/09/2026

    Describe una cadena de voz típica: corrección de tono, EQ, compresión, de-esser y después delay y reverb, con la recomendación de buscar entre 3 y 7 dB de compresión y situar el de-esser por encima de unos 3 kHz.

  2. 4 steps to a polished vocal mix Documentación oficial iZotope · consultado el 30/09/2026

    Recorre limpieza de ruido, corrección de tono, EQ y sibilancia: distingue de-essers de banda ancha, de banda dividida y modos espectrales, y sitúa la sibilancia de voz en zonas que pueden bajar hasta unos 2 kHz en casos de chasquido.

  3. Basic controls — FabFilter Pro-DS Help Documentación oficial FabFilter · consultado el 30/09/2026

    Explica los controles de un de-esser: umbral, rango, filtros de la cadena lateral entre 2 y 20 kHz y modo Single Vocal frente a Allround, indicando que las eses normales de voz suelen estar en torno a 8 a 10 kHz.

  4. Vocal mixing cheat sheet: Your guide to a release-ready sound Documentación oficial iZotope · consultado el 30/09/2026

    Guía de referencia con el orden de trabajo en una sesión real: reparación previa, EQ, compresión con ajustes suaves de umbral, de-essing y canales paralelos para compresión, brillo y dobles.

Última revisión técnica: 30/09/2026. Si detectas un error, indícalo para corregirlo.