Sound effects, ambience, music editing y loudness para vídeo.
Cómo construir efectos de sonido, ambientes y edición de música contra imagen, y cómo medir el loudness del vídeo para entregar dentro de objetivo.
Una vez el diálogo está montado, la pieza suena todavía a maqueta: voces sobre silencio, música que entra y sale sin motivo y ningún sonido que explique dónde estamos. El trabajo de esta etapa es añadir las capas que faltan —efectos, ambiente y música— y cerrar el nivel de entrega para que la plataforma no tenga que adivinar nada.
Este capítulo cubre Sound effects, Ambience, Music editing y Loudness para vídeo: cómo se construye cada capa, cómo se corta la música contra la imagen y con qué criterio se mide el nivel final.
Sound effects: de dónde sale cada sonido
Los Sound effects son todo aquello que no es diálogo ni música: impactos, roces, mecanismos, pasos de fondo, transiciones y detalles de diseño. En la práctica se agrupan en tres familias: efectos duros que ocurren en pantalla, texturas que acompañan y efectos de diseño que no existen en el mundo real pero dan identidad a la pieza.
Un efecto sólido suele ser una composición, no un único fichero. Se combina un componente transitorio que marca el golpe, un cuerpo que da peso y una cola que lo integra en el espacio. Antes de apilar capas conviene comprobar la fase: dos versiones del mismo golpe desfasadas se comen los graves y el resultado suena fino aunque el medidor diga lo contrario.
El origen es indiferente. Las bibliotecas aportan variedad y grabaciones profesionales, mientras que grabar los sonidos concretos del plano da coincidencia exacta con lo que se ve. Lo que decide la velocidad de trabajo es la organización: nombres consistentes con fuente, lugar y fecha, y metadatos que permitan encontrar un sonido sin abrir veinte. La misma disciplina que se aplica en la creación de librerías de field recording sirve aquí.
El criterio de elección es la perspectiva, no el gusto. Un efecto grabado de cerca suena presente y detallado; uno captado desde lejos suena pequeño y envuelto en el espacio. Si el plano es abierto, el efecto necesita la cola y la distancia del plano; si es un primer plano, necesita el detalle. Mezclar efectos de biblioteca de estilos distintos sin igualar distancia y reverb produce el síntoma típico de una escena donde los sonidos parecen venir de sitios diferentes.
Ambience: la capa que se nota cuando falta
El Ambience es la cama de sonido ambiental que sostiene la escena: aire de sala, tráfico lejano, aparatos, viento, murmullo de un local. Se trabaja por capas —un lecho continuo, eventos distantes que ocurren de vez en cuando y detalles cercanos que solo aparecen cuando el plano los justifica— para que el ambiente tenga profundidad en lugar de sonar a bucle.
Su función principal es ocultar los cortes. Cuando el diálogo se edita toma a toma, la cama ambiental mantiene la sensación de continuidad y los empalmes dejan de percibirse. Por eso entra después del diálogo y se mueve con él: si la escena cambia de día o de localización, el ambiente cambia en el mismo fotograma.
Dos errores recurrentes: dejar silencio entre escenas, que resulta más evidente que cualquier ruido, y pasar un ambiente demasiado presente, que compite con la voz. La regla práctica es escuchar el ambiente con la boca cerrada y la voz en off: si el ambiente solo se nota cuando el diálogo calla, está en su sitio.
Music editing: música contra imagen
El Music editing es ajustar música existente a la estructura visual: no componer, sino cortar, extender y colocar. El punto de partida es la sesión con la imagen importada y marcadores en los puntos de interés —cambios de escena, golpes dramáticos, entradas de logotipo— que serán los lugares donde la música puede entrar, salir o cambiar.
La técnica de montaje más habitual emplea una pista de trabajo para los cortes y dos pistas de música alternas: cada edición se prueba sobre la de trabajo y se mueve a una u otra para que los fundidos sean siempre posibles sin deshacer el corte anterior. Los cortes se colocan en golpes o en transiciones visuales; los que caen en mitad de una frase musical se enmascaran con un efecto, un fundido corto o la entrada de un efecto sonoro.
También hay que decidir el origen de la música. Las canciones comerciales exigen licencia para cualquier pieza que se publique; las bibliotecas de música libre de derechos cubren el uso dentro de sus condiciones. Y si la imagen ya venía con música temporal, esa referencia sirve para entender el estilo pedido, pero no para entregar.
Un detalle de oficio acelera mucho el trabajo: preparar la sesión a 48 kHz con la imagen a la velocidad real y medir las duraciones en compases antes de cortar. Si la música se corta contra el fotograma sin ajustarse a compases, cada ajuste obliga a recolocar; si se corta sobre compases y marcadores, mover un bloque entero es un solo arrastre con el ratón. Y conviene dejar escrito qué se cortó y por qué: cuando llega una revisión con la escena tres segundos más larga, la nota ahorra reconstruir el razonamiento.
Loudness para vídeo: medir antes de exportar
El Loudness para vídeo no es un gusto personal: es una especificación del destino. Se mide en LUFS o LKFS con medición integrada de la pieza completa, acompañada del techo de true peak, y cada destino tiene su objetivo. La televisión europea trabaja con -23 LUFS según EBU R 128 y la estadounidense con -24 LKFS según ATSC A/85.
Las plataformas de vídeo normalizan por su cuenta: bajan o suben la mezcla hasta su objetivo, que para YouTube ronda los -14 LUFS. Eso no significa entregar a -14, sino entender que una mezcla demasiado baja será subida con su ruido de fondo al descubierto, y una demasiado alta será recortada.
Medir antes de exportar resuelve ambos casos: se revisa el loudness integrado de la mezcla completa, el pico real con margen de seguridad y la coherencia entre escenas, y se corrige con automatización de nivel en lugar de con un limitador trabajado en exceso. El detalle de los medidores y del margen está en la guía de mastering, true peak y limitación, y el mismo criterio vale para radio y podcast.
| Destino | Norma o práctica | Objetivo de loudness |
|---|---|---|
| Televisión europea | EBU R 128 | -23 LUFS integrado con límite de true peak |
| Televisión de EE. UU. | ATSC A/85 | -24 LKFS medido por bloques de tres segundos |
| Plataformas de vídeo online | Normalización interna de la plataforma | Ajustan a su objetivo, en torno a -14 LUFS en YouTube |
| Cine y salas | Mezcla de referencia del propio filme | Se decide en la sala de mezcla, no con un medidor de canal |
Tabla de cuatro filas que compara televisión europea, televisión estadounidense, plataformas de vídeo online y cine, con su norma y su objetivo de loudness.
Cómo se balancean las capas en la mezcla
La jerarquía de una mezcla para imagen es simple: primero la voz, después lo que la apoya y al final lo que decora. La música y los efectos se mueven alrededor del diálogo con automatización —bajar en las frases importantes, subir en las pausas— en vez de intentar que un compresor haga ese trabajo a ciegas.
Tres comprobaciones evitan la mayoría de los problemas. Escuchar a nivel de referencia constante, porque el oído se acostumbra y todo parece correcto a los cinco minutos. Revisar en mono para detectar elementos que solo existen en un canal y desaparecen en pantallas de un altavoz. Y comparar con una referencia de volumen y estilo parecido, para no juzgar la mezcla contra el recuerdo de la anterior.
La imagen también manda en el campo estéreo. Si un sonido está anclado a un objeto que cruza el plano, el paneo lo sigue; si es ambiente, ocupa el ancho completo sin movimientos bruscos; si acompaña a la voz, se mantiene centrado para no competir con ella. Todo lo que se mueve sin motivo en el estéreo distrae de la imagen, y en canales pequeños o en móvil se percibe mucho antes que en el estudio.
Checklist de entrega de audio para vídeo
Antes de exportar: sample rate idéntico al del proyecto de vídeo, profundidad suficiente, sin recortes en los picos, loudness integrado dentro del objetivo de destino, true peak con margen, primera y última media segunda revisadas y sincronía comprobada de principio a fin con la imagen.
Exportar el máster en el formato que pide el destino, conservar una copia del proyecto y de los elementos sueltos por si llegan correcciones, y anotar el nivel al que se entregó. Anotar el nivel parece excesivo hasta la primera revisión en la que alguien pregunta a cuánto se mezcló.
Siguiente paso
Con la banda completa y el nivel medido, queda cerrar la sincronía y preparar la entrega formal: timecode, stems, especificaciones de canal y paquetes de entrega. Todo eso está en la guía de sync audio/video, timecode, deliverables, stems y broadcast specs.
Preguntas frecuentes
¿Cuál es la diferencia entre ambience y room tone?
El room tone es el silencio grabado en la localización para poder empalmar diálogos sin cortes evidentes; el ambience es la capa de sonido ambiental que se construye o se amplía para dar contexto a la escena: aire, tráfico lejano, aparatos, naturaleza. El tono de sala sostiene los cortes y el ambience sostiene el mundo de la historia.
¿A cuántos LUFS debo exportar un vídeo?
Depende del destino: la televisión europea trabaja con -23 LUFS según EBU R128, la estadounidense con -24 LKFS según ATSC A/85 y las plataformas de vídeo normalizan internamente a su propio objetivo, así que conviene entregar con el margen correcto y sin picos de true peak en lugar de intentar forzar su normalización.
¿Puedo cortar una canción para que encaje con la escena?
Sí, y es el trabajo habitual de music editing: localizar los puntos de interés con marcadores, cortar en golpes que enmascaren la unión, usar fundidos cortos o dejar que el efecto sonoro cubra el corte. Si la pieza tiene licencia, el uso queda dentro de sus condiciones; si no, conviene resolver los derechos antes de entregar.
¿Los efectos de sonido se compran o se graban?
Las dos cosas. Las bibliotecas aportan variedad y calidad de captación, mientras que grabar los gestos concretos del proyecto —herramientas, puertas, mecánicas del propio plano— da coincidencia exacta con la imagen. Lo importante es tener metadatos claros y nombres consistentes para poder encontrar cada sonido en segundos.
¿Qué pasa si la mezcla suena bien en mis altavoces pero la plataforma la sube?
Que estás midiendo mal. Si la mezcla llega muy por debajo del objetivo, la plataforma sube el volumen y revela ruido; si llega demasiado alta, recorta o baja el general y se pierde dinámica. Medir el loudness integrado y el true peak antes de exportar evita cualquiera de los dos escenarios.
Continúa aprendiendo
Si esto te suena a chino, empieza por aquí
Relacionadas
Fuentes
- EBU Recommendation R 128 — Loudness normalisation
Define la normalización de loudness en -23 LUFS con medición integrada y límite de true peak, además del método de medición; es la referencia de la sección de loudness para vídeo en destino europeo.
- ATSC/CEA Recommended Practice: Techniques for Establishing and Maintaining Audio Loudness for Digital Television
Práctica recomendada para televisión digital estadounidense, con objetivo de -24 LKFS y uso de la medición por bloques de tres segundos; aporta el segundo destino de loudness de la tabla comparativa.
- Designer Sounds
Explica el music editing contra imagen: marcar los puntos de interés del vídeo, montar sobre una pista de trabajo y alternar dos pistas de música para hacer fundidos, y avisar de que una canción comercial no se puede usar sin licencia; base de la sección de music editing.
- The Sound Effects Metadata Style Guide
Artículo sobre lo que buscan los compradores de bibliotecas de efectos: variedad, metadatos útiles y nombres consistentes; sirve para la sección de sound effects y organización de biblioteca.
Última revisión técnica: 01/10/2026. Si detectas un error, indícalo para corregirlo.