Saltar al contenido principal
Audio para vídeo, cine, videojuegos y medios interactivos (ruta opcional) · Intermedio · 7 min de lectura

Surround, immersive audio, spatial audio y audio para instalaciones.

Del multicanal al objeto: cómo funcionan surround, immersive audio y spatial audio, y qué exige proyectar audio para instalaciones fijas.

El estéreo resuelve bien la mayoría de los encargos, pero hay destinos que piden más: un canal de televisión que exige 5.1, una plataforma que recibe objetos inmersivos, unos auriculares que prometen posición real o un espacio físico donde cada zona necesita su propio nivel. Sin entender cómo se representa el sonido en cada caso, se entrega el formato equivocado y se pierde la escucha prevista.

Este capítulo cubre Surround, Immersive audio, Spatial audio y Audio para instalaciones: qué modelo usa cada uno, cómo se renderiza y qué decisiones de proyecto hay que tomar antes de grabar o mezclar.

Surround: la base multicanal

El Surround es un modelo de canales: una disposición fija de altavoces —5.1 con frente, centro, LFE y dos traseros, 7.1 añadiendo laterales— y cada sonido colocado en los canales que correspondan. El centro existe para anclar el diálogo, los canales traseros para la envolvente y el LFE para la extensión grave, que no es un subwoofer por canal sino una pista aparte.

Trabajar así tiene consecuencias concretas. La mezcla se valida en una sala con la disposición correcta o con un renderizado que la emule, la imagen estéreo del frente se conserva y el movimiento se consigue cruzando señal entre canales. Si la pieza debe sonar también en estéreo, se comprueba el downmix: un diálogo mal colocado en el centro puede perderse o quedar demasiado presente al reducir a dos canales.

La convención también ordena el trabajo: el frente izquierdo y derecho sostienen la música y los efectos amplios, el centro sostiene lo que debe entenderse, los traseros dan envolvente y el LFE aporta energía grave sin colgar de él información necesaria. En la práctica, cualquier cosa que un espectador deba comprender —voz, instrucciones, alertas— vive centrada, porque en sistemas incompletos el centro suele ser lo primero que se pierde.

La entrega multicanal comparte las reglas de la entrega con stems y especificaciones de canal: mismo inicio, mismo largo y ninguna normalización entre canales, porque la suma debe reconstruir la mezcla tal cual salió del estudio.

Immersive audio: canales y objetos

El Immersive audio añade una idea nueva: el sonido deja de estar atado a un altavoz. Convive un lecho de canales fijos —la base multicanal— con objetos que viajan con metadatos de posición, ganancia y, a veces, tamaño, y que el sistema renderiza en el momento según la disposición real de altavoces o los auriculares del oyente.

El resultado es que la misma entrega sirve para una sala con muchos altavoces, para un sistema doméstico con altavoces virtuales y para unos cascos. El trabajo de mezcla cambia en consecuencia: se comprueba el renderizado en varios destinos, se cuida que el lecho mantenga la lectura en sistemas pequeños y se evita colocar información crítica solo en objetos que un sistema reducido no reproduzca.

También cambia la documentación: los ficheros inmersivos describen canales y objetos, y hay que indicar cómo se generó la versión de referencia y qué se espera en cada destino. El modelo de objetos de Dolby Atmos es el ejemplo más extendido y buena parte de la literatura técnica parte de él.

Un punto práctico: los objetos no sustituyen al lecho. Lo esencial —palabra, señal de interfaz, impacto principal— se apoya en canales fijos que existen en casi cualquier sistema, mientras que los objetos añaden movimiento y detalle en los sistemas que sí pueden reproducirlos. Mezclar asumiendo una sala con todos los altavoces activos y sin comprobar la versión reducida es el error más caro de esta etapa, porque se descubre en el destino y ya no hay tiempo de rehacerlo.

Comparativa
Formato Cómo representa el sonido Dónde encaja
Estéreo 2.0 Dos canales fijos con imagen entre altavocesVídeo online, música y emisión general
Surround 5.1 / 7.1 Canales fijos alrededor de la posición de escuchaTelevisión, cine doméstico y salas
Immersive audio Canales de lecho más objetos con metadatosCine premium, plataformas y salas con Atmos
Spatial audio binaural Renderizado para auriculares con posición simuladaMóvil, juegos, realidad virtual y podcast inmersivo
Sistemas multizona Zonas con fuentes, nivel y retardo propiosMuseos, tiendas, auditorios y atracciones

Tabla de cinco filas que compara estéreo, surround multicanal, immersive audio con objetos, spatial binaural y sistemas multizona de instalación.

Spatial audio: dónde se decide que suena

El Spatial audio se ocupa de la percepción de posición en el oyente, no del formato de entrega. En auriculares se basa en el renderizado binaural: la señal se filtra para simular la dirección y la distancia, y el resultado suena como si la fuente estuviera fuera de la cabeza aunque solo haya dos transductores.

Las APIs de referencia lo describen con precisión: hay un oyente con posición y orientación, fuentes con atenuación por distancia y reverberación de entorno, y una limitación importante —en el modelo clásico de la API de Apple, la espacialización se aplica a fuentes mono—. Eso explica por qué un estéreo plano no se coloca en el espacio sin tratarlo y por qué la escucha cambia cuando el sistema actualiza la posición del oyente.

El sistema de monitores, la calibración y la medición siguen siendo los cimientos: de nada sirve una escena inmersiva si los altavoces o los auriculares no están comparables entre sí. Para comprobar la respuesta de un sistema multicanal se recurre a medición y ajuste con calibración de PA y función de transferencia, que también vale para validar el renderizado en sala.

Audio para instalaciones: el espacio como sala de mezcla

El Audio para instalaciones se parece poco a una entrega de vídeo: aquí el sistema es permanente, el contenido se repite durante horas y cada zona —entrada, sala principal, pasillo, exterior— tiene su propia función. El proyecto empieza por la cobertura: cuántos altavoces, en qué posiciones y con qué dispersión para que el nivel sea uniforme y la inteligibilidad se sostenga, no por la potencia disponible.

Las herramientas de predicción de fabricantes permiten calcular cobertura, retardo y ecualización antes de instalar nada, y los procesadores de sistema alinean y gobernan varias zonas desde un único punto. A esa capa se suman la distribución de audio sobre red, con transportes como Dante o AES67 que reparten señales entre salas —ver la guía de audio sobre IP—, y la supervisión del sistema para detectar fallos sin entrar en la sala.

Las decisiones de contenido también cambian: bucles largos sin cortes evidentes, fuentes distintas por zona, automatización horaria y una salida de emergencia que siga funcionando. El objetivo no es el impacto sino la cobertura sostenida y el mantenimiento previsible.

Hay una capa más, la de la operación diaria: quién cambia el contenido, con qué interfaz, qué pasa si falla un reproductor o la conexión de red y cómo se comprueba que el sistema sigue sonando como el día de la puesta en marcha. Un proyecto que solo funciona con quien lo instaló no está terminado; la documentación de zonas, canales, niveles y rutas es parte del entregable, igual que los ficheros de audio.

Monitores, calibración y nivel

En sistemas multicanal e inmersivos, el nivel no se define por gusto sino por medición. Se fija un nivel de presión sonora por zona, se comprueba la coherencia entre altavoces solapados, se ajustan retardos para que la sumatoria sea constructiva y se verifica con un medidor que cumple el algoritmo multicanal de referencia, como el de la recomendación ITU-R BS.1770, cuando se trata de validar loudness.

Tres comprobaciones habituales: respuesta de frecuencia por posición de escucha, retardo entre altavoces contiguos y fase en los cruces. A eso se añade una revisión de escucha en los tres puntos posibles de un sistema inmersivo —delante, a los lados y detrás— para confirmar que la imagen no se rompe al salir del centro.

Qué formato pedir según el destino

Antes de producir conviene cerrar tres preguntas: dónde se va a escuchar, qué sistemas existen en el destino y qué versiones se necesitan. De ahí sale la decisión entre estéreo, multicanal e inmersivo, y de ahí sale también la lista de ficheros: máster completo, versiones reducidas y documentación de renderizado.

La comprobación final siempre es la misma: escuchar la entrega en el sistema más modesto del destino. Si allí se entiende la historia, el resto es añadido; si no, ningún objeto de sonido lo va a rescatar.

Siguiente paso

El audio inmersivo y el de sistemas fijos comparten con los videojuegos una misma idea: el sonido responde a un estado que cambia. El siguiente paso es audio para videojuegos con middleware Wwise/FMOD, audio interactivo y looping adaptativo.

Preguntas frecuentes

¿Qué diferencia hay entre surround e immersive audio?

El surround clásico es de canales: cada sonido se coloca en un altavoz concreto de una disposición fija, como 5.1 o 7.1. El immersive audio añade objetos de sonido con metadatos de posición, de modo que el sistema decide en tiempo de reproducción cómo renderizarlos según la disposición real de altavoces o los auriculares.

¿Necesito altavoces alrededor para escuchar audio inmersivo?

No siempre. Los formatos inmersivos se pueden reproducir en sistemas multicanal completos, en barras de sonido con reenvío de altavoces virtuales o en auriculares con renderizado binaural. Lo que no se puede es saltarse el renderizado: reproducir un fichero inmersivo como si fuera estéreo deja fuera la información de posición.

¿Qué es el spatial audio binaural?

Es la reproducción para auriculares que simula direcciones y distancias usando la respuesta al impulso de la cabeza y las orejas. Permite que un sonido parezca venir de delante, de detrás o de arriba sin más altavoces que los dos de los cascos, y suele combinarse con seguimiento de cabeza en juegos y realidad virtual.

¿Cuál es el error más común en una instalación de audio?

Proyectar por volumen en lugar de por cobertura: altavoces sobredimensionados en potencia que llenan de presión unas zonas y dejan otras sin inteligibilidad. El enfoque correcto es predecir cobertura y niveles por zona, ajustar retardos para que el sonido llegue coherente y comprobar en el lugar con un medidor.

¿El loudness sirve para calibrar una instalación?

No es el criterio principal. En instalaciones se trabaja con nivel de presión sonora por zona, inteligibilidad y coherencia entre altavoces; el loudness de entrega sigue importando para el contenido que se reproduce, pero la calibración del sistema se valida midiendo respuesta, retardo y SPL en cada zona.

Continúa aprendiendo

Siguiente lecciónAudio para videojuegos: Wwise, FMOD, audio interactivo y looping

Guía de audio para videojuegos: introducción al middleware con Wwise y FMOD, audio interactivo, looping adaptativo y sonido reactivo al gameplay.

Fuentes

  1. Dolby Atmos technology Documentación oficial Dolby Laboratories · consultado el 01/10/2026

    Explica el modelo de audio basado en objetos de Dolby Atmos: pistas de lecho fijas más objetos con metadatos de posición que el decodificador renderiza según el sistema de reproducción; base de la sección de immersive audio.

  2. Dolby Atmos installations Documentación oficial Dolby Laboratories · consultado el 01/10/2026

    Casos de instalaciones inmersivas en salas y espacios no cinematográficos, con requisitos de sistema y de renderizado; sirve para enlazar el audio inmersivo con el audio para instalaciones.

  3. ITU-R BS.1770 — Algorithms to measure audio programme loudness Estándar técnico ITU-R · consultado el 01/10/2026

    Algoritmo de medición de sonido multicanal con ponderación y gating, base de las mediciones de loudness en varias normas de emisión; referencia de la sección de monitores, calibración y nivel.

  4. AVAudioEnvironmentNode Documentación oficial Apple · consultado el 01/10/2026

    Clase que simula un entorno de audio 3D con oyente, atenuación por distancia y reverberación, y que solo espacializa fuentes mono; sustenta la sección de spatial audio y su renderizado.

  5. Meyer Sound HMS operating instructions Documentación oficial Meyer Sound · consultado el 01/10/2026

    Manual de altavoces de instalación: herramienta de predicción de cobertura y retardo, procesador para alinear y gobernar varias zonas y opciones de cableado y alimentación; base de la sección de audio para instalaciones.

Última revisión técnica: 01/10/2026. Si detectas un error, indícalo para corregirlo.