Saltar al contenido principal
Fundamentos del Sonido, Audio Digital y Calidad de Archivos · Intermedio · 8 min de lectura

Audio digital: Nyquist, dither, noise shaping, buffer, clock, Mid/Side y correlación.

Teorema de Nyquist para músicos, dither y noise shaping al reducir bit depth, buffer size y latencia, clock y jitter, codificación Mid/Side y correlación de fase.

Convertir el sonido a números es una decisión de resolución en dos ejes: cuántas veces por segundo se mide y cuántos valores puede tomar cada medida. Ya sabes qué son sample rate y bit depth. Lo que viene aquí es el resto de la cadena digital: qué ocurre justo al reducir resolución, qué retraso mete el ordenador entre tus manos y los altavoces, y cómo se miden las decisiones de fase en estéreo.

Concretamente: teorema de Nyquist explicado para músicos, dither, noise shaping, buffer size, clock digital y jitter, Mid/Side y correlación de fase. El punto de partida es la guía de sample rate y bit depth.

Teorema de Nyquist explicado para músicos

El teorema dice que para representar una señal, hay que tomar muestras a una frecuencia superior al doble de la frecuencia más alta que contenga. En la práctica: con 44.100 muestras por segundo, la techo teórica es la mitad, 22.050 Hz, por encima de lo que oye la mayoría de adultos.

El efecto práctico no es tanto el techo como la trampa de alrededor. Cualquier frecuencia por encima de la mitad del sample rate no se muestrea bien: se pliega hacia abajo y aparece como una frecuencia fantasma que no existía en la señal original. Ese fenómeno es el aliasing, y es el motivo de que existan los filtros anti-aliasing antes de convertir y los de reconstrucción después.

Para música con auditivo normal, 44.1 kHz cumple sin discusión. Trabajar a 48, 88.2 o 96 kHz tiene otras razones: filtros de conversión más suaves, procesos en tiempo real que generan armónicos por encima del techo, o compatibilidad con vídeo. Lo que no hace falta es subir sample rate para «tener más detalle en los agudos»; el detalle del agudo depende de que las muestras estén bien tomadas, no de que haya más por segundo. Las demos de Xiph de muestreo y cuantización son la mejor forma de verlo.

Dither

Al reducir la profundidad de bits, cada muestra tiene que redondearse a uno de los pocos valores disponibles. Si simplemente redondeas, el error no es aleatorio: depende de la señal y se convierte en distorsión armónica de orden alto que suena áspera justo donde las cosas iban suaves. El dither mete una cantidad pequeña y controlada de ruido antes de redondear, para que el error dependa del ruido y no de la señal: el resultado es ruido blanco en vez de distorsión tonal, y es preferible a oír el redondeo.

Cuándo toca: siempre que bajes de bits, típicamente de 24 o 32 bits a 16 bits al exportar. Si el destino conserva la misma resolución, no hagas nada. La mayoría de aplicaciones ofrecen varios tipos; Audacity, por ejemplo, lista Rectangular, Triangular y Shaped, y describe Shaped como la opción que aplica noise shaping. Las cuatro opciones se comparan en la tabla que sigue a este capítulo.

Noise shaping

El noise shaping es el paso siguiente al dither: en vez de repartir el ruido añadido por igual por todo el espectro, lo esculpe hacia las bandas donde el oído es menos sensible, que son las agudas. El nivel de ruido total puede ser igual o mayor, pero se percibe menor porque queda fuera de la zona de máxima audibilidad.

Sale gratis con el dither de tipo shaped de la mayoría de programas, y su uso racional es el mismo que el del dither: reducciones de bits finales, no una perilla que subir por sistema. En masters muy limpios, con poca energía en el extremo agudo, su efecto se nota más; en material comprimido con agudos saturados, la diferencia con un dither simple es menor.

Si tu cadena digitaliza a 24 bits y exportas a 24 bits, ninguno de los dos procesos interviene. Dither y noise shaping son herramientas de reducción, no de mejora.

Opciones de dither al exportar
Método Qué hace Cuándo usarlo
Sin dither Redondea el valor de cada muestra y añade distorsión armónica relacionada con la señal.Si no reduces bits, o si el material es ruidoso de por sí y no quieres ruido extra.
Dither rectangular Añade un ruido pequeño y uniforme antes de redondear.Cuando quieres el cambio mínimo con el coste de ruido más bajo.
Dither triangular Usa una distribución que evita la correlación entre ruido y señal.La opción habitual para material con matices suaves y niveles bajos.
Dither con noise shaping Además mueve el ruido hacia las frecuencias altas, donde oyes menos.Cuando buscas la máxima percepción de detalle en 16 bits.

Según la documentación de dither de Audacity, que incluye los tipos Rectangular, Triangular y Shaped con noise shaping.

Buffer size

El buffer size es el número de muestras que el ordenador procesa de una tacada. Cuanto más pequeño, más veces tiene que despertar a la CPU por segundo: menos retraso, más carga y más riesgo de que la audio falle con chasquidos. Cuanto más grande, la cadena trabaja cómoda pero con más latencia.

El retraso total de ida y vuelta —entrada, procesado y salida— es lo que notas cuando tocas y escuchas con retardos. En la práctica se busca aterrizar en torno a 10-20 milisegundos para trabajar en tiempo real, que a 44.1 kHz equivalen a unas pocas centenas de muestras de margen. Por encima de ese rango el toque y el sonido se separan y tocar con monitorización deja de ser cómodo.

Regla de decisión: sube el buffer cuando mezcles o renderices con muchas pistas y procesos; bájalo cuando toques en directo o grables con monitorización. El buffer no es un parámetro de calidad sonora: si hay chasquidos con buffer grande, el problema está en la carga o en los controladores, no en el tamaño.

Clock digital y jitter

Todo el mundo digital necesita un pulso que diga «ahora». Ese pulso es el reloj o clock, y delante de un conversor decide el instante exacto en que se toma cada muestra. El jitter es la desviación de ese instante: muestras bien medidas pero colocadas en el tiempo un poco mal.

Esa deriva temporal se traduce en pérdida de nitidez, imagen estéreo menos definida y, cuando es grande, artefactos. Los fabricantes lo saben y publican soluciones: RME describe su SteadyClock como un sistema de estabilización que reduce el jitter tanto en las salidas propias como en la entrada de audio digital, porque la calidad de reloj condiciona la conversión.

Cuando tiene importancia en tu cadena: interfaces de entrada/salida, cadenas con varios equipos sincronizados por S/PDIF o AES, y setups de DJ con varias fuentes conectadas digitalmente. Y un detalle que se olvida: el jitter de un reloj barato no se arregla con más resolución; se arregla con mejor reloj.

Mid/Side

Mid/Side no es una captación exótica: es una reescritura matemática de lo que ya tienes. Mid es lo que comparten ambos canales, la suma; Side es lo que los diferencia, la resta. De ahí se vuelve con dos operaciones inversas: izquierda es Mid más Side, derecha es Mid menos Side.

Su utilidad está en el control. Al separar lo común de lo diferente puedes estrechar o ensanchar el estéreo sin tocar el centro, ecualizar el centro sin mover los lados o procesar los lados con más agresividad porque no llevan el golpe del bombo. También explica por qué algunos sonidos se pierden al pasar a mono: si estaban casi enteros en Side, la suma a mono los cancela.

Se puede codificar y decodificar a mano con un par de operaciones, y la mayoría de plug-ins de width y los micrófonos tipo par funcionan sobre esta misma base.

Correlación de fase

La correlación de fase mide cuánto se parecen los dos canales. El correlador típico recorre de +1 a −1: en +1 los canales son idénticos y el material es mono; en valores intermedios hay diferencias parciales y existe información estéreo; cerca de 0 hay poca relación; y en negativo hay componentes invertidas en polaridad.

Lo que es distinto —y conviene no mezclarlo— es polaridad, desfase y correlación. Invertir la polaridad es cambiar el signo de la señal; el desfase es un desplazamiento temporal que depende de la frecuencia; la correlación es el resultado que ves medido. Un correlador negativo sostenido es la señal de que algo se está cancelando al sumar a mono: un canal invertido, un micrófono mal cableado o un proceso de width mal aplicado.

Para qué mirarlo en cabina: antes de salir a un sistema en mono o de saber que tu tema sobrevivirá en un PA con canal único, comprueba que el correlador no viva en negativo. Es el test más barato que existe para saber si un estéreo es robusto o solo suena bien con los dos canales activos.

Errores frecuentes en la cadena digital

Subir sample rate por costumbre. No añade detalle audible por sí mismo y multiplica el tamaño de archivo. Sube solo con razón: compatibilidad, procesado en vivo que genera armónicos o requisito de entrega.

Exportar de 24 a 16 bits sin dither. Es el momento exacto en que el redondeo se hace audible como distorsión áspera en los matices bajos.

Bajar el buffer para «mejorar el sonido». Solo baja la latencia; si hay fallos con buffer grande, la carga no acompaña.

Culpar al software del jitter. El jitter es un problema de reloj y de conversión, no de plugin.

Dar por bueno un estéreo sin mirar la correlación. Un estéreo que se deshace en mono es un estéreo a medias. El siguiente capítulo toca justo este terreno: qué es DC offset y cómo elegir formatos al convertir.

Siguiente paso

Ya sabes cómo se muestrea, se cuantiza, se reloja y se mide la fase. Falta el último eslabón: los formatos de archivo, el bitrate, cómo detectar transcodificaciones y qué es ese desplazamiento llamado DC offset. Sigue con Formatos y bitrate: MP3, AAC, OGG, Opus, CBR, VBR y DC offset.

Preguntas frecuentes

¿Cuándo hay que aplicar dither?

Al reducir la profundidad de bits de una señal, por ejemplo al exportar de 32 bits o 24 bits a 16 bits para CD. Si no reduces bits, no hace falta. Elegir dither es preferible a dejar que la cuantización añada distorsión armónica de orden alto en señales suaves.

¿Qué gano con noise shaping si ya pongo dither?

Que el ruido del dither se reorganiza fuera de las bandas donde el oído es más sensible. El nivel total de ruido puede ser igual o mayor, pero se percibe menor, con el coste de que el ruido queda más concentrado en las frecuencias altas.

¿Cuánto buffer debo usar?

El mayor que tolere tu latencia. En producción con monitores o en directo buscas 10-20 milisegundos de ida y vuelta; para mezclar con pistas ya renderizadas puedes subir el buffer y ganar estabilidad. El buffer pequeño no mejora el sonido: solo reduce el retraso, a costa de más carga.

¿Puede el reloj cambiar cómo suena una grabación digital?

El reloj decide cuándo se toma cada muestra. Si su momento varía —jitter—, las muestras se colocan en el tiempo equivocado y la degradación aparece como pérdida de detalle, imagen estéreo deteriorada y en casos extremos artefactos. Por eso los conversores de gama alta invierten en estabilidad de reloj.

¿Qué me dice el correlador de fase?

Cuánto se parecen las señales de los dos canales. Un valor de +1 indica señal idéntica en ambos lados, es decir mono; valores intermedios indican diferencias parciales; y un valor negativo indica que hay componentes invertidas en polaridad, que pueden desaparecer al sumar a mono.

Continúa aprendiendo

Siguiente lecciónFormatos y bitrate: MP3, AAC, OGG, Opus, CBR, VBR y DC offset

MP3, AAC, OGG y Opus explicados: qué es CBR y VBR, cómo afecta el bitrate, cómo detectar transcodificaciones, qué es DC offset y cómo convertir sin degradar de más.

Fuentes

  1. Digital Show and Tell (vid2) Medio técnico Xiph.Org Foundation · consultado el 01/10/2026

    Vídeo de Xiph que demuestra de forma visual el muestreo, la cuantización, la profundidad de bits y el dither: enseña cómo se ve una señal continua tras discretizarla y por qué añadir una cantidad controlada de ruido antes de redondear mejora la representación de los matices bajos.

  2. Dither Documentación oficial Audacity Team · consultado el 01/10/2026

    Manual de Audacity sobre dither: qué es, cuándo se aplica al cambiar de profundidad de bits y qué tipos ofrece el programa, concretamente Rectangular, Triangular y Shaped, describiendo Shaped como la opción que emplea noise shaping para colocar el ruido fuera de las bandas más sensibles.

  3. Audio Settings — buffer size / latency Documentación oficial Image-Line · consultado el 01/10/2026

    Página de ajustes de audio de FL Studio que explica la relación entre buffer, CPU y latencia: buffers más pequeños reducen la latencia pero aumentan la carga y el riesgo de fallos de audio, y con ellos se busca un retraso total de ida y vuelta en el entorno de 10 a 20 milisegundos para poder trabajar en tiempo real.

  4. SteadyClock FS Medio técnico RME Audio · consultado el 01/10/2026

    Página del sistema de reloj SteadyClock FS de RME: describe la estabilidad del reloj como factor directo de la calidad de conversión, explica que el jitter es la desviación temporal del reloj y presenta su circuito de reducción de jitter como mejora aplicable a entradas digitales y salidas de reloj.

  5. Mid/Side Stereo Explained, Part 1 Medio técnico JustMastering.com · consultado el 01/10/2026

    Artículo que distingue polaridad, desfase y correlación como conceptos separados, presenta las ecuaciones de Mid y Side a partir de izquierda y derecha, y explica la lectura del correlador de fase: +1 para señal idéntica y mono, 0 para componentes sin relación y valores negativos cuando hay inversión de polaridad.

Última revisión técnica: 01/10/2026. Si detectas un error, indícalo para corregirlo.