Эта серия из двух статей посвящена спорным вопросам, связанным с аудио высокого класса, и сложному устройству человеческого слуха. Рассмотренные понятия помогают обоснованнее судить о том, что может иметь значение для максимально точного воспроизведения музыки, а что — нет.
Область воспроизведения музыки, известная как high-end audio (HEA), использует любые доступные средства, чтобы добиться звучания, максимально близкого к живому исполнению. Применяемые методы и материалы — например, атомные часы, алмазные диафрагмы и так далее — могут казаться чрезмерными и излишними. Разработка устройств предполагает небольшие последовательные изменения, оценка которых отчасти опирается на прослушивания, при которых участники знают, какое оборудование звучит, то есть на неслепые тесты.
Мельчайшие, порой весьма специфические искажения, которые стремится свести к минимуму HEA, выходят за рамки стандартных технических характеристик. Слышимость заявленных улучшений ставят под сомнение, поскольку зачастую она не подтверждена контролируемыми слепыми тестами. По совокупности этих причин вокруг HEA существует немало споров и скептицизма. Однако часть этого скептицизма основана на ошибочных представлениях о связи между временной и частотной областями и на недостаточном понимании работы слуха.
Рассмотренные здесь понятия помогают обоснованнее оценивать, что может иметь значение для воспроизведения музыки с наивысшей точностью. Кроме того, мы объясним, почему традиционные быстрые слепые сравнения A–B могут не срабатывать. За подробностями читатель может обратиться к недавно опубликованной обстоятельной обзорной статье [1], другим цитируемым работам и статьям на сайте автора.
Связь между частотой, фазой и временем
Значительная часть аудиосообщества неоправданно привержена формализму Фурье и чрезмерно полагается на описание звука через частотный спектр. Например, компонент, который не изменяет тембр [2], часто называют «нейтральным», подразумевая ровную амплитудно-частотную характеристику. Более подходящими определениями были бы «точный» или «естественный», поскольку компоненты HEA, за исключением акустических систем, обычно и так имеют достаточно ровную АЧХ. Искажения [3], влияющие на тембр, преимущественно связаны с временной областью — например, с точностью воспроизведения атаки и затухания звуков, — а не с частотным спектром. Прости, Фурье!
На рисунке 1 показаны спектрограммы трёх инструментов. По вертикали отложена частота, по горизонтали — время, а яркость и цвет соответствуют интенсивности. Обычно внимание сосредоточено на распределении энергии по спектру: у губной гармоники самый богатый спектр, плотно заполненный гармониками и другими обертонами; у фортепиано — наиболее чистый тон, в котором к концу затухания остаётся лишь основная частота; скрипка занимает промежуточное положение.
Есть и отчётливые различия во временной области: отдельные частотные составляющие по-разному нарастают и затухают. У скрипки основной тон начинается немного позже некоторых обертонов. У губной гармоники начало обертонов всё сильнее запаздывает с повышением их частоты. У фортепиано все обертоны возникают резко и одновременно. Кроме того, в начале фортепианного звука между обертонами виден шум — размытые участки, характерные для резкого импульса [4].
Рисунок 1: Спектрограммы одной и той же ноты — ми пятой октавы по международной нотации, E5, — сыгранной на указанных инструментах. На вставках показаны соответствующие формы сигналов: графики напряжения в зависимости от времени.
Вопреки распространённому мнению, сильнее всего на тембр влияют различия во временной области, а не различия спектров. Это показано в демонстрационном видео на YouTube [5], представленном на рисунке 2. При воспроизведении нот задом наперёд тембр резко меняется, хотя усреднённый спектр, рассчитанный по всему сигналу, остаётся в точности тем же [6]. Это показывает, насколько важны огибающая и временная структура для тембральной окраски звука.
Рисунок 2. Демонстрация [5] изменения тембра при обращении времени. При обратном воспроизведении фортепиано по тембру несколько напоминает губную гармонику, несмотря на неизменность спектра.
Огромное значение тонкой временной информации, связанной с атакой и затуханием, наглядно продемонстрировал классический эксперимент К. У. Бергера [7], результаты которого приведены в таблице 1. Звуки различных духовых инструментов записали, а затем воспроизвели, слегка обрезав начала и окончания нот. Хотя усреднённый спектр практически не изменился, удаление начальных и конечных участков сделало инструменты неузнаваемыми даже для профессиональных музыкантов, хорошо знакомых с их звучанием. Например, шестеро приняли флейту за альт-саксофон, пятеро — за трубу и так далее.
Эти наблюдения подчёркивают важность временных характеристик аудиооборудования. Действительно, во многих конструкциях акустических систем стараются расположить акустические центры динамиков на одинаковом расстоянии от слушателя, чтобы правильно воспроизводить временные соотношения между частотными составляющими.
Таблица 1. Эксперимент Бергера с «матрицей ошибок распознавания». Удаление переходных процессов в начале и конце звука и небольшие изменения огибающей сильно затрудняли распознавание тембра. Следовательно, спектральных формант недостаточно для определения инструмента.
Временную задержку иногда путают с фазовым сдвигом. Это разные вещи, и в общем случае между ними вовсе не обязательно существует связь — за исключением отдельных, строго определённых ситуаций. Если два человека проходят через дверь, задержку между их появлениями можно измерить секундомером. Говорить о разности фаз для подобных непериодических событий бессмысленно [8].
Спектрограммы на рисунке 1 показывают относительные задержки начала частотных составляющих, а не просто фазовые сдвиги. Различие между фазой и задержкой показано в демонстрационном видео [9], представленном на рисунке 3. Стандартная смесь «A», в которой совпадают фазы и моменты начала составляющих, попеременно звучит со смесью «B», где фазы различаются на 90 градусов. На хорошей аудиосистеме разница едва слышна. Затем «A» чередуется со смесью «C», где начало второй гармоники задержано во времени, а не просто сдвинуто по фазе. В этом случае различие в характере звучания слышно отчётливее.
Рисунок 3. Демонстрационное видео [9] показывает, что тембр изменяется при временной задержке между гармониками — вариант (б), — но не при относительном фазовом сдвиге — вариант (а).
Таким образом, задержка между моментами начала составляющих существеннее, чем несовпадение фаз. Как уже упоминалось, во многих акустических системах HEA этому уделяют особое внимание. Независимость тембра от фазы настолько широко известна, что для неё существует отдельный научный закон — акустический закон Ома [10, 11, 12].
Временное размытие и разрешение в аудио
Физические системы с более быстрым откликом обычно лучше способны воспроизводить более высокие частоты и реагировать на них. Это справедливо, например, при сравнении высокочастотного и низкочастотного динамиков: более высокая резонансная частота сопровождается более быстрым возвращением к равновесию. Другой пример — RC-фильтр нижних частот: более высокая частота среза
f₍C₎ = 1/(2πRC)
означает меньшую постоянную времени затухания:
τ = RC = 1/(2πf₍C₎).
Однако между характерной частотой и характерным временем процесса не всегда существует простая обратно пропорциональная связь. Например, фильтры восстановления [13] при цифровом воспроизведении, имеющие наиболее короткий временной отклик, могут обладать менее протяжённой частотной характеристикой. Повседневные события нашей жизни — например, завтрак — «синхронизированы по фазе» с 24-часовым циклом. Но какое отношение продолжительность завтрака имеет к этой суточной периодичности? Никакого!
Точно так же человеку не обязательно лучше слышать высокие частоты, чтобы различать мельчайшие временные ошибки. Точность бинаурального различения временных сдвигов составляет 10 мкс при 700 Гц — это одна сотая периода T = 1,43 мс. При более высокой частоте, 1400 Гц, точность оказывается в десять раз хуже: более 100 мкс! Интересные нейрофизиологические особенности слуха, объясняющие отсутствие прямой связи между частотой, фазой и временем, а также основу закона Ома, рассматриваются во второй части этой серии.
Термин «временное разрешение» употребляют непоследовательно, обозначая им разные вещи. Для определённости мы будем использовать термин «временное размытие», обозначаемый τ, — размывание деталей переходных процессов, аналогичное оптическому размытию в телескопах. На рисунке 4а показано изображение звезды в телескопе: из-за дифракции вместо одной чёткой точки возникает картина Эйри. Две близкие звезды сливаются в одну, если угловое расстояние между ними меньше
θ₍C₎ = 1,22λ/d радиан,
где d — диаметр апертуры, а λ — длина волны. Это условие называют критерием Рэлея. Оно показано на профилях рисунка 4б.
Рисунок 4. (а) Изображение звезды представляет собой размытую дифракционную картину Эйри. (б) Дифракционные профили двух близких звёзд перекрываются, и звёзды невозможно различить, когда угловое расстояние между ними θ < θ₍C₎ = 1,22λ/d. Рисунок адаптирован из источника [1].
Аналогичным образом каждый компонент аудиотракта размывает сигнал во времени, увеличивая общее τ системы. Два импульса, разделённые промежутком меньше τ, будут сливаться. Можно ожидать, что это повлияет на качество звучания, если τ превышает способность нашего слуха различать кратковременные события — временное разрешение переходных процессов, TR. Классические эксперименты Б. Лешовица [14] дали значение TR ≈ 4–10 мкс [15]. По аналогии с размытием изображений звёзд на рисунке 4, в этом психоакустическом исследовании измеряли способность слушателя различать одиночные и двойные импульсы одинаковой энергии, как показано на рисунке 5а.
Это объясняет, почему цифровое аудио с частотой дискретизации 44,1 кГц — стандарт Red Book, или уровень CD — недостаточно быстрое. На рисунке 5б показан сигнал напряжения на выходе ЦАП [16], когда входной WAV-файл содержит импульс длительностью в один отсчёт. Величина τ имеет порядок периода дискретизации и значительно превышает временное разрешение слуха. Чтобы уменьшить τ настолько, чтобы оно перестало быть ограничивающим фактором, потребуются существенно более высокие частоты дискретизации. Однако в большинстве аудиосистем слабые звенья найдутся и в других местах тракта. Если частота дискретизации не является главным ограничением системы, её повышение сверх 44,1 кГц может не дать слышимой разницы.
Рисунок 5. Эксперименты Лешовица [14] показали, что слушатели могли отличить одиночный импульс — (а) — от двойного — (б), — если промежуток между импульсами составлял TR ≈ 4–10 мкс. (в) Временное размытие цифрового аудио качества CD — 16 бит/44,1 кГц, — оцениваемое по полной ширине на половине максимума, FWHM, значительно превышает это TR. Рисунок адаптирован из источника [1].
Различение временного сдвига в цифровом аудио
В цифровом аудио существует величина
τ* ≈ 1/(2ᴺf₍S₎),
соответствующая порогу различения временного сдвига, то есть наименьшему сдвигу сигнала во времени, который можно обнаружить как изменение цифрового значения. Её смысл показан на рисунке 6. Для качества CD величина τ* составляет менее одной наносекунды [17]. Это очень малое значение иногда ошибочно называют «временным разрешением». Оно не имеет отношения к точности звучания. На рисунке 5в видно, какой искажённый отклик получается вместо задуманного бесконечно узкого импульса: он в сто тысяч раз шире субнаносекундного τ*, а слабые остаточные колебания продолжаются ещё дольше.
Рисунок 6. Различение временного сдвига в цифровом аудио. Задержку, или сдвиг во времени, треугольного сигнала на величину меньше периода дискретизации можно обнаружить как изменение цифровых значений отсчётов. Порог обнаружения τ* ≈ 1/(2ᴺf₍S₎) значительно меньше периода дискретизации 1/f₍S₎, но не характеризует минимальную длительность детали сигнала, которую можно разрешить. Это не «временное разрешение».
Разрешение низкоуровневых деталей
Временное размытие τ соответствует интервалу, за который сигнал падает от своего пикового значения до некоторой существенной доли от него — например, ½, 10%, 1/e и так далее. Два импульса, расположенные внутри этого интервала τ, невозможно различить. Но на рисунке 5б видно, что остаток исходного пика сохраняется гораздо дольше — порядка миллисекунды — и накладывается на последующую звуковую информацию.
Это не проявится как замедление атаки, но будет маскировать тихие детали. Можно ожидать, что влияние на звук окажется хуже, чем у случайного шума, поскольку этот остаток связан с самим сигналом. Восприятие глубины звуковой сцены использует слуховой механизм [1], сравнивающий интенсивность прямого и реверберационного звука; после времени реверберации последняя номинально на 60 дБ ниже. Маскирование этой информации уменьшает глубину и ощущение живого звучания. Такое длительное размытие можно оценивать по времени полного затухания τ₍C₎, за которое остаточный отклик исчезает полностью.
На рисунке 7 показаны основное, τ, и длительное, τ₍C₎, временное размытие в двух межблочных кабелях. Эти параметры в некоторой степени независимы друг от друга и могут даже изменяться в противоположных направлениях. Другой пример — акустическая система с хорошо согласованными по времени быстрыми динамиками, но недостаточно жёстким и плохо демпфированным корпусом. У неё будет короткое τ, но длительное τ₍C₎ из-за долго сохраняющихся вибраций корпуса.
Рисунок 7. (а) Основное временное размытие, порядка сотен наносекунд, сильнее выражено у аудиофильского межблочного кабеля S, чем у обычного кабеля G. Однако у первого остаточный отклик полностью обрывается примерно за микросекунду, тогда как у кабеля G он сохраняется несколько микросекунд. (б) τ₆₀ — время, за которое уровень сигнала снижается на 60 дБ. Данные и рисунок адаптированы из источников [1, 18].
В стандартных технических характеристиках аудиооборудования сегодня не указывают τ и τ₍C₎. Возможно, их стоит включить в будущий, более полный набор характеристик. Величину τ₍C₎ следует определять по моменту, когда остаточный импульсный отклик становится настолько малым, что его уже невозможно измерить. Как мы увидим в следующей части этой серии, разрешающая способность уха превосходит даже астрономические масштабы: число возможных вариантов нейронного возбуждения улитки содержит на 17 нулей больше, чем число всех звёзд во Вселенной!
Оригинал — Hearing and Audio: Part 1 - Frequency, Phase, and Time | audioXpress
Источники и примечания
[1] М. Н. Кунчур. «Человеческая слуховая система и аудио». Applied Acoustics, том 211, статья 109507, 2023.
Опубликованная статья. Бесплатный препринт.
[2] Тембр, или звуковая окраска, — качество, позволяющее различать звуки одинаковой высоты, громкости и длительности.
[3] Если не указано иное, термин «искажение» используется в широком смысле и означает любое изменение формы сигнала.
[4] Дельта-функция Дирака содержит в своём спектре все частоты.
[5] М. Кунчур. «Тембр фортепианных нот при обычном и обратном воспроизведении», YouTube.
[6] Хотя изменяющийся во времени спектр, рассчитанный с коротким окном, может отчасти показывать происходящее, это довольно косвенный и сложный способ представить то, что уместнее отображать с помощью формы сигнала и спектрограммы.
[7] К. У. Бергер. «Некоторые факторы распознавания тембра». Journal of the Acoustical Society of America, том 36, с. 1888, 1963.
[8] Люди часто гордятся знанием формализма Фурье, но иногда это превращается в дурную привычку. Любой сигнал всегда можно преобразовать из временной области в частотную. Однако иногда такое преобразование не проясняет смысл, а скрывает существенную информацию.
[9] М. Кунчур. «Акустический закон Ома и влияние фазового сдвига и временной задержки на тембр», YouTube.
[10] Г. С. Ом. «Об определении тона и связанной с ним теории сирены и подобных устройств, создающих звук». Annalen der Physik und Chemie, том 59, с. 513–565, 1843.
[11] Г. Л. Ф. фон Гельмгольц. «Учение о слуховых ощущениях». Английский перевод четвёртого издания, выполненный А. Дж. Эллисом. Longmans, Green and Co., Лондон, 1912.
[12] Дополнительное обсуждение закона Ома приведено в разделе 3.8 статьи [1].
[13] Иногда его также называют сглаживающим фильтром, антиалиасинговым фильтром или фильтром подавления спектральных копий.
[14] Б. Лешовиц. «Измерение порога различения двух щелчков». Journal of the Acoustical Society of America, том 49, с. 462–466, 1971.
[15] В этих экспериментах использовалось оборудование, собственное быстродействие которого могло ограничивать точность измерений. Чтобы определить предельное TR, эксперименты необходимо повторить на современном оборудовании HEA. Нейрофизиологическое моделирование, описанное во второй части этой серии — «Разрешающая способность слуха», — предполагает, что возможно TR ≈ 1 мкс.
[16] Muse Audio USB Mini DAC. Другие испытанные ЦАП и CD-проигрыватели отличались в деталях, но имели сопоставимую полную ширину импульсного отклика на половине максимума — FWHM.
[17] При N = 16, где N — разрядность, то есть разрешение по вертикальной оси, и f₍S₎ = 44,1 кГц, где f₍S₎ — частота дискретизации, получаем:
τ* ≈ 1/(2¹⁶ × 44 100) = 0,35 нс.
[18] М. Н. Кунчур. «Кабельные соединения между аудиокомпонентами могут влиять на воспринимаемое качество звука». Journal of the Audio Engineering Society, том 69, № 6, с. 398–409, 2021.














