Принципы имитации объемного звучания, часть 1

Илья Волков, https://gamedev.ru/sound/forum/?id=195231

Данная статья основана на моей дипломной работе по теме «Разработка принципов имитации объемного звучания в развлекательной сфере», кафедра информационных технологий, МАИ 2011 год. Для адаптации текста вырезаны сухие статистические данные, язык сделан более живым, вставлены отсылки к книгам и статьям, которые я могу порекомендовать. Затронутые вопросы будут интересны тем, кто еще только изучает механизмы локализации звука. Программная часть в статье не затрагивается. Для дополнительного интереса из статьи не вырезана практическая часть создания бинаурального манекена-микрофона.

Хочу выразить благодарности Борису Климову за создание эксклюзивных иллюстраций, а так же Надежде Гурской за анализ и правки текста.

Введение

Основная цель виртуальной реальности «погрузить» человека в пространство игры, действия на экране (фильм, мультфильм, 5D кинотеатр) настолько, чтобы на время он забыл о реальности мира окружающего.

О понятиях «Immersion», а так же «Suspension of Disbelief» по отношению к звуку и музыке можно прочитать в книге Winifred Phillips – A Composer’s Guide to Game Music.

Объемное звучание – залог того, что человек сможет ощутить эффект «присутствия». Восприятие звукового пространства, очевидно, было востребовано еще задолго до появления средств записи звука: на протяжении веков создавались помещения, такие как храмы, театры, концертные залы, где обеспечивалось «погружение» слушателя в звуковое пространство путем создания естественного акустического эффекта — реверберации. Научные исследования поведения акустики в концертных залах фирмой «Bose» показали, что приблизительно 11% доходит до слушателя напрямую, остальной процент звука приходит в отраженном виде от стен, пола и потолка и других объектов вокруг слушателя, тем самым создавая объем звука. С информативной точки зрения 25% информации об окружающем мире, получаемой человеком, приходится на звук.

Подход к звуку в современных кинотеатрах приучает слушателя к тому, что звук может и должен быть качественным и реалистичным. Профессиональными разработчиками современных игровых приложений работе со звуком отводится до 40 процентов бюджета и временно-людских ресурсов. С другой стороны некоторых разработчиков игр и приложений ещё надо убедить потратить время и средства на реализацию качественного звука.

На тему различных подходов интересно почитать статьи «Озвучивание компьютерных игр» 1 и 2 части от Кристофера (свободно ищется в интернете).

Восприятие звука человеком

Человеческий слух способен воспринимать звук в диапазоне от 16—20 Гц до 15—20 кГц. Звуки с частотой ниже 20—30 Гц (инфразвук) воспринимается не органом слуха, а осязанием, например, через вибрацию поверхностей. Частоты предельных нижних значений слышимого спектра могут восприниматься через резонансы внутренних органов человека. При небольшой интенсивности звук низкой частоты оказывает дополнительное эмоциональное воздействие (например, популярный эффект sub drop).

Уменьшение диапазона слышимых частот связано с изменениями во внутреннем ухе и с развитием возрастной нейросенсорной тугоухости. К 60-и годам слышимый диапазон на верхней границе становится не выше 10—12 кГц. Так как основной контингент развлекательной сферы люди молодые, то воспринимаемый слухом диапазон должен учитываться в полной мере. Но и специалист по звуку должен обладать полноценным слухом, слышать неестественность и неполноту тембра, мочь выявить резонансы. И что не маловажно — беречь слух от перегрузок. Многие люди в музыкальной-звуковой сфере испытывают постоянные нагрузки от звукоусиливающей техники и громких акустических инструментов (как и я сам, за более чем 12 лет игры на ударных инструментах). Современный человек подвержен негативному воздействию окружающих шумов, что снижает его чувствительность, притупляет верхние границы частот раньше естественной тугоухости. Не нужно пренебрегать такими средствами защиты слуха, как беруши. Также негативное влияние могут оказывать звуки низких частот.

Подробно с негативным воздействием звука (в том числе технического) можно ознакомиться в книге Чедд Г. – Звук.

Восприятие звука индивидуально, оно зависит от конфигурации (формы) ушной раковины, физиологических особенностей, возраста и от психологического настроя в конкретный момент. В рассматриваемой сфере восприятия звука также зависит от:

— средств воспроизведения (динамики воспроизводящего устройства, наушники, колонки, многоканальные системы),

— помещения в котором осуществляется прослушивание,

— качества средств преобразования (например, реализация звукового процессора, движка),

— соблюдения принципов создания правильной звуковой картины, если речь идет о саунд-дизайне.

Механизмы локализации источника звука человеческим слухом

Способность человека локализовать источник звука в пространстве строится на принципе бинаурального слуха. Бинауральное (от лат. bini — «два» и auricula — «ухо») строение слуховой системы заключается в различном восприятии звуковых сигналов пришедших на правое и левое ухо. Алгоритм локализации источника звука:

— звуковой сигнал, исходящий от источника звука и переотражений помещения, попадает во внешнюю часть слуховой системы, где конфигурация ушной раковины позволяет передать во внешний слуховой канал уже частотно обработанный сигнал,

— сигнал проходит в барабанную перепонку человека, в силу вступают механизмы внутреннего уха,

— из внутреннего уха информация поступает в отделы головного мозга, где на основе анализа сравнения сигналов, поступивших с каждого из слуховых каналов, делаются выводы о расположении звукового источника.

Человеческий мозг сравнивает информацию, пришедшую из барабанных перепонок, с той информацией, которая уже хранится в памяти.

Слуховая система человека | Принципы имитации объемного звучания

Рис. 1. Строение внешней части слуховой системы человека

Подробно об устройстве внешнего и внутреннего слуха и о многих другом можно прочитать в книге Ирины Алдошиной и Роя Приттса – Музыкальная Акустика, глава «Восприятие звука. Основы психоакустики»

Для определения месторасположения звукового источника в пространстве слуховая система использует основные механизмы локализации: по разнице во времени, по разнице интенсивности, по разнице амплитудно-частотного спектра. К вспомогательным механизмам относятся отражения звука от туловища и плеч человека, реверберация, окклюзии (звук, прошедший через препятствие), обструкции (звук отфильтрованный препятствием), эффект Доплера, эффект Хааса (эффект предшествования). Не стоит забывать про эффект психологического восприятия: при несоответствии источника в видимом пространстве со звуком или нарушении синхронности качество локализации резко падает.

Определять пространственное положение источника звука приходится при наличии звуковых помех. Существуют естественные механизмы помехоустойчивости слуховой системы. Один из них проявляется в бинауральном освобождении от маскировки. Феномен состоит в том, что локализовать звуковой сигнал на фоне статичных помех (например, шумов окружения) легче.

Пару слов о прозрачности звучания. Приведу известный пример. Представим несколько контурных рисунков животных, наложенных друг на друга. Опознавание совмещенных в пространстве рисунков тем сложнее, чем ближе формы изображенных животных (термин форма имеет тот же смысл, что и в звуковом сигнале). Если же эти рисунки разнести в пространстве, то задача определения животного по форме становится значительно проще.

Локализация по временной разнице (фазовая локализация)

Данный механизм работает на частотах от 300 Гц до 1,5 кГц. За счет разницы между положением левого и правого уха звук, приходящий от источника, расположенного под углом к фронтальному направлению, затрачивает различное время для достижения барабанных перепонок.

Фазовая локализация | Принципы имитации объемного звучания

Рис. 2. Схематичный пример фазовой локализации

При одинаковом времени, затрачиваемом для достижения сигнала левого и правого уха, данный механизм будет локализовать источник в азимуте 0 и 180 градусов. Различное время достижения барабанных перепонок приводит к появлению фазового сдвига. Слуховая система различает фазовый сдвиг до 10—15 градусов. С повышением частоты, а соответственно, с уменьшением длины звуковой волны, фазовый сдвиг сигналов, пришедших от одного и того же источника к разным ушам, увеличивается. Как только сдвиг достигает значения, близкого к половине длины звуковой волны механизм перестает работать. Человеческий мозг не может однозначно определить, отстает ли звуковой сигнал в одном из слуховых каналов от другого или, наоборот, опережает его.

Максимальная разница во времени, соответствующая полному смещению источника звука вправо или влево, не может быть больше 630 мкс.

Расстояние между правым и левым ухом взрослого человека составляет 0,15 м—0,20 м, если брать среднее значение по полу. При источнике, излучающем звуковую волну с частотой 20 Гц и скорости звука в 340 м/с, длина волны будет составлять 17 м. Соответственно, если человек повернется к источнику одной стороной, то фазовый сдвиг сигналов, пришедших в одно ухо, а затем в другое, будет составлять примерно 1,1 % от всего периода 20 Гц волны (локализации на таких низких частотах невозможна). Физиологически точность локализации зависит от размера головы, то есть расстояния между ушами. Чем больше это расстояние, тем с большей разницей приходят звуковые сигналы в каждое ухо.

Локализация по уровню интенсивности

При излучении звука источником, расположенным под определенным углом к фронтальному направлению, уровень звукового давления на барабанные перепонки в разных ушах будет различным. Это связано с тем, что одно ухо будет находиться как бы «в тени», которую создает голова, а также с тем, что звуковые волны выше 1000 Гц сравнительно быстро затухают в пространстве.

Рис. 3. Схематичный пример локализация по уровню интенсивности

Данный механизм является достаточно эффективным, но в диапазоне звуковых частотах от 1600 Гц. При длине звуковой волны, сравнимой с диаметром человеческой головы, дальнее от источника ухо перестает находиться в «акустической тени», что обусловлено явлением дифракции звуковой волны на поверхности головы. При этом опытным путем было выявлено, что способность человеческим слухом определения угла между двумя источниками в горизонтальной плоскости в области частот 1500—2000 Гц резко снижается.

Такой механизм способствует определению расстояния до источника звука. Однако уровень звука от слабого, но близко расположенного источника может быть таким же, как от мощного, но удаленного на значительное расстояние. При таких условиях локализации способствует следующий механизм.

Локализация по разнице амплитудно-частотного спектра

Механизм основывается на возможности анализа мозгом АЧ провалов и подъемов определенных частот в сложном сигнале. Звук, приходящий под углом 90°, содержит как низкочастотные, так и высокочастотные составляющие, а в спектре звука, действующего на дальнее ухо, высокочастотных составляющих будет меньше — экранирующее воздействие головы. Кроме того, звуковой сигнал по-разному отражается от участков ушной раковины, происходит усиление и ослабление различных участков звукового спектра.

Данный механизм отвечает за локализацию фронт-тыл и вертикальную плоскость. Изучение фильтрующего действия головы и ушных раковин слушателя позволило ввести понятие пеленговых полос. При локализации человек анализирует не весь спектр приходящего звука, а лишь изменения некоторых частот. Такие полосы сформировались эволюционно, слух выработал собственную систему отслеживания и предупреждения опасности, достаточно точно локализуя откуда исходит угроза.

Изменения в полосах от 16 до 500 Гц и от 2 до 6 кГц отвечают за локализацию передних источников звука. Полоса от 0,7 до 2 кГц — изменение тембра источников, которые могут располагаться сзади.

Сигнал со сложным спектральным составом локализуется лучше, а ощущение направления «фронт-тыл» формируется преимущественно теми полосами направления, в которых сосредоточена большая часть мощности сигнала. Чистые тона, которые, практически не встречаются в природе локализуются хуже сложных сигналов. Так, чистые тона свыше 8000 Гц поддаются локализации с трудом. Невозможно определить и местоположение источников звука низкой частоты — менее 150 Гц.

Локализация в вертикальной плоскости гораздо хуже, чем в горизонтальной. Без психологического, зрительного воздействия практически невозможно создать имитацию объекта, который должен располагаться, например, сверху. Этот звук должен быть как минимум привычный и ожидаемый.

Гибсон Д. в своих книгах и видео выдвигает концепцию о вертикальном расположении инструментов в музыкальном миксе по их звуковысотности (тесситуре) или форманте (область усиленных частичных тонов), так как в вертикальной плоскости звуковоспроизводящая техника построена по такому же принципу. За счет акустического кроссовера с определенными границами сложный сигнал делится на полосы частот. В трехполосной системе снизу расположен woffer предающий НЧ, в средней части mid-driver для СЧ и tweeter в верхней части системы для передачи ВЧ. А sub-woffer передает часть информации через пол. Такой подход интересен, но не подходит для многих систем, например, при использовании наушников или любой другой системы без разделения на полосы.

Подробнее с описанными принципами можно ознакомиться в книге Гибсон Д. — Визуальное руководство по звукозаписи и продюссированию.

Тем не менее уменьшение интенсивности низких частот психоакустически помогает «приподнять» объект, сделать его легче.

Перемещение источника звука

До 1960-х годов изучение способности человека локализовать источник звука в пространстве в основном касалось неподвижных источников звука. После же началось исследование восприятия человеком и движущихся источников звука: определялись основные характеристики восприятия.

В ходе исследований оказалось, что для того, чтобы у человека возникло ощущение движения звука, необходимо определенное время — временное окно. Оно колеблется от 0,08 до 0,12 с. Локализовать же короткий неподвижный звук (например, щелчок длительностью порядка 0,001 с.) достаточно легко.

Так же человек может различать скорость движения источника звука: чем она выше (в определенных пределах), тем тоньше эта способность. Если источник звука движется со скоростью 90°/с (движение по полупериметру перед головой испытуемого), человек различает изменение скорости на 15%; а при скорости движения 360°/с — на 5,5%.

Если источник является неподвижным, то для его локализации человек подсознательно совершает микроперемещения головы, на порядок повышающие точность определения положения источника в пространстве.

Эффекты

Для того чтобы правдоподобно передать звук от движущегося источника, необходимо учитывать эффект Доплера (эффект изменения частоты звука от источника при нерадиальном перемещении его относительно слушателя). По субъективному ощущению эффекта звук резко меняет тон — становится более высоким при приближении объекта и более низким при его удалении. В игровой сфере эффект Доплера играет значимую роль. Особенно, если речь идет об авто симуляторах и других приложениях связанных с быстрым перемещением объектов. Эффект Доплера распространённым плагином для секвенсоров, а также, на сколько мне известно, существует во многих звуковых движках.

Одним из основных эффектов создания пространства является эффект реверберации (процесс многократного переотражения звукового сигнала от различных поверхностей с постепенным уменьшением его интенсивности). У моделируемой реверберации существует ряд параметров — время раннего отражения, время позднего отражения, скорость затухания, процентное соотношение «сухого» сигнала с обработанным. Эти параметры указывают на размер помещения и место источника звука в нем относительно слушателя. В работе я использую исключительно конволюционные (сверточные) ревербераторы, применяя к ним импульсы реальных помещений. Не вдаваясь в подробности технологии сам импульс представляет из себя шумовой «слепок» помещения (wav файл), который модулирует исходный звуковой файл, тем самым помещая его в имитируемое пространство. В музыкальной сфере конволюционные технологии давно используются, так в оболочке Kontakt (4,5) от NI конволюционный ревербератор с набором импульсов имеется в списке стандартных эффектов.

Звуковые системы. Бинауральная система

Существует два основных подхода по организации современных звуковых систем в помещении: многоканальные системы и двухканальные системы (в том числе и наушники). В многоканальных системах звук передается из мониторов, размещенных спереди и сзади от слушателя (либо вокруг него).

Подробно с монофоническими, бинауральными, стереофоническими и многоканальными системами и их тонкостями можно ознакомиться в книге Ю. Ковалгина — Стереофоническое радиовещание и звукозапись.

Для усиления пространственного эффекта производители пытаются продвигать концепции систем уже не пяти-, а шести-, семи- и даже девятиканальные. Увеличение количества каналов требует усложнение работы звукорежиссера, увеличения количества акустических систем, коммутационных проводов, применения более сложных усилителей, а, следовательно, позволяет увеличивать доходы с продаж.

Не всем потребителям необходимы многоканальные аудиосистемы. Для кого-то это неприемлемо по экономическим соображениям, кто-то не может выделить под систему домашних развлечений помещение в жилом помещении. Кто-то по очевидным причинам предпочитает пользоваться наушниками (в ночное время суток, при перемещении в транспорте и т.д.).

Всего два уха обеспечивают человека всей необходимой информацией об объекте, это значит, что для ее передачи достаточно всего лишь двух громкоговорителей. При использовании бинауральной записи кажущиеся источники звука в случае применения наушников оказываются вынесенными за пределы головы слушателя в то место, где расположены действительные источники звука. В отличие от этого, при прослушивании через наушники сигналов обычной стереофонии кажущиеся источники звука ощущаются как расположенные внутри головы слушателя.

Появление реверберации затрудняет оценку азимута кажущихся источников звука в тыловой области, где слушатели вместо истинного направления часто указывают соответствующее ему зеркальное фронтальное направление. Данное явление возникает особенно часто, когда время стандартной реверберации в помещении прослушивания превышает 0,3 с.

Правильная передача пространственной информации при воспроизведении с помощью двух мониторов возможна, но даже незначительное (около 9—15 см.) смещение центра головы слушателя влево или вправо от этой точки приводит к тому, что локализация кажущихся источников звука оказывается невозможной вне фокуса осей мониторов.

В оптимальной точке прослушивания бинауральная система обеспечивает звучание, уверенно предпочитаемое обычному стереофоническому. Однако ее применение весьма ограничено: воспроизведение с помощью наушников, переносная аппаратура радиовещания и звуковоспроизведения, компьютерное моделирование. Бинауральная звуковая система мало пригодна для условий коллективного прослушивания.

При воспроизведении бинаурального сигнала через акустическую систему из-за попадания сигнала правого канала в левое ухо слушателя и наоборот возникают перекрестные искажения.

В реалиях игрового саунд дизайна записанные бинауральные аудио файлы не применяются, потому как невозможно изменять их положение в пространстве, нет виртуального источника и виртуального слушателя, это не моделирование.

Алгоритмы

Основной алгоритм, использующий основные механизмы локализации звука человеком, реализован в HRTF (Head Related Transfer Functions — функции перемещения звука относительно слушателя. Количественно HRTF определяются обратным интегральным Фурье преобразованием коэффициентов под названием HRIR (Head Related Impulse Response), которые в первом приближении определяются отношением давлений на барабанную перепонку уха звуковой волны в свободном пространстве (free field) и в реальном пространстве с учётом головы человека, ушных раковин, его корпуса и других препятствий.

HRTF представляет собой сложную функцию с четырьмя переменными: три пространственных координаты и частота. При использовании сферических координат для определения расстояния до источников звука больших, чем один метр, принимается, что источники звука находятся в дальнем поле (far field),значение HRTF уменьшается обратно пропорционально расстоянию. Большинство измерений HRTF производится именно в дальнем поле, при этом количество переменных уменьшается до трёх: азимут (azimuth), высота (elevation) и частота (frequency). Действие HRTF зависит от частотного диапазона обрабатываемого сигнала: только звуки со значениями частотных компонентов в пределах от 3000 Гц до 10000 Гц могут успешно интерпретироваться с помощью функций HRTF. Если сигнал от источника звука не содержит особую частоту, влияющую на разницу между фронтальными и тыловыми HRTF функциями, то такой сигнал никогда будет локализован по направлению фронт-тыл.

HRTF моделировался при помощи манекена KEMAR (Knowless Electronics Manikin for Auditory Research) и специального «цифрового уха» (digital ear), разработанного компанией Sensaura. В ушах манекена размещаются микрофоны, а вокруг манекена — акустические колонки, в результате происходит запись того, что слышит каждое «ухо». Получаемые при таком моделировании результаты используются для пополнения базы данных по HRTF, которые затем могут быть использованы для интерактивного выбора параметров при воспроизведении позиционируемого 3D звука (в базе данных компании Sensaura накоплено более 1100 HRTF). Необходимость в такой базе данных объясняется, во-первых, различием размеров и формы головы и ушных раковин манекена и потенциального слушателя и, во-вторых, определяемых этими параметрами так называемой зоны sweet spot, в которой корректно воссоздаётся эффект звучания в вертикальной плоскости и гарантируется правильное определение местоположения источников звука в пространстве. Чем больше область sweet spot, тем большую свободу действий имеет слушатель. Поэтому разработчики постоянно ищут способы увеличить область действия sweet spot.

Компания QSound при реализации технологий с HRTF опирается не только на математические методы, но и на апробацию слушателями (таких прослушиваний было проведено около 550 тыс.). Специалисты компании Sensaura после серии опытов определили, что HRTF в чистом виде «работает» только при воспроизведении через наушники. Моделирование звука в этом случае тривиальная задача: каждый динамик контролирует соответствующее ему ухо. Однако при воспроизведении того же самого звука через колонки правое ухо слышит также звук, призванный «обманывать» с точки зрения трехмерности левое, и наоборот. Для исключения этого явления требуется добавить в звук дополнительные компенсационные вычисления. Удачные алгоритмы компенсации были разработаны, они получили название Transaural Cross-talk Cancellation (TCC). Решена задача была с помощью другой идеи инженеров Sensaura. Она заключается в том, что функции HRTF действуют только для среднестатистического уха, так как выведены с помощью одного манекена или усредненных показаний большой группы людей. Sensaura разработала цифровую модель уха, в которой можно задавать параметры ушной раковины. С помощью этой цифровой модели сочетанием разных параметров можно воспроизвести форму практически любого уха. Получившийся драйвер цифрового уха работает так: при его установке человек слушает ряд тестовых звуков и настраивает параметры драйвера, чтобы наилучшим образом ощущать трехмерность звука. Индивидуальные параметры слушателя записываются в специальный «профиль», он впоследствии и используется приложениями.

Читать вторую часть: http://telegra.ph/Obemnoe-zvuchanie-v-razvlekatelnoj-sfere-01-23