Исследование распознавания звука на основе глубокой нейронной сети в преподавании музыки
Oct 10, 2023
Сольфеджио является важным базовым курсом для музыкальных специальностей, а обучение распознаванию звука является одним из важных звеньев. С улучшением производительности компьютеров распознавание звука стало широко использоваться в интеллектуальных носимых устройствах. В последние годы развитие глубокого обучения ускорило процесс исследования распознавания звука. Однако в среде преподавания музыки существует много звуковых помех, что приводит к тому, что производительность аудиокласса не может удовлетворить фактический спрос. Для решения этой проблемы предлагается улучшенная система распознавания звука на базе YOLO-v4, которая преимущественно улучшает структуру сети.
Пение с листа и тренировка слуха неотделимы от памяти. В процессе обучения музыке очень важным навыком является пение с листа и тренировка слуха. Цель тренировки слуха при пении с листа — дать учащимся возможность практиковать свои музыкальные навыки и память, слушая и напевая определенные ноты.
Основное содержание тренировки слуха при пении с листа включает в себя высоту звука, ритм, голос, мелодию, гармонию и т. д. Благодаря тренировке слуха при пении с листа мы можем постоянно тренировать наши уши, что позволяет нам более точно идентифицировать различные ноты и ритмы и быстро конвертировать их. ноты, которые мы слышим, преобразуются в символы на музыкальной карте, тем самым улучшая нашу способность запоминать.
Пение с листа и тренировка слуха также могут помочь нам лучше понять и освоить законы музыки. Когда мы используем наши уши, чтобы напрямую чувствовать и понимать музыку, мы можем глубже понять ритм и мелодию музыки, тем самым быстрее улучшая нашу способность памяти.
Кроме того, пение с листа и тренировка слуха также могут помочь нам развить хорошее чувство музыки и сильные музыкальные эмоции. Благодаря тренировкам наше понимание и чувство музыки будет становиться все более и более глубоким, тем самым улучшая нашу любовь и понимание музыки.
Память – очень важный фактор в процессе изучения музыки. Хорошая память – одно из необходимых условий для изучения любого инструмента и сочинения музыки. Благодаря пению с листа и тренировке слуха мы можем улучшить нашу память и лучше овладеть музыкальными техниками и навыками. Столкнувшись со сложным репертуаром, мы можем быстрее запоминать ноты и ритмы, что помогает нам лучше исполнять музыкальные произведения.
Короче говоря, тренировка слуха и память неотделимы друг от друга и дополняют друг друга. Посредством постоянного пения с листа и тренировки слуха мы можем улучшить наши музыкальные навыки и способности памяти, чтобы лучше освоить музыку. Видно, что нам нужно улучшить память, а цистанхе пустынный может значительно улучшить память, потому что цистанхе пустынный — это традиционное китайское лекарственное средство, обладающее множеством уникальных эффектов, одним из которых является улучшение памяти. Эффективность мясного фарша обусловлена различными содержащимися в нем активными ингредиентами, в том числе кислотами, полисахаридами, флавоноидами и т. д. Эти ингредиенты могут способствовать здоровью мозга различными способами.

Нажмите, чтобы узнать, как улучшить работу мозга
Во-первых, число кепстра частоты Mel используется для обработки исходного звука и извлечения соответствующих характеристик. ru, попытайтесь применить модель YOLO-v4 в … области глубокого обучения к … области распознавания аудио и улучшить ее, объединив ее с модулем пула пространственных пирамид, чтобы усилить способность к обобщению данных в различных аудиоформатах. Во-вторых, метод суммирования при ансамблевом обучении используется для объединения независимых подмоделей двух разных каналов. Результаты экспериментов показывают, что по сравнению с другими технологиями глубокого обучения улучшенная модель YOLO-v4 может повысить производительность распознавания звука, а также имеет более высокую производительность при обработке данных различных аудиоформатов, что демонстрирует лучшую способность к обобщению.
1. Введение
Музыка – это абстрактная форма искусства, средством выражения которой является звук. В процессе обучения музыке сольфеджио может укрепить музыкальную память учащихся, дать им возможность точно идентифицировать музыкальные произведения и, таким образом, улучшить «музыкальное восприятие». Являясь важным звеном сольфеджио, обучение распознаванию звука представляет собой большую трудность для младших школьников. Причина в том, что учащимся необходимо освоить все виды ключей, различать длину и длительность разных нот, а также разницу в высоте между разными нотами.
Анализ аудиосигналов на основе встроенных интеллектуальных устройств привлекает все больше внимания исследователей [1–7]. Интеллектуальные носимые устройства с функциями распознавания звука могут помочь учащимся решить вышеуказанные проблемы и оказать помощь в обучении музыке. Задача распознавания звука требует предварительной обработки собранных аудиосигналов… отдыха, извлечения ценных признаков для различения из них музыкальных партитур и… наконец, классификации их в соответствии с этими признаками. Классификация — очень важный метод интеллектуального анализа данных [8–10]. Классификация означает генерацию функции классикации в соответствии с определенными правилами на основе данных обучающего набора. Функция is может сопоставить данные тестового набора с одной из заданных категорий, реализуя тем самым прогнозирование категорий неизвестных данных. В настоящее время к общим классикам относятся деревья решений, логистическая регрессия, машина опорных векторов (SVM), наивный Байес, алгоритм k-ближайшего соседа (KNN), нейронная сеть BP и глубокое обучение [11–13].
Предыдущим методам машинного обучения часто приходилось вручную извлекать признаки, которые могут представлять собой исходные данные в качестве входных данных классификатора. Однако глубокое обучение может автоматически извлекать многомерные характеристики образцов (без ручного извлечения признаков), если входные данные максимально охватывают информацию исходных данных, что подходит для крупномасштабных данных. *Метод глубокого обучения позволяет реализовать конкретные задачи распознавания звука с помощью большого количества аудиоданных, собранных интеллектуальными устройствами. *Сверточная нейронная сеть (CNN), как разновидность архитектуры глубокого обучения, широко используется в классификации изображений, распознавании речи, обработке естественного языка и других областях из-за ее превосходной производительности при обучении локальных признаков [14]. В отличие от других моделей нейронных сетей (таких как машина Больцмана и рекуррентная нейронная сеть), CNN характеризуется тем, что основной операцией является операция свертки. *Сеть YOLO извлекает уроки из структуры классификационной сети CNN и показывает хорошие преимущества в области распознавания изображений, что привлекло внимание многих исследователей.
*Поэтому в этом исследовании делается попытка применить модель YOLO-v4 к области распознавания звука и улучшить ее сетевую структуру. Кроме того, метод суммирования при ансамблевом обучении используется для объединения двух независимых подмоделей разных каналов, а эффективность классификации объединенной системы еще больше улучшается по сравнению с одной подмоделью.
2. Сопутствующие работы
В настоящее время, с появлением большого количества интеллектуальных устройств, отличная производительность компьютеров и развитие технологий глубокого обучения совместно способствуют исследовательскому процессу в области аудио. В сочетании с основным содержанием этого исследования текущий статус исследований будет представлен с двух аспектов: сверточная нейронная сеть и распознавание звука.
*Структура сверточной нейронной сети возникла в результате исследования Янна Лекуна в 1998 году под названием «искусственная нейронная сеть Le Net-5». *Сверточная нейронная сеть, как и другие нейронные сети, может обучаться с помощью алгоритма обратного распространения ошибки [15]. В 2012 году Алекс Крижевский и другие впервые применили технологию CNN для решения сложных задач компьютерного зрения. Используя 3 полносвязных слоя, 5 слоев свертки и классификатор Softmax, создается сверточная нейронная сеть с 8 слоями, которая называется AlexNet. AlexNet использует функцию активации ReLU и в то же время использует регуляризацию (отсев) для предотвращения переобучения. В 2014 году команда компьютерного зрения Google предложила сеть GoogLeNet [16] с глубиной сети в 22 слоя, содержащую новую структуру, инцидент. Он объединяет функции различной глубины и одного и того же масштаба, а точность обнаружения повышается. На базе сети GoogLeNet появились алгоритмы YOLO и SSD. Оба метода основаны на единой сквозной сети, которая может завершить вход от исходного изображения до вывода позиции и категории объекта.
Что касается распознавания звука, Ян и Чжао [17] предложили метод классификации акустических сцен, основанный на машине опорных векторов (SVM), который улучшал звуковую текстуру для повышения точности классификации. Греко и др. [18] предложили систему распознавания голоса, основанную на эвристическом методе глубокого обучения. Демир и др. [19] предложили новый пирамидально-каскадный метод CNN для классификации звуков окружающей среды. Чжу и др. [20] предложили улучшенный алгоритм YOLO-v4 для инструментов формирования звуковых изображений, который эффективно повысил точность обнаружения изображений акустических фазовых облаков. *Все вышеперечисленные методы показывают отличную производительность при решении задач распознавания звука в одной акустической сцене, но в среде обучения музыке существует множество звуковых помех, и приходится иметь дело с множеством данных различных аудиоформатов.
*Поэтому в этом исследовании предлагается система распознавания звука, основанная на улучшенной сетевой модели YOLO-v4. *Основные инновации и вклад включают следующее: (1) попытаться применить сетевую архитектуру YOLO-v4, которая превосходна в области глубокого обучения, к области распознавания звука и улучшить ее, объединив модуль пула пространственной пирамиды. *Улучшенная сетевая архитектура YOLO-v4 эффективно использует пространственную информацию в аудиофайлах, тем самым усиливая способность обобщения данных в различных аудиоформатах. (2) *Метод суммирования при ансамблевом обучении используется для объединения двух независимых подмоделей разных каналов, при этом эффективность классификации объединенной системы улучшается.
3. Извлечение и обработка аудио-функций
Извлечение наилучшего представления параметров аудиосигнала является одной из важных задач для повышения эффективности распознавания. *e Извлечение признаков на этом этапе очень важно для классификации классификатора на следующем этапе, поскольку оно напрямую влияет на эффективность классификации.
В задаче классификации, особенно в задаче классификации звука, коэффициент кепстра частоты Mel (MFCC), который описывает форму спектра, имеет долгую историю. Хотя процесс извлечения MFCC приводит к сжатию данных с потерями, его эффект классификации и распознавания вполне доступен даже при очень низкой скорости передачи данных. Кроме того, по сравнению с другими классификационными признаками, MFCC широко используется, поскольку он больше соответствует звуковой частотной кривой человеческого уха.

*Причина, по которой люди могут судить о различных средах в сложной звуковой среде, заключается в заслуге улитки. *Улитку можно рассматривать как банк фильтров, помогающий людям фильтровать звук 20-20 кГц. *Проблема в том, что чувствительность улитки к частотам слухового диапазона не является линейной, а имеет картографическую зависимость. MFCC может моделировать частотную характеристику человеческого уха. Извлечение признаков MFCC состоит из семи этапов, и весь процесс показан на рисунке 1.
Обычные аудиосигналы характеризуются тем явлением, что низкочастотная энергия велика, а высокочастотная энергия мала. Если он будет передаваться напрямую, это приведет к высокому отношению сигнал/шум на низких частотах и недостаточному отношению сигнал/шум на высоких частотах. Чтобы компенсировать эту потерю аудиосигнала во время передачи, вводится предыскажение для компенсации входного сигнала, чтобы можно было выделить высокочастотные характеристики аудиосигнала. Предыскажение обычно достигается с помощью фильтра верхних частот [21–23].

Кадрирование делит аудиосэмплы, полученные в результате аналого-цифрового преобразования (АЦП), на небольшие кадры длиной в диапазоне 20–40 миллисекунд. После того, как предыскажения и кадрирование выполнены, необходимо к каждому кадру добавить окно Хэмминга. Окно предназначено для управления объемом обработки данных, при этом одновременно обрабатываются только данные в окне. *Диапазон частот в спектре быстрого преобразования Фурье очень широк, что приводит к тому, что речевой сигнал не подчиняется линейному масштабу [24–26]. *поэтому необходимо пройти набор фильтров шкалы Mel, как показано на рисунке 2.
На рисунке 2 показан набор треугольных фильтров, которые используются для расчета взвешенной суммы спектральных компонентов фильтров так, чтобы обработанный выходной сигнал аппроксимировал шкалу Мела. *Амплитудно-частотная характеристика каждого фильтра имеет треугольную форму. *e Mel-спектр заданной частоты f рассчитывается следующим образом:

13 дифференциальных признаков первого порядка представляют собой изменения между кадрами кепстра в признаках MFCC, а 39 дифференциальных признаков второго порядка представляют изменения между кадрами в дифференциальных признаках первого порядка. *Разница первого порядка рассчитывается следующим образом:

4. Структура сети SPP-YOLO-v4
4.1. Модуль «Пространственный пирамидальный бассейн» (SPP). SPP может избежать искажения информации, вызванного масштабированием, растяжением, обрезкой и другими операциями, и обеспечить вывод, на который не влияет размер ввода, чего невозможно достичь с помощью технологии объединения скользящих окон [27]. Во-вторых, SPP может объединять несколько масштабов, тогда как пул скользящих окон использует только один масштаб окна. *Базовая структура модуля SPP показана на рисунке 3. Видно, что, поскольку размер входного сигнала является гибким, SPP может сочетать характеристики данных в различных аудиоформатах. *e размерность преобразованного вектора признаков такая же, как и у полносвязного слоя, но при этом облегчается проблема обобщения.
4.2. СПП-ЙОЛО-v4. YOLO-v4 — это высокоточный одноэтапный алгоритм обнаружения в реальном времени, объединяющий YOLO-v1, YOLO-v2 и YOLO-v3. YOLO-v4 создает межэтапную частичную сеть CSP (CSPNet) в остаточном модуле, в котором векторный уровень является входом, а информация о признаках более высокого уровня является выходом. *показывает, что цели обучения YOLO-v4 в модуле ResNet различаются для выходных и входных данных. * Таким образом, реализуется остаточное обучение, а параметры модели уменьшаются, поэтому способность к обучению функций улучшается. Учитывая прикладную среду преподавания музыки, в исходную сеть внесены некоторые изменения, а окончательная структура сети показана на рисунке 4.
Сначала векторный слой сворачивается три раза, а затем входной векторный слой максимально объединяется с использованием максимального количества объединенных ядер разных размеров. После свертки и повышения дискретизации различные слои объектов соединяются последовательно для реализации объединения объектов. *ru, выполните понижающую дискретизацию, сожмите высоту и ширину и, наконец, сложите с предыдущим слоем объектов, чтобы реализовать большее объединение объектов (5 раз). *Модуль классификации использует функции, извлеченные из сети, для вынесения классификационных суждений. В качестве примера возьмем сетку 13 × 13, которая равна разделению входной спектрограммы Mel на квадраты 13 × 13; затем для каждого квадрата будут заданы три предыдущих кадра. *Результаты классификации сети будут корректировать положения этих трех предыдущих блоков и, наконец, фильтровать с помощью алгоритма немаксимального подавления (NMS) [28], чтобы получить окончательные результаты классификации.

5. Система распознавания звука на базе SPPYOLO-v4.
5.1. Архитектура системы. Как показано на рисунке 5, после ввода аудио предлагаемая система распознавания звука сначала делит данные аудиопоследовательности на две части. *Первая часть поступает из стереоканала, а вторая часть сжимается в моно. *Аудиосигналы двух каналов извлекаются с помощью спектрограммы MFCC и вводятся в модель SPP-YOLO-v4 в качестве функций. *ru, две группы моделей SPP-YOLO-v4 интегрированы, и при интеграции используется метод штабелирования. После интегрированного обучения двух моделей наконец выводятся результаты классификации звука. *Подробности модели SPP-YOLO-v4 показаны на рисунке 4.
5.2. Комплексное интегрированное обучение. Как показано на рисунке 5, система использует технологию ансамблевого обучения для получения окончательного результата классификации. *Основная идея ансамблевого обучения заключается в формировании сильного классификатора путем объединения нескольких слабых классификаторов. Даже если некоторые слабые классификаторы делают неправильные прогнозы, их можно исправить другими слабыми классификаторами с правильными прогнозами, тем самым достигая эффекта улучшения производительности системы.
Предполагая, что x является входными данными, mi (i=1, 2,..., k) представляет собой группу классификаторов, а выходными данными классификаторов является распределение вероятностей mi (x, cj) каждого класса cj (i=1, 2,...,k) конечный результат y(x) интегрированного классификатора может быть выражен как


цель классификации. В настоящее время популярные алгоритмы ансамблевого обучения включают в себя суммирование, объединение в пакеты, повышение, выбор ансамбля и т. д. * Алгоритм ансамблевого обучения, выбранный в этом исследовании, представляет собой метод суммирования.
Наложение — это процесс обучения второго порядка, в котором в качестве входных данных используются результаты процесса обучения первого порядка, также известный как «метаобучение». *Метод суммирования стал популярным методом ансамблевого обучения не только потому, что его реализация довольно проста, но и потому, что он может значительно улучшить способность системы к обобщению, что очень соответствует цели данного исследования. *Основной принцип метода штабелирования показан на рисунке 6.
6. Эксперимент и анализ результатов
6.1. Экспериментальная среда и набор данных. *Аппаратная платформа этого исследования — процессор Intel Core i3-M350 Dualcore 2,20 ГГц, 8 ГБ памяти DDR2, графический процессор Nvidia RTX2080Ti и 11 ГБ видеопамяти. *Интегрированный инструмент разработки PyCharm разработан на языке Python 3.5.0. * Платформа аннотаций YOLO, написанная на Python, используется для преобразования числового формата, чтобы YOLO мог его прочитать. *Методы сравнения: модель смеси Гаусса (GMM), CNN и R-CNN.

*Экспериментальный набор данных представляет собой записанные аудиофайлы в реальной учебной среде. *Набор данных состоит из типов аудио четырех разных меток (D1, D2, D3 и D4). Все аудиофайлы разрезаются на 30-секундные клипы. *Существует 12 форматов аудиофайлов, включая MPEG, MP3 и WMA. Каждая запись выполняется в другом месте, а средняя продолжительность записи составляет 3–5 минут. *Записывающее оборудование включает в себя двухканальный внутриушной микрофон Soundman OKM II Classic/studio A3 и записывающее устройство сигналов Roland Edirol R09 с частотой дискретизации 44,1 кГц и разрешением 24-бит.
*Использованный набор данных содержит 1404 аудиофайла, а количество аудиофайлов каждого типа — 351. Около 70% данных используется для обучения модели распознавания звука, а оставшиеся 30% — для тестирования. *Настройки системы приведены в Таблице 1.


6.3. Проверка производительности SPP-YOLO-v4. Чтобы проверить влияние предлагаемого улучшенного YOLO-v4 (SPP-YOLO-v4) на способность к обобщению, его сравнивают с традиционной моделью YOLO-v4. В эксперименте были выбраны 3 из 12 форматов аудиофайлов: MPEG, MP3 и WMA. *Обобщающая способность SPP-YOLOv4 представлена в таблице 2.
Из таблицы 2 видно, что общая точность SPP-YOLO-v4 выше, чем у традиционного YOLO-v4, что подтверждает его способность к обобщению данных в различных аудиоформатах. *Поскольку по сравнению с исходным методом SPP SPP-YOLO-v4 содержит больше слоев, но также увеличивает время обработки.
6.4. Сравнение результатов испытаний. В таблице 3 представлены результаты потерь обучения, mAP и т. д. для всех категорий после 8000 раундов обучения. Видно, что обучающая модель предлагаемого метода может эффективно идентифицировать типы аудио. Он имеет определенные преимущества в точности, скорости отзыва и показателе F1, а его значение потерь также самое низкое из всех методов - всего 0,0122. *Следовательно, стабильность и точность предлагаемого метода лучше. *В основном это связано с высоким разрешением и полем приема (RF) SPP-YOLO-v4, а добавление модуля SPP на уровень соединения сохраняет преимущества, предоставляемые SPP. По времени обучения SPP-YOLO-v4 лишь немного больше, чем GMM. *e CNN необходимо обучить множеству операций свертки, поэтому время обучения увеличивается.

Наконец, в эксперименте используются данные 12 различных аудиоформатов для тестирования и сравнения четырех методов. В таблице 4 приведены значения точности и времени испытаний. Видно, что средняя точность метода, предложенного в данном исследовании, составляет 99,0%, а среднее время обнаружения — 0,449сс. * Таким образом, предлагаемый метод обеспечивает лучшую производительность среди четырех сравниваемых методов. Можно сделать вывод, что повышение дискретизации и максимальное объединение SPP-YOLO-v4 принесли значительные преимущества. Максимальное объединение выбирает максимальное значение из соседних областей, чтобы слегка удалить шум максимальной частоты в аудиопоследовательности. * Таким образом, подвыборку свертки можно лучше использовать на последующем слое выборки. *Благодаря этим преимуществам SPP может улучшить производительность магистральной сети.

7. Выводы
*В этом исследовании представлена система распознавания звука, подходящая для обучения музыке. Используйте SPP для улучшения сетевой архитектуры YOLO-v4, то есть используйте SPP для выбора локальных областей в разных масштабах одного и того же слоя свертки, чтобы изучить характеристики многомасштабной системы. Кроме того, метод суммирования при ансамблевом обучении используется для объединения независимых подмоделей двух разных каналов. *Результаты экспериментов показывают, что предложенный метод позволяет повысить точность распознавания типов аудио и имеет лучшую производительность для различных форматов аудиофайлов. Из-за ограничений условий записи звука в экспериментальном наборе данных имеется несколько типов звука, а эффективность классификации аудиофайлов, записанных разными устройствами, еще предстоит проверить. В будущем по этим двум вопросам будут проведены дополнительные испытания.
Доступность данных
*Данные, использованные для подтверждения результатов этого исследования, можно получить у соответствующего автора по запросу.
Конфликт интересов
*Авторы заявляют об отсутствии конфликта интересов.
Рекомендации
[1] С. Ву, Д. Чжан, З. Чжан, Н. Ян, М. Ли и М. Чжоу, «Нейронный машинный перевод от зависимости к зависимости», Транзакции IEEE/ACM по аудио, речи и языку. Обработка, том. 26, нет. 11, стр. 2132–2141, 2018.
[2] Дж. Цзоу, В. Ли, К. Чен и Ц. Ду, «Классификация сцен с использованием локальных и глобальных признаков с совместным объединением представлений», Information Sciences, vol. 348, нет. 2, стр. 209–226, 2016.
[3] Х. Фан, Л. Хертель, М. Маасс, П. Кох, Р. Мазур и А. Мертинс, «Улучшенная классификация аудиосцен на основе встраивания дерева меток и сверточных нейронных сетей», IEEE/ACM Transactions on Обработка звука, речи и языка, том. 25, нет. 6, стр. 1278–1290, 2017.
[4] С. Баятли, «Неконтролируемое взвешивание правил передачи в машинном переводе на основе правил с использованием подхода максимальной энтропии», Journal of Information Science and Engineering, vol. 36, нет. 2, стр. 309–322, 2020.
[5] А. Ракотомамонджи, «Обучение контролируемому представлению для классификации аудиосцен», Транзакции IEEE/ACM по обработке аудио, речи и языка, том. 25, нет. 6, стр. 1253–1265, 2017.
[6] В. Янг и С. Кришнан, «Объединение временных характеристик по локальному двоичному шаблону для классификации акустических сцен», IEEE/ACM Transactions on Audio, Speech and Language Processing, vol. 25, нет. 6, стр. 1315–1321, 2017.
[7] А.С. Дханжал и В. Сингх, «Автоматическая система машинного перевода многоязычной речи на индийский язык жестов», «Мультимедийные инструменты и приложения», том. 81, нет. 3, стр. 4283–4321, 2021.
[8] МА. Аламир, «Новая модель классификации акустических сцен, использующая позднее слияние сверточных нейронных сетей и различных ансамблевых классификаторов», Applied Acoustics, vol. 172, нет. 3, стр. 112–122, 2020.
[9] Дж. Г. Макин, Д. А. Мозес и Э. Ф. Чанг, «Машинный перевод кортикальной активности в текст с помощью структуры кодировщика-декодера», Nature Neuroscience, vol. 23, нет. 4, стр. 575–582, 2020.
[10] С. Вальдекар и Г. Саха, «Двухуровневая классификация акустических сцен на основе слияния», Applied Acoustics, vol. 170, нет. 5, артикул 107502, 2020 г.
For more information:1950477648nn@gmail.com






