Улучшенное извлечение параметров признаков из речевых сигналов с использованием алгоритма машинного обучения(1)
May 30, 2023
Абстрактный: Распознавание речи относится к способности программного или аппаратного обеспечения принимать речевой сигнал, идентифицировать особенности говорящего в речевом сигнале и затем распознавать говорящего. В общем, процесс распознавания речи включает три основных этапа: акустическую обработку, извлечение признаков и классификацию/распознавание. Цель выделения признаков — проиллюстрировать речевой сигнал с использованием заданного количества компонентов сигнала. Это связано с тем, что вся информация в акустическом сигнале слишком громоздка для обработки, а некоторая информация не имеет отношения к задаче идентификации. В этом исследовании предлагается подход, основанный на машинном обучении, который выполняет извлечение параметров признаков из речевых сигналов для повышения производительности приложений распознавания речи в среде умного города в реальном времени. Более того, принцип отображения блока оперативной памяти в кэш-память эффективно используется для сокращения времени вычислений. Размер блока кэш-памяти — это параметр, сильно влияющий на производительность кэша. В частности, реализация таких процессов в системах реального времени требует высокой скорости вычислений. Скорость обработки играет важную роль в распознавании речи в системах реального времени. Это требует использования современных технологий и быстрых алгоритмов, увеличивающих ускорение извлечения параметров признаков из речевых сигналов. Проблемы с разгоном при цифровой обработке речевых сигналов до сих пор полностью не решены. Экспериментальные результаты показывают, что предложенный метод успешно извлекает характеристики сигнала и обеспечивает беспрепятственную классификацию по сравнению с другими традиционными алгоритмами распознавания речи.

Цистанхе пустынная
Ключевые слова: распознавание речи; параллельные вычисления; распределенных вычислений; многоядерный процессор; извлечение признаков; спектральный анализ
1. Введение
Создание коммуникационных подходов между людьми и компьютерными технологиями является важнейшей задачей современного искусственного интеллекта. Одним из самых простых способов ввода информации пользователями являются речевые сигналы. Поэтому технология обработки речевого сигнала и ее инструменты стали необходимой частью информационного общества. Распознавание речи является важным исследовательским аспектом обработки речевых сигналов и жизненно важным методом взаимодействия человека с компьютером. Речевые сигналы содержат семантическую, личную информацию и информацию об окружающей среде [1]. Общий подход к обработке речевого сигнала заключается в использовании краткосрочного анализа, при котором сигнал разбивается на временные окна фиксированного размера, предполагая, что параметры сигнала не изменяются. Между окнами размещается перекрытие для получения более точного представления сигнала. Алгоритмы выделения признаков, такие как спектральный анализ и линейное предсказание, применяются к каждому окну. Однако эти процессы также должны учитывать скорость и время.

Пустынный женьшень
Синхронизация является серьезной проблемой в нескольких областях обработки сигналов в реальном времени. Коэффициент скорости обработки можно увеличить за счет эффективного использования ресурсов процессора и разработки новых и быстрых алгоритмов для сокращения времени цифровой обработки. Однако проблемы высокопроизводительных вычислений до сих пор полностью не решены [2]. Кроме того, значительный прогресс был достигнут в области автоматического распознавания речи с развитием аппаратного и программного обеспечения для цифровой обработки сигналов. Однако, несмотря на эти достижения, машины не могут сравниться с человеческими аналогами в плане точности и скорости распознавания, особенно в распознавании речи независимо от говорящего. Таким образом, большое количество исследований, проведенных в области распознавания речи, было сосредоточено на проблемах распознавания речи, которые не зависят от говорящего, из-за широкого спектра приложений и ограничений доступных методов распознавания речи [3].
Подводя итог, можно сказать, что основные вклады исследования заключаются в следующем:

Цистанче чай
Нажмите здесь, чтобы просмотреть чайные продукты Cistanche Deserticola
【Запросите дополнительную информацию】 Электронная почта: cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Процесс опознания человека по речевым сигналам состоит из нескольких этапов. Среди них некоторые шаги требуют больше времени расчета. Это спектральный анализ. Одним из параметров, который особенно важен в алгоритмах машинного обучения, является время обучения. В этой работе мы обнаружили, что процесс выделения признаков важен для идентификации речевых сигналов. Кроме того, машинное обучение требует много времени. Установлено, что процесс спектрального анализа состоит из независимых операций, возможно распараллеливание.
Эксперименты показали, что спектральные преобразования БПФ и ДКП дают хорошие результаты в спектральном анализе. Процесс спектрального анализа действителен для каждого сегмента речевого сигнала. Это позволяет четко выделить эти признаки из речевого сигнала. С помощью инструментов OpenMP и TBB был разработан алгоритм параллельных вычислений, позволивший ускорить расчеты.
Размер сегмента важен при разделении речевого сигнала на сегменты. В ходе экспериментов было установлено, что размер сегмента речевого сигнала зависит от кэш-памяти центрального процессора. В частности, было обнаружено, что сопоставление сегмента с размером кэша в многоядерных процессорах положительно влияет на скорость вычислений в машинном обучении.
Предложен новый метод параллельной реализации спектральных преобразований сигналов для выделения параметров признаков из речевых сигналов с использованием алгоритма машинного обучения на многоядерных процессорах с использованием TBB и OpenMP.
Также было установлено, что эффективное использование принципа отображения блока основной памяти в кэш и размера блока кэш-памяти позволяет увеличить скорость обработки.

Добавка Cistanche рядом со мной-улучшение памяти
Оставшаяся часть этой статьи организована следующим образом. В разделе 2 рассматриваются существующие исследования по извлечению конкретных свойств речевого сигнала. Раздел 3 описывает этапы извлечения признаков с помощью экспериментов. В разделе 4 подробно представлен предлагаемый высокопроизводительный вычислительный алгоритм для извлечения параметров признаков из речевых сигналов. Экспериментальные результаты, основанные на нашей реализации, обсуждаются в разделе 5. Раздел 6 подчеркивает ограничения предлагаемого метода. Наконец, Раздел 7 завершает исследование, обобщая результаты и отмечая направления будущих исследований.
2. Связанные работы
В настоящее время разрабатываются и совершенствуются новые методы, алгоритмы и более современные приложения для сегментации речевых сигналов и расчета параметрических показателей выделенных фрагментов, тем самым создавая спектрограммы речевых сигналов с помощью спектрального анализа [4–7]. Идентификация говорящего с помощью разнообразных голосовых клипов по всему миру является важной и сложной задачей, особенно при извлечении ярких и отличительных признаков [8]. Korkmaz et al. предложили новую систему извлечения характеристик кепстральных коэффициентов частоты Mel (MFCC), которая быстрее и энергоэффективнее, чем традиционная реализация MFCC. [9]. Вместо фильтра верхних частот с предыскажением они использовали фильтр нижних частот. Они внедрили полосовой фильтр с фильтром верхних частот, потому что предварительное выделение необходимо для повышения энергии сигнала на высоких частотах. В нашей предыдущей работе [10] мы представили новый метод идентификации говорящего на основе MFCC. Вместо использования обычных MFCC мы используем пиксели из спектрограммы Мела в качестве нашего набора функций. Спектрограмма была преобразована в массив 2-D для создания нового набора данных. Для идентификации говорящего было применено несколько алгоритмов обучения с методом 10-кратной перекрестной проверки. С помощью многослойного персептрона (MLP) с функцией активации tanh была достигнута наилучшая точность 90,2 процента.
Извлечение признаков осуществляется путем преобразования формы речевого сигнала в форму параметрического представления при относительно меньшей скорости передачи данных для последующей обработки и анализа [11–14]. Подходы к извлечению признаков обычно дают многомерный вектор признаков для каждого речевого сигнала. Извлечение признаков — наиболее важная часть распознавания говорящего. Особенности речи играют жизненно важную роль в отделении говорящего от других. Извлечение признаков уменьшает величину речевого сигнала, не нанося ущерба мощности речевого сигнала [15–17]. В [18] авторы представили новый подход, который использует точную настройку размера и параметров сдвига окна спектрального анализа, используемого для вычисления начального кратковременного преобразования Фурье, для повышения производительности автоматического распознавания речи в зависимости от говорящего. (АСР) система. В отсутствие врачей неспециалисты могут использовать системы помощи в принятии решений, созданные с использованием подходов искусственного интеллекта. Раннее и неинвазивное определение состояния сердца может быть выполнено с использованием сигналов фонокардиограммы (ФКГ) [19–21].
Было продемонстрировано, что сверточные нейронные сети (CNN) успешно моделируют структурную локальность в пространстве признаков, а также используют объединение в смещенной частотной области для уменьшения трансляционных вариаций и приспособления к нарушениям и небольшим изменениям в пространстве признаков [22]. Мухамадиев и др. предложили сквозную модель распознавания речи со скрытой глубокой нейронной сетью Марковской модели и гибридную коннекционистскую временную классификацию (CTC)-сеть внимания для узбекского языка и его диалектов. Предлагаемый подход сокращает время обучения и повышает точность распознавания речи за счет эффективного использования целевой функции CTC при обучении модели внимания [23]. В работе [24] было предложено выделение и классификация признаков с использованием модели одномерной сверточной нейронной сети (CNN), которая делит звуковые сигналы сердца на нормальные и аномальные, напрямую независимые от электрокардиограммы (ЭКГ). Они утверждают, что точность классификации в 1D CNN выше, чем в 2D CNN для сигналов звуков сердца, используемых в этом исследовании, когда ядро свертки меньше 52, потому что большое ядро свертки может привести к вычислительной сложности и требует все больше времени. . В [25] глубокая нейронная сеть была обучена максимизировать апостериорную точность последовательностей состояний акустических моделей относительно последовательностей речевых признаков с использованием базы данных TIMIT (TIMIT Acoustic-Fonetic Continuous Speech Corpus).
3. Предварительная обработка: обзор материала

Добавка Cistanche рядом со мной-улучшение памяти
Для этого необходимы разработка быстрых алгоритмов выделения параметров признаков из речевых сигналов и параметрических представлений, выделение полезных и информативных выборок для обработки, разработка программ для реализации спектрограмм выделенных акустических сегментов.
Системы распознавания речи состоят из двух основных подсистем:
первичная обработка речевых сигналов (фонограмма);
Классификация акустических символов с использованием интеллектуального алгоритма (спектрограммы).
Первая подсистема формирует акустические символы как совокупность информативных акустических свойств сигналов и характеристик сигналов. Вторая подсистема преобразует речевой сигнал в параметрическую форму на основе полученных акустических характеристик. Обработка речевого сигнала состоит из следующих этапов:
Разделение границ речевого сигнала;
цифровая фильтрация;
сегментация;
Применение сглаживающего окна;
Спектральное преобразование и нормализация спектральных частот.
Эти этапы широко используются для извлечения параметров признаков из речевых сигналов, и их основные свойства рассматриваются ниже.
3.1. Разделение границ
Извлечение только частей речи из входящего сигнала или определение начального и конечного моментов предложения в шумной обстановке является важнейшей задачей при обработке речи. Для решения этой задачи используются следующие свойства речевого сигнала: кратковременная энергия речевого сигнала, количество точек, пересекающихся в нуле, плотность распределения значений поля тишины внутри сигнала, спектральная энтропия. Традиционные системы распознавания речи используют методы, основанные на переходных и спектральных энергиях сигнала (например, обнаружение голосовой активности) для определения границ речи из входящих речевых сигналов [26–28].
Основными параметрами речевого сигнала являются кратковременная энергия речевого сигнала и количество точек, проходящих через нуль. Как правило, параметры речевого сигнала быстро изменяются во времени; поэтому принято обрабатывать речевой сигнал на фрагменты длиной от 10 до 30 мс, которые не перекрываются. В этом диапазоне речевой сигнал является стационарным, а области тишины в речевом сигнале удаляются путем вычисления переходной энергии. Алгоритм решения этой задачи разбивается на N последовательностей по 256 кратковременных значений энергии очередного речевого сигнала.
Вычисление энергии каждого фрагмента путем деления речевого сигнала подходит для параллельных и распределенных вычислений. Каждый фрагмент обрабатывается независимо. Если обработка применяется в n-ядерном мультипроцессоре, можно будет вычислить энергию n фрагментов одновременно. Следовательно, на этом этапе можно повысить эффективность параллельной обработки [29–32].
3.2. Количество пересечений нуля
Переход через нуль — это точка, в которой меняется знак математической функции (например, с положительного на отрицательный), что изображается точкой пересечения оси (нулевое значение) на графике функции [33]. Частота пересечения нуля в сигнале может быть самым простым индикатором его спектральных свойств. Например, количество точек, проходящих через ноль в речевом сигнале, можно определить с помощью следующего уравнения:

Рис. 1. Метод разделения речи на основе спектрально-энтропийного анализа.
3.3. Цифровая фильтрация
Помимо типичного полезного сигнала присутствуют различные виды шума. Поскольку шум отрицательно влияет на качество систем распознавания речи, борьба с шумом является актуальной проблемой. Для снижения уровня шума в системе используются два типа цифровых фильтров: линейный фильтр и начальный фильтр. Линейный фильтр можно рассматривать как комбинацию фильтров низких и высоких частот, поскольку он улавливает все низкие и высокие частоты. Начальная фильтрация применяется для минимизации влияния локальных помех на характеристические маркировки, которые используются для последующей идентификации. Речевой сигнал должен быть пропущен через фильтр нижних частот для спектрального выравнивания [35].
3.4. Сегментация
Сегментация — это процесс разделения речевого сигнала на дискретные непересекающиеся фрагменты. Сигнал обычно делится на речевые единицы, такие как предложения, слова, слоги, фонемы или даже более мелкие фонетические единицы. Сегментация записей, содержащих высказывания многих говорящих, может заключаться в отнесении фрагментов высказываний к конкретным говорящим. Термин «сегментные станции» иногда используется для обозначения разделения речевого сигнала на кадры перед его параметризацией [36,37].
3.5. Спектральное преобразование
Необходимо различать основные признаки речевых сигналов, которые используются на более поздних этапах процесса распознавания речи. Исходные признаки определяются путем анализа спектральных свойств речевых сигналов. Алгоритм быстрого преобразования Фурье обычно используется для получения спектральной частоты речевого сигнала [38,39].
3.6. Нормализация спектральных частот
Весь вычислительный процесс в интеллектуальных алгоритмах основан на перемещении десятичных чисел. Поэтому параметры объектов, которые классифицируются с помощью нейронных сетей, ограничены диапазоном [{{0}}.0, 1.0]. Результирующий спектр нормализуется между 0 и 1, чтобы применить спектральную обработку с помощью нейронной сети. Для этого каждая компонента вектора разбивается на свои максимальные компоненты.
Методы спектральной обработки позволяют использовать все выборки данных, полученные из речевого сигнала. Многие речевые сигналы имеют специфическую частотную структуру и спектральные свойства. Спектральные методы обеспечивают высокоточную обработку речевых сигналов. К недостаткам спектральной обработки относятся низкая гибкость локальных характеристик сигналов, отсутствие спектральных размерностей и относительно высокие вычислительные затраты.
Преобразование Фурье, вейвлет-анализ и многие другие алгоритмы широко используются при спектральной обработке речевых сигналов. Преобразование Фурье используется во многих областях науки, в том числе в обработке речи. При обработке речевого сигнала преобразование Фурье преобразует сигнал из временного поля в спектральное поле как частотную составляющую [40].
В предыдущих исследованиях для спектрального анализа применялись дискретное преобразование Фурье (ДПФ), дискретное косинусное преобразование (ДКП), кратковременное преобразование Фурье и вейвлет-преобразование. Эти методы использовались для преобразования фрагментов речевого сигнала в частотную область и расчета спектра. Пакеты TBB и OpenMP использовались для создания параллельных алгоритмов спектральных преобразований. В этих методах команда делит сигнал на кадры; например, N=16, 32, … или 4096 для каждого кадра [4]. Размер каждого созданного кадра равен размеру блока кэш-памяти, поскольку кэш-память является фактором, влияющим на эффективность параллельной обработки. Результаты ускорения изображены на Рисунке 2.

Рис. 2. Результаты разгона для четырехъядерных (а) и восьмиядерных (б) процессоров.
Для программной реализации алгоритмов параллельной обработки выполнялась последовательная и параллельная обработка на четырех- и восьмиядерных процессорах, которые применялись с использованием персональных компьютеров и серверов, как указано в таблице 1.
Таблица 1. Характеристики процессоров Intel.

Главной особенностью алгоритма DCT является периодичность. Преимущество DCT заключается в том, что он имеет тенденцию концентрировать большую часть энергии сигнала на небольшом числе факторов. Следующие уравнения определяют элементы матрицы коэффициентов:


где L(k) — значение DCT, k — индекс коэффициентов, x(n) — элементы данных, а N — размер кадра.
Параметры анализа Фурье лежат в основе методов, которые используются для генерации векторов признаков в большинстве систем распознавания речи при цифровой обработке речевых сигналов в спектральной области. Мел-частотные кепстральные коэффициенты (MFCC) [41] и методы кодирования с линейным предсказанием (LPC) [42,43] используются в анализе Фурье для создания изображений спектрограмм из речевых сигналов. Спектры, полученные с помощью анализа Фурье, предоставляют краткую и точную информацию о речевом сигнале, как показано на рисунке 3.

Рис. 3. ДПФ: (а) изменение частотного диапазона во временной области и (б) спектрограмма.
Двумерные (2D) сигналы использовались для спектрального анализа в экспериментах. Характеристики двумерного спектрального анализа, используемые в алгоритмах параллельной обработки изображений, подходят для параллельной обработки в многоядерных процессорах [38]. В частности, векторы и матрицы прямого и обратного преобразования имеют двоичную размерность, а совместимость с этой архитектурой многоядерного процессора может эффективно увеличить скорость вычислений. Поэтому мы применили последовательную и параллельную обработку на компьютере с разными характеристиками процессора для аппаратной реализации алгоритмов, которые использовались для обработки 2D-сигналов (табл. 2).
Таблица 2. Характеристики применения процессоров Intel.

Весь 2D-сигнал на каждом этапе разбивался на одинаковые фрагменты разного размера [44]. Значения выбранных фрагментов находились между разрешениями 16 × 16 и 1024 × 1024 пикселей. Скорость параллельного алгоритма DCT с использованием пакета OpenMP по сравнению со скоростью последовательного алгоритма представлена на рисунке 4. Использование параллельного 2D спектрального анализа алгоритм на многоядерных процессорах дает результат разгона, близкий к числу ядер.

Рисунок 4. Результаты ускорения для двумерного параллельного спектрального анализа.






