Исследование самоуправляемых преобразователей зрения для распознавания походки в дикой природе, часть 2

Nov 24, 2023

2.2. Видение Трансформеры

Первоначально трансформаторы предлагались для задач НЛП [16,34] с огромным успехом, но в последние годы они стали широко использоваться в компьютерном зрении [24,25,28,35–37]. Оба домена добились беспрецедентных результатов за счет использования различных вариантов трансформаторов, отчасти из-за увеличенной мощности модели и способности трансформаторов получать гораздо большую выгоду от самоконтроля, чем предыдущие модели [17].

Самоконтроль и память тесно связаны. Самоконтроль относится к оценке и корректировке своего поведения, мышления и эмоций, тогда как память относится к способности приобретать, обрабатывать и хранить информацию. Самоконтроль может помочь нам лучше контролировать свое поведение и эмоции, тем самым улучшая память.

Во-первых, самоконтроль может помочь нам лучше противостоять искушению. Искушение имеет тенденцию отвлекать наше внимание и энергию и влиять на нашу память. Благодаря самоконтролю мы можем лучше контролировать себя и избегать чрезмерных отвлекающих факторов, тем самым улучшая память.

Во-вторых, самоконтроль также может помочь нам лучше понимать и запоминать информацию. Самоконтроль позволяет нам уделять больше внимания ключевым моментам информации и обращать внимание на связи между информацией, лучше понимать и запоминать информацию. Когда мы уделяем внимание, мы лучше подготовлены к пониманию и сохранению информации.

Наконец, самоконтроль также может помочь нам лучше наблюдать и обобщать наше поведение и мышление. Размышляя о своих действиях и мыслительных процессах, мы можем выявить недостатки и исправить их. Это улучшение не только улучшает наше поведение и мышление, но также улучшает нашу память.

Таким образом, самоконтроль и память тесно связаны. Благодаря самоконтролю мы можем лучше контролировать себя, лучше понимать и запоминать информацию, а также лучше улучшать свое поведение и мыслительные процессы. В то же время это также поможет нам улучшить нашу память, что позволит нам учиться и работать более эффективно. Давайте проясним наши цели, активно корректируем себя и постоянно стремимся к прогрессу! Видно, что нам необходимо улучшить память, а Cistanche Deserticola может значительно улучшить память, поскольку Cistanche Deserticola также может регулировать баланс нейротрансмиттеров, например, повышая уровень ацетилхолина и факторов роста. Эти вещества очень важны для памяти и обучения. Кроме того, мясо также может улучшить кровоток и способствовать доставке кислорода, что может гарантировать, что мозг получает достаточное количество питательных веществ и энергии, тем самым повышая жизнеспособность и выносливость мозга.

supplements to boost memory

Нажмите «Знайте добавки для улучшения памяти»

Досовицкий и др. [24] были первыми, кто предложил использовать преобразовательные кодеры для классификации изображений, представив Vision Transformer (ViT). Архитектура делит входное изображение на фрагменты фиксированного размера 16x16, выравнивает и проецирует их линейным слоем на размер внедрения. В последовательность вставляется токен дополнительного класса (CLS), и к каждому вектору добавляются позиционные кодировки.

Результирующая последовательность вложений передается в качестве входных данных кодировщику преобразователя, который имеет ту же структуру, что и в [34], но использует оператор LayerNorm перед каждым блоком, а не после (предварительная норма). MLPhead используется для получения метки класса из глобально агрегированной информации в маркере класса.

Механизм самовнимания, предложенный Васвани и др. [34] принимает последовательность элементов в качестве входных данных и оценивает взаимодействие между ними, агрегируя глобальную информацию для каждого элемента последовательности. Для расчета различных взаимодействий между элементами последовательности модуль многоголового самообслуживания (MSA) объединяет результаты нескольких блоков самообслуживания и проецирует выходные данные на обучаемую весовую матрицу. Кодер-трансформатор, представленный в [34], состоит из нескольких сложенных слоев, состоящих из блока MSA, блока прямой связи (FFN), остаточных соединений между каждым блоком и LayerNorm (LN) после каждого блока.

Туврон и др. [25] предлагают два архитектурных изменения для улучшения характеристик преобразователей глубокого видения. Их первый вклад, LayerScale, облегчает обучение более глубоких моделей, добавляя обучаемую диагональную матрицу, которая умножается на выходные данные остаточных блоков. Поскольку матрица инициализируется небольшими значениями, результаты слоев кодера преобразователя вносят небольшой вклад в выходные данные остаточного блока в начале обучения.

Их второй вклад — механизм классового внимания. Вместо первоначального добавления токена CLS, как, например, в стандартном ViT, он добавляется после нескольких блоков кодера. После этого этапа обновляется только токен класса, а токены исправлений остаются замороженными. Этот механизм помогает отделить операции самоконтроля между исправлениями от агрегирования информации, которая будет использоваться для классификации.

Юань и др. [28] утверждают, что простая токенизация патчей в ванильном ViT имеет ограничение, заключающееся в невозможности моделировать локальную структуру изображения и взаимодействие между соседними патчами. Следовательно, они вводят прогрессивный процесс токенизации, который объединяет соседние токены в один.

Этот процесс состоит из модуля Reshape, который берет последовательность токенов из предыдущего слоя и создает из них изображение на основе пространственной близости. Модуль Soft Split делит построенное изображение на перекрывающиеся фрагменты токенов и передает их следующему кодировщику. Сгенерированные токены после процесса токенизации передаются в глубокую узкую магистраль ViT для классификации.

ways to improve your memory

Как отмечают Ван и др. [35] стандартный Vision Transformer был специально разработан для классификации изображений и не подходит для других задач, таких как обнаружение объектов или сегментация. По этой причине они предлагают Pyramid Vision Transformer (PVT), который черпает вдохновение из архитектур CNN, создавая промежуточные карты объектов с уменьшением пространственных размеров и увеличением количества каналов.

Эта пирамидальная структура помогает модели изучать многомасштабные функции, которые можно использовать для различных задач. Модель сначала обрабатывает токены, полученные из патчей размером 4×4, и на каждом этапе токены соответствуют большим пространственным размерам патчей.

Вычислительные затраты на классическое самовнимание составляют O(N2·d), где N — количество токенов в последовательности, а d — размерность вектора. Квадратичные вычислительные затраты, выраженные в количестве токенов, становятся практической проблемой при увеличении разрешения входного изображения, поскольку каждый токен в последовательности соответствует патчу в изображении.

В литературе описано несколько методов, с помощью которых можно снизить вычислительные затраты на самообслуживание [26,35,36]. PVT [35] использует внимание к пространственной редукции, которое уменьшает пространственный размер векторов ключа и значения перед самоконцентрацией с помощью операции изменения формы и линейной проекции.

Трансформатор Swin [36], также имеющий пирамидальную структуру, заменяет блок самообслуживания модулем, аппроксимирующим его. Модуль группирует соседние патчи в локальные окна и выполняет операцию самообслуживания только внутри этих окон.

Чтобы передать информацию другим окнам, он смещает локальные окна так, чтобы они также содержали исправления из соседних окон, и снова вычисляет самообслуживание. Чу и др. [27] приняли архитектуру PVT и предложили аналогичный метод аппроксимации внимания к себе. Они также осуществляли локальное внимание между патчами в окне, аналогично преобразователю Swin.

Для передачи информации другим окнам они проводили самообращение между представителем каждого окна и всеми остальными окнами. CrossFormer [26] также основан на PVT. Он использует внимание на близком расстоянии, которое похоже на локальное внимание в преобразователе Swin, но для передачи информации в другие окна оно использует внимание на большом расстоянии, которое вычисляет взаимодействие между патчами, которые имеют фиксированное расстояние между ними. Он также объединяет многомасштабные патчи, сосредоточенные вокруг одного и того же пикселя, для получения токенов для блоков преобразователей, что помогает модели изучать межмасштабные взаимодействия.

Ян и др. [37] предлагают механизм фокусного внимания для изучения как ближних, так и дальних взаимодействий между токенами, который позволяет преобразователям зрения обрабатывать изображения с высоким разрешением. Для каждого фрагмента изображения модуль фокусного внимания вычисляет взаимодействие с пространственно замкнутыми фрагментами и с суммарными окнами более удаленных фрагментов. Суммирование окон исправлений осуществляется путем объединения и не собирает информацию, когда исправления находятся далеко.

RegionViT [38] использует архитектуру PVTarchitecture и добавляет два пути токенизации для каждой карты объектов. Первый путь токенизации получает региональные токены, которые состоят из патчей, охватывающих большое количество пикселей. Второй путь токенизации получает локальные токены, которые фиксируют информацию низкого уровня, содержащую небольшое количество пикселей. Эти два типа токенов подаются в качестве входных данных в кодировщик преобразования региона в локальный, в котором сначала вычисляется самообладание между регионами, а затем между каждым региональным токеном и соответствующими ему локальными токенами.

Архитектура LeViT [39] сочетает в себе как CNN, так и механизм самообслуживания. Изображение сначала подается в кодер CNN, который уменьшает пространственные размеры и увеличивает размерность канала. Полученные карты признаков передаются в иерархический ViT, который содержит модуль сокращения внимания между его кодировщиками для дальнейшего уменьшения пространственных размеров и увеличения размерности каналов карт признаков.

Архитектуры, основанные на внимании, также использовались в задачах, связанных с видео, где необходимо принимать во внимание временную информацию. Архитектуры, такие как ViViT [40] и TimeSformer [41], используют механизм самообслуживания как в пространственном, так и во временном измерениях. Из-за этого модель учится улавливать пространственную информацию из каждого кадра и изменения с течением времени.

3. Метод

В этом разделе мы даем подробное описание каждой архитектуры и выбранных гиперпараметров. Далее мы опишем обработку данных и предлагаемые конструктивные решения по адаптации преобразователей зрения для работы со скелетными последовательностями. Наконец, мы опишем методы инициализации, протокол оценки и наборы данных оценки.

3.1. Описание архитектуры

Мы исследовали пять различных вариантов Vision Transformers (рис. 1), которые были разработаны для более оптимизированных вычислений на изображениях с точки зрения производительности и времени вывода. В частности, мы исследуем классический ViT [24], CaiT [25], Token2Token ViT [28] и Twins-SVT [27].

В общем, разновидности преобразователей зрения имеют дело с усовершенствованиями «классического» способа обработки изображений с помощью преобразователей, предложенного в ViT: изображения разбиваются на одинаковые по размеру и неперекрывающиеся участки, которые сглаживаются и проецируются в пространство более низкого измерения для затем рассматриваться как «токены» аналогично приложениям НЛП. В случае анализа походки квадратный участок соответствует группе суставов, которые варьируются в небольшом временном окне.

increase brain power

Стандартный кодер-трансформер принимает на вход последовательность элементов (X ∈ Rn×d, где — количество элементов, d — размерность внедрения) и проецирует их на три различные обучаемые весовые матрицы, получая запросы (Q ∈ Rn×dq), ключи (K ∈ Rn×dk, dk=dq) и значения (V ∈ Rn×dv), где dq, dk и dv — измерения для запросов, ключей и значений соответственно. Внимание рассчитывается как:

increase memory power

Для большинства архитектур мы по возможности фиксировали количество слоев, голов внимания и размерностей элементов. Таким образом, мы выбираем 4 слоя с 4 головками внимания в каждом, размерностью 512 для сети прямой связи и окончательным размером встраивания 128.

improve brain

ViT Vision Transformer [24] получает входную последовательность токенов, разделяя изображение на фрагменты и линейно проецируя их на измерение встраивания. Результирующая последовательность вместе с токеном дополнительного класса (CLS) передается в качестве входных данных кодировщику преобразователя. Более того, кодировщик ViT использует предварительную нормализацию, а не постнормализацию. Выходные данные слоя можно вычислить как:

improve short term memory

где λl, i и λ0l, i — обучаемые параметры. Модель также отделяет вычисление взаимодействий между входными токенами от вычисления встраивания класса, который объединяет всю глобальную информацию. Это делается с помощью класса внимания, который вводит токен CLS во входную последовательность после получения взаимодействий и замораживает все остальные токены. Для кодера CaiT мы использовали ту же конфигурацию, что и в ViT, но для кодера CLS мы использовали глубину в 2 слоя.

Token2Token ViT Архитектура Token2Token [28] содержит прогрессивный процесс токенизации, который моделирует локальную структуру изображения путем объединения соседних токенов. Процесс токенизации сначала создает структуру, подобную изображению, из входной последовательности токенов с помощью модуля Reshape. Затем изображение делится на перекрывающиеся участки токенов с помощью модуля Soft Split (SS). Результирующий вывод модуля токенизации вычисляется как:

increase memory

Для Token2Token мы использовали два слоя с размерами патчей {2, 8} и {2, 4} для первого слоя и {4, 16} для второго слоя.

Twins-SVT Архитектура Twins-SVT [27] заменяет классический блок самообслуживания модулем, называемым пространственно разделяемым самообслуживанием (SA), который аппроксимирует операцию. SSSA состоит из локально сгруппированного блока самообслуживания (LSA), который вычисляет взаимодействие только между токенами внутри одного и того же локального окна и глобальным подвыборочным вниманием (GSA), которое агрегирует глобальную информацию, выполняя самообладание между всеми представителями каждого локального окна, вычисленное путем свертки соседних токенов. Операции слоя aTwins можно записать так:

ways to improve brain function

Для кодера CrossFormer мы использовали размеры {16, 32, 64, 128} для слоев, размеры глобального окна {4, 2, 2, 1}, размер локального окна 2, шаги перекрестного внедрения 2 и перекрестное встраивание 2. -встраивание размеров ядра {{2, 4, 8, 16}, {2, 4}, {2, 4}, {2, 4}}.

3.2. Предварительная обработка данных

Для наборов данных DenseGait и GREW мы используем одну и ту же процедуру предварительной обработки. Для каждой извлеченной и отслеживаемой последовательности скелета, содержащей 18 суставов с координатами x и y и дополнительным показателем достоверности, мы сначала нормализуем последовательность, центрируя ее по координатам таза (таз, таз). и путем масштабирования по горизонтали и вертикали в соответствии с пропорциями человеческого тела (т. е. расстоянием между плечами: |xR.shoulder − xL.shoulder| и расстоянием от шеи до таза: |yneck − ypelvis|). Для каждой координаты (сустава, сустава) каждого из 18 суставов в формате позы КОКО мы применяем следующую процедуру нормализации:

improve your memory

Благодаря процессу нормализации устраняются различия между разрешением камеры и расстоянием до объекта съемки. Более того, мы удаляем информацию о внешнем виде, касающуюся высоты и ширины объекта, которая не относится к информации о движении. Этот шаг аналогичен этапу выравнивания в современных моделях распознавания лиц [42]. Более того, мы также используем слой пакетной нормализации [43] в начале каждой модели для дальнейшей нормализации результирующего изображения.

Учитывая временную размерность T (т. е. количество кадров) и пространственную размерность скелета J (т. е. количество соединений), наивные последовательности скелетов кодируются как изображения формы (T, J, 3), где в нашем случае T {{ 1}} и J=18.

improve memory

Однако большинство преобразователей зрения предполагают, что изображения квадратные. Поэтому мы предлагаем несколько вариантов изменения размера пространственного измерения таким образом, чтобы изображение преобразулось в (T, T, 3), что эквивалентно искусственному увеличению количества стыков (см. Рисунок 2).

improving brain function


For more information:1950477648nn@gmail.com


Вам также может понравиться