Explorant els transformadors de visió autosupervisats per al reconeixement de la marxa a The Wild Part 2

Nov 24, 2023

2.2. Transformadors de visió

Tot i que es van proposar inicialment per a tasques de PNL [16,34] amb un èxit immens, els transformadors s'han utilitzat àmpliament en visió per ordinador en els darrers anys [24,25,28,35–37]. Ambdós dominis han gaudit d'un rendiment sense precedents mitjançant l'ús de diverses variacions de transformadors, en part a causa de l'augment de la capacitat del model i la capacitat dels transformadors de beneficiar-se de l'autosupervisió molt més que els models anteriors [17].

L'autocontrol i la memòria estan estretament relacionats. L'autocontrol fa referència a l'avaluació i l'ajust de la pròpia conducta, pensament i emocions, mentre que la memòria es refereix a la capacitat d'adquirir, processar i emmagatzemar informació. L'autocontrol ens pot ajudar a tenir un millor control sobre el nostre comportament i emocions, millorant així la memòria.

En primer lloc, l'autocontrol ens pot ajudar a resistir millor la temptació. La temptació tendeix a distreure la nostra atenció i energia i afecta la nostra memòria. Mitjançant l'autocontrol, podem controlar-nos millor i evitar les distraccions excessives, millorant així la memòria.

En segon lloc, l'autocontrol també ens pot ajudar a comprendre i recordar millor la informació. L'autocontrol ens permet parar més atenció als punts clau de la informació i prestar atenció a les connexions entre la informació, per entendre i recordar millor la informació. Quan prestem atenció, estem millor equipats per comprendre i retenir la informació.

Finalment, l'autocontrol també ens pot ajudar a observar i resumir millor el nostre comportament i pensament. En reflexionar sobre les nostres pròpies accions i processos de pensament, podem identificar les mancances i millorar-les. Aquesta millora no només millora el nostre comportament i el nostre pensament, sinó que també millora les nostres capacitats de memòria.

En resum, l'autocontrol i la memòria estan estretament relacionats. Mitjançant l'autocontrol, podem controlar-nos millor, comprendre i recordar millor la informació i millorar millor el nostre comportament i els nostres processos de pensament. Al mateix temps, això també ens ajudarà a millorar la nostra memòria, permetent-nos estudiar i treballar de manera més eficient. Aclarim els nostres objectius, ajustem-nos activament i perseguim constantment el progrés! Es pot veure que hem de millorar la memòria, i Cistanche deserticola pot millorar significativament la memòria, perquè Cistanche deserticola també pot regular l'equilibri dels neurotransmissors, com l'augment dels nivells d'acetilcolina i factors de creixement. Aquestes substàncies són molt importants per a la memòria i l'aprenentatge. A més, la carn també pot millorar el flux sanguini i promoure el lliurament d'oxigen, cosa que pot garantir que el cervell rebi suficients nutrients i energia, millorant així la vitalitat i la resistència del cervell.

supplements to boost memory

Feu clic a Coneix suplements per millorar la memòria

Dosovitskiy et al. [24] van ser els primers a proposar la utilització de codificadors de transformadors per a la classificació d'imatges, introduint el Vision Transformer (ViT). L'arquitectura divideix la imatge d'entrada en pedaços de mida fixa de 16x16, aplana i les projecta amb una capa lineal a la dimensió d'incrustació. S'insereix un testimoni de classe addicional (CLS) a la seqüència i s'afegeixen codificacions posicionals a cada vector.

La seqüència resultant d'incrustacions es dóna com a entrada a un codificador de transformador, que té la mateixa estructura que la de [34], però utilitza l'operador LayerNorm abans de cada bloc en lloc de després (pre-norma). S'utilitza un MLPhead per obtenir l'etiqueta de classe a partir de la informació global agregada al testimoni de classe.

El mecanisme d'autoatenció introduït per Vaswani et al. [34] pren una seqüència d'elements com a entrada i estima la interacció entre tots ells agregant la informació global per a cada element de la seqüència. Per calcular diferents interaccions entre els elements d'una seqüència, el mòdul d'autoatenció multicapçal (MSA) concatena els resultats de múltiples blocs d'autoatenció i projecta la sortida en una matriu de pes aprendre. El codificador del transformador introduït a [34] es compon de múltiples capes apilades que consisteixen en un bloc MSA, un bloc feedforward (FFN), connexions residuals entre cada bloc i una LayerNorm (LN) després de cada bloc.

Touvron et al. [25] proposen dos canvis arquitectònics per millorar el rendiment dels transformadors de visió profunda. La seva primera contribució, LayerScale, facilita l'entrenament de models més profunds afegint una matriu diagonal que es pot aprendre que es multiplica per la sortida dels blocs residuals. Com que la matriu s'inicia amb valors petits, obliga els resultats de les capes del codificador del transformador a tenir una petita contribució a la sortida del bloc residual al començament de l'entrenament.

La seva segona contribució és el mecanisme d'atenció de classe. En lloc d'afegir inicialment el testimoni CLS, com en el ViT estàndard, s'afegeix després de diversos blocs de codificació. Després d'aquesta etapa, només s'actualitza el testimoni de classe i els fitxes de pedaç es mantenen congelats. Aquest mecanisme ajuda a desacoblar les operacions d'autoatenció entre pedaços de l'agregació de la informació que s'utilitzarà per a la classificació.

Yuan et al. [28] argumenten que la simple tokenització de pegats a la ViT de vainilla té la limitació de no poder modelar l'estructura local de la imatge i la interacció entre els pegats veïns. En conseqüència, introdueixen un procés de tokenització progressiva que combina fitxes veïnes en una sola.

Aquest procés consisteix en el mòdul Reshape, que pren la seqüència de fitxes de la capa anterior i construeix una imatge a partir d'ells basant-se en la proximitat espacial. El mòdul Soft Split divideix la imatge construïda en pedaços superposats de fitxes i els alimenta al següent codificador. Els testimonis generats després del procés de tokenització s'alimenten a una columna vertebral estreta de ViT per a la seva classificació.

ways to improve your memory

Com assenyala Wang et al. [35] el transformador de visió estàndard va ser dissenyat específicament per a la classificació d'imatges i no és adequat per a altres tasques com ara la detecció d'objectes o la segmentació. Per això, proposen el Pyramid Vision Transformer (PVT) que s'inspira en les arquitectures de CNN mitjançant la producció de mapes de característiques intermediàries amb dimensions espacials decreixents i un nombre creixent de canals.

Aquesta estructura piramidal ajuda el model a aprendre característiques multiescala que es poden utilitzar per a diverses tasques. El model processa primer fitxes obtingudes a partir de pedaços de dimensions 4 × 4, i en cada etapa, els fitxes corresponen a dimensions espacials més grans dels pegats.

El cost computacional de l'autoatenció clàssica és O(N2· d) on N és el nombre de fitxes de la seqüència i d és la dimensió vectorial. El cost computacional quadràtic en termes de nombre de fitxes esdevé un problema pràctic amb l'augment de la resolució de la imatge d'entrada, ja que cada testimoni d'una seqüència correspon a un pegat de la imatge.

A la literatura, hi ha diverses tècniques amb les quals reduir el cost computacional de l'autoatenció de vainilla [26,35,36]. PVT [35] utilitza l'atenció de reducció espacial, que redueix la mida espacial dels vectors Clau i Valor abans de l'autoatenció amb una operació de remodelació i una projecció lineal.

El transformador Swin [36] que també té una estructura piramidal substitueix el bloc d'autoatenció per un mòdul que l'aproxima. El mòdul agrupa els pegats veïns a les finestres locals i realitza l'operació d'autoatenció només dins d'aquestes finestres.

Per comunicar la informació amb altres finestres, desplaça les finestres locals de manera que també continguin pegats de finestres veïnes i torna a calcular l'autoatenció. Chu et al. [27] va adoptar l'arquitectura PVT i va proposar un mètode similar per aproximar l'autoatenció. També van realitzar atenció local entre pegats a una finestra, similar al transformador Swin.

Per comunicar informació amb altres finestres, van dur a terme l'autoatenció entre un representant de cada finestra i totes les altres finestres. CrossFormer [26] també es basa en el PVT. Utilitza l'atenció a curta distància, que és similar a l'atenció local al transformador Swin, però per filtrar informació a altres finestres utilitza atenció a llarga distància, que calcula la interacció entre pegats, que tenen una distància fixa entre ells. També combina pedaços multiescala centrats al voltant del mateix píxel per obtenir les fitxes dels blocs transformadors, cosa que ajuda el model a aprendre interaccions a escala creuada.

Yang et al. [37] proposen el mecanisme d'atenció focal per aprendre interaccions tant a curt com a llarg abast entre fitxes que fa que els transformadors de visió puguin processar imatges d'alta resolució. Per a cada pegat d'imatge, el mòdul d'autoatenció focal calcula les interaccions amb pedaços tancats espacialment i amb finestres resumides de pegats més distants. El resum de les finestres de pedaços es fa mitjançant l'agrupació i no captura informació quan els pegats estan lluny.

El RegionViT [38] utilitza l'arquitectura PVT i afegeix dos camins de tokenització per a cada mapa de característiques. El primer camí de tokenització obté fitxes regionals que consisteixen en pedaços que cobreixen un gran nombre de píxels. El segon camí de tokenització obté fitxes locals que capturen informació de baix nivell en contenir pocs píxels. Aquests dos tipus de fitxes s'alimenten com a entrada al codificador del transformador regional a local en el qual es calcula la primera autoatenció entre regions, després entre cada testimoni regional i els seus corresponents fitxes locals.

L'arquitectura LeViT [39] combina les CNN i el mecanisme d'autoatenció. Primer s'introdueix una imatge a un codificador CNN, que disminueix les dimensions espacials i augmenta la dimensió del canal. Els mapes de característiques resultants s'alimenten a un ViT jeràrquic que conté un mòdul d'atenció que es redueix entre els seus codificadors per reduir encara més les dimensions espacials i augmentar la dimensió del canal dels mapes de característiques.

També s'han utilitzat arquitectures basades en l'atenció en tasques basades en vídeo on cal tenir en compte la informació temporal. Les arquitectures, com ViViT [40] i TimeSformer [41], utilitzen el mecanisme d'autoatenció tant en les dimensions espacial com temporal. Per això, el model aprèn a capturar la informació espacial de cada fotograma i el canvi al llarg del temps.

3. Mètode

En aquesta secció, proporcionem una descripció detallada de cada arquitectura i els hiperparàmetres escollits. A més, es descriu el processament de dades i les decisions de disseny proposades per adaptar els transformadors de visió per treballar amb seqüències d'esquelet. Finalment, es descriuen els mètodes d'inicialització, el protocol d'avaluació i els conjunts de dades d'avaluació.

3.1. Descripció d'arquitectures

Vam explorar cinc variants diferents dels transformadors de visió (figura 1), que es van desenvolupar per a un càlcul més optimitzat en imatges, en termes de rendiment i temps d'inferència. En particular, explorem el clàssic ViT [24], CaiT [25], Token2Token ViT [28] i Twins-SVT [27].

En general, els sabors dels transformadors de visió s'ocupen de millores en la forma "clàssica" de processar imatges amb transformadors, tal com es proposa a ViT: les imatges es divideixen en pedaços de mida igual i no solapades que s'aplanen i es projecten en un espai dimensional inferior per llavors es tractaran com a "fitxes", de manera similar a les aplicacions de PNL. En el cas de l'anàlisi de la marxa, un pegat quadrat correspon a un grup d'articulacions que varien a través d'una petita finestra temporal.

increase brain power

El codificador de transformador estàndard pren com a entrada una seqüència d'ítems (X ∈ Rn×d on n—nombre d'ítems, d—dimensió d'incrustació) i els projecta en tres matrius de pes aprendre diferents obtenint les consultes (Q ∈ Rn×dq), les claus. (K ∈ Rn×dk, dk=dq)i valors (V ∈ Rn×dv ), on dq, dk i dv són les dimensions de les consultes, claus i valors, respectivament. L'atenció es calcula com:

increase memory power

Per a la majoria de les arquitectures, hem corregit el nombre de capes, capçals d'atenció i característiques dimensionals sempre que fos possible. Com a tal, escollim 4 capes amb 4 capes d'atenció, una dimensió de 512 per a la xarxa de feedforward i una mida d'inserció final de 128.

improve brain

ViT The Vision Transformer [24] obté una seqüència d'entrada de fitxes dividint la imatge en pedaços i projectant-los linealment a la dimensió d'incrustació. La seqüència resultant juntament amb un testimoni de classe addicional (CLS) es dóna com a entrada a un codificador de transformador. A més, el codificador ViT utilitza pre-norma, a diferència de la post-normalització. La sortida d'una capa es pot calcular com:

improve short term memory

on λl, i i λ0l, i són paràmetres aprendre. El model també desacobla el càlcul de les interaccions entre fitxes d'entrada del càlcul de la incrustació de classes que agrega tota la informació global. Això es fa amb l'atenció de la classe que introdueix el testimoni CLS a la seqüència d'entrada després d'haver obtingut les interaccions i congela tots els altres fitxes. Per al codificador CaiT, hem utilitzat la mateixa configuració que a ViT, però per al codificador CLS, hem utilitzat una profunditat de 2 capes.

Token2Token ViT L'arquitectura Token2Token [28] conté un procés de tokenització progressiva que modela l'estructura local d'una imatge combinant fitxes veïnes. El procés de tokenització construeix primer una estructura semblant a una imatge a partir d'una seqüència d'entrada de fitxes amb l'ajuda del mòdul Reshape. A continuació, la imatge es divideix en pegats superposats de fitxes mitjançant el mòdul Soft Split (SS). La sortida resultant del mòdul de tokenització es calcula com:

increase memory

Per a Token2Token, hem utilitzat 2 capes amb mides de pegat de {2, 8} i {2, 4} per a la primera capa i {4, 16} per a la segona capa.

Twins-SVT L'arquitectura Twins-SVT [27] substitueix el bloc clàssic d'autoatenció per un mòdul anomenat autoatenció separable espacialment (SA) que aproxima l'operació. SSSA consisteix en una autoatenció agrupada localment (LSA) que calcula la interacció només entre fitxes dins de la mateixa finestra local i l'atenció global submostrejada (GSA) que agrega informació global fent autoatenció entre tots els representants de cada finestra local calculada mitjançant la convolució dels testimonis veïns. Les operacions de la capa aTwins es poden escriure com:

ways to improve brain function

Per al codificador CrossFormer, hem utilitzat dimensions de {16, 32, 64, 128} per a les capes, mides globals de finestra de {4, 2, 2, 1}, mida de finestra local de 2, passos d'inserció creuada de 2 i creus. -Incrustar mides del nucli de {{2, 4, 8, 16}, {2, 4}, {2, 4}, {2, 4}}.

3.2. Preprocessament de dades

Tant per als conjunts de dades DenseGait com per GREW, utilitzem el mateix procediment de preprocessament. Per a cada seqüència d'esquelet extreta i rastrejada que conté 18 articulacions amb coordenades x i y i una puntuació de confiança addicional, primer normalitzem la seqüència centrant-nos a les coordenades de la pelvis (pelvis, pelvis) i escalant horitzontalment i verticalment, segons les proporcions del cos humà (és a dir, la distància entre les espatlles: |xR.shoulder − xL.shoulder| i la distància del coll a la pelvis: |yneck − ypelvis|). Per a cada coordenada (unió, unió) de cadascuna de les 18 articulacions en el format de posada COCO, apliquem el següent procediment de normalització:

improve your memory

Mitjançant el procés de normalització, s'eliminen les diferències entre les resolucions de la càmera i la distància del subjecte a la càmera. A més, eliminem la informació de l'aparença sobre l'alçada i l'amplada d'un subjecte, que no pertany a la informació del moviment. Aquest pas és similar al pas d'alineació dels models moderns de reconeixement facial [42]. A més, també fem servir una capa de normalització per lots [43] al principi de cada model per normalitzar encara més la imatge resultant.

Donada la dimensió temporal T (és a dir, el nombre de fotogrames) i la dimensió espacial de l'esquelet J (és a dir, el nombre d'articulacions), les seqüències d'esquelets ingenus es codifiquen com a imatges de forma (T, J, 3), on, en el nostre cas, T {{ 1}} i J=18.

improve memory

La majoria dels transformadors de visió, però, assumeixen que les imatges són quadrades. Per tant, proposem múltiples variants de redimensionar la dimensió espacial de manera que la imatge es transformi a (T, T, 3), la qual cosa equival a augmentar artificialment el nombre d'articulacions (vegeu la figura 2).

improving brain function


For more information:1950477648nn@gmail.com


Potser també t'agrada