Reconeixement de senyals de trànsit basat en l'algoritme YOLOv3 Part 2
Jan 19, 2024
2. Fonaments de l'algorisme
2.1. L'algoritme YOLOv3
YOLOv3 [14] és l'algoritme de detecció d'objectius d'una sola etapa millorat de Redmon basat en YOLOv2, que ha millorat la precisió de la detecció i el rendiment en temps real i supera altres algorismes en termes de velocitat i precisió.
En els darrers anys, el ràpid desenvolupament de la tecnologia d'intel·ligència artificial ha permès aplicar diversos sistemes de detecció intel·ligents en diversos camps. La precisió de la detecció és un indicador important per avaluar la qualitat d'un sistema intel·ligent, i la memòria és una de les capacitats bàsiques que admet el funcionament d'un sistema intel·ligent. Aleshores, quina és la relació entre tots dos?
En primer lloc, hem de deixar clar que la precisió de la detecció i la memòria no són una simple "correlació positiva" o "correlació negativa". Hi ha un alt grau d'interacció i coordinació entre ells. En molts casos, la precisió de detecció d'un sistema intel·ligent depèn de la seva memòria, és a dir, de la seva capacitat per entendre i aprendre dades de mostra.
Per exemple, en el camp del reconeixement facial, un bon sistema de reconeixement facial ha de ser capaç d'identificar amb precisió diferents cares i relacionar-les amb la informació de la persona a la base de dades de cares conegudes. Això requereix que el sistema intel·ligent tingui una memòria forta, pugui emmagatzemar la informació de cares conegudes a la base de dades i utilitzar-la de manera flexible en tasques de reconeixement posteriors.
De la mateixa manera, en l'àmbit mèdic, els sistemes intel·ligents han d'entendre i recordar una gran quantitat de coneixements mèdics per ajudar els metges en el diagnòstic de malalties i el disseny del pla de tractament. Això també requereix que el sistema intel·ligent tingui una forta memòria i capacitats d'aprenentatge, que absorbeixi contínuament nous coneixements mèdics i que es verifici i actualitzi amb la base de coneixement existent.
Per descomptat, la relació entre la precisió de la detecció i la memòria no és unidireccional. Per contra, una bona precisió de detecció també pot promoure la millora de la memòria dels sistemes intel·ligents. Per exemple, en algunes tasques de classificació i reconeixement, els sistemes intel·ligents han de proporcionar retroalimentació i optimització contínuament per millorar contínuament la seva precisió i precisió, reforçant així encara més la capacitat d'entendre i recordar dades de mostra.
En general, la precisió de detecció i la memòria són dos elements indispensables per al funcionament dels sistemes intel·ligents. Tenen interaccions i relacions complexes que cal tenir en compte i coordinar-se completament. Només millorant contínuament la precisió de la detecció i reforçant contínuament la memòria i les capacitats d'aprenentatge del sistema intel·ligent es pot fer realitat el desenvolupament i l'aplicació integrals del sistema intel·ligent. Es pot veure que hem de millorar la memòria, i Cistanche deserticola pot millorar significativament la memòria, perquè Cistanche deserticola també pot regular l'equilibri dels neurotransmissors, com l'augment dels nivells d'acetilcolina i factors de creixement. Aquestes substàncies són molt importants per a la memòria i l'aprenentatge. A més, la carn també pot millorar el flux sanguini i promoure el lliurament d'oxigen, cosa que pot garantir que el cervell rebi suficients nutrients i energia, millorant així la vitalitat i la resistència del cervell.

Feu clic a Coneix suplements per augmentar la memòria
YOLOv3 és actualment l'algorisme més popular de la família YOLO i s'utilitza àmpliament en escenaris de detecció real [15]; l'estructura de xarxa YOLOv3 es mostra a la figura 1.

L'estructura convolucional completa utilitzada per YOLOv3 no està limitada per la mida de l'entrada de la imatge.
L'agrupació i les capes totalment connectades s'eliminen de tota l'estructura de la xarxa i s'utilitza una capa convolucional amb una mida de pas de 2 en lloc de la capa de agrupació per a l'operació de mostreig inferior, que evita la pèrdua d'informació de l'objectiu durant l'agrupació i facilita la detecció d'objectius petits. 16].
A més, YOLOv3 substitueix l'estructura de xarxa DarkNet-19 de YOLOv2 per la capa d'extracció de funcions DarkNet-53.
La xarxa DarkNet-53, que resol amb èxit el problema del gradient de la xarxa profunda i la pèrdua d'informació original durant l'operació convolucional multicapa per extreure millor les característiques i millorar la detecció i la classificació [17], pren prestada l'estructura de xarxa residual de ResNet [ 18] i utilitza la sortida original de la capa anterior com a part de l'entrada a l'última capa de la xarxa.
Com es mostra a la figura 2, el mòdul residual de YOLOv3 consta de dues capes convolucionals i una capa de drecera.

A més, YOLOv3 utilitza la noció de xarxa de piràmides de característiques (FPN) (19) i introdueix la xarxa de piràmides de característiques per predir mapes de característiques a tres escales, amb escales de detecció de 13 x 13, 26 x 26 i 52 x 52.
El mètode d'extracció de característiques per la xarxa neuronal convolucional és de baix a dalt a la xarxa FPN i el procés de mostreig superior dels mapes de característiques de la capa convolucional és de dalt a baix, tal com es mostra a la figura 3.
2.2. Estructura de agrupació piramidal espacial
L'estructura de agrupació de piràmides espacials (SPP) (20] resol el problema de l'extracció repetida de característiques de la imatge per xarxes neuronals convolucionals i millora molt l'eficiència de detecció; l'estructura de la xarxa SPPNet es mostra a la figura 4.

Per garantir que la resolució de la imatge d'entrada coincideixi amb la dimensió de la característica de la capa totalment connectada en una xarxa neuronal amb una capa completament connectada, calen operacions de retall i escala de regió a la imatge d'entrada.
Els processos d'escala i retall provocaran la pèrdua d'informació de les característiques de la imatge, redueixen la precisió de la detecció i afectaran els resultats de la detecció: tanmateix, els processos d'escala i retall provocaran la pèrdua de la precisió de la detecció de la informació de les característiques de la imatge i afectaran els resultats de la detecció, mentre que SPPNet pot superar les limitacions del mida fixa de la imatge d'entrada, estalviant el cost computacional 21.

3. YOLOv3 millorat
3.1. Estructura de xarxa YOLOv3 millorada
La xarxa d'extracció de característiques bàsiques es mostra habitualment cinc vegades, amb una taxa de mostreig de 2, i la multiplicitat de cinc vegades la baixa de mostreig és de 32 a la cinquena potència de dos, segons la descripció del conjunt de dades COCO.
Si es continua amb el mostreig inferior, el mapa de característiques obtingut serà un i es perdrà la informació de l'objectiu. Els objectius petits tenen menys de 32 × 32 píxels, els objectius mitjans són de 32 × 32–96 × 96 píxels i els objectius gegants són superiors a 96 × 96 píxels [22].
Tal com es mostra a la figura 5, el conjunt de dades de senyals de trànsit TT100K utilitzat en aquest treball estava format principalment per objectius petits i mitjans, amb objectius grans que només representaven el 7,4% del conjunt de dades total i els objectius minúsculs representaven el 42,5% [23].

El conjunt de dades TT100K té una alta resolució, amb cada imatge amb una resolució de 2048 × 2048 píxels i els senyals de trànsit més grans entre els objectius petits representen menys del 0,1% de la imatge sencera, cosa que suposa un repte important per a l'objectiu. ritme de detecció.
Els objectius petits tenen característiques limitades i necessiten una gran precisió de localització.
Malgrat la introducció de l'estructura FPN a YOLOv3 per aprofitar la fusió de característiques multiescala per produir prediccions fusionant les troballes de diferents capes de característiques, que és fonamental per a la identificació d'objectius petits, els resultats encara eren insatisfactoris.
A la xarxa YOLOv3, la capa poc profunda conté menys informació semàntica de característiques però una ubicació objectiu precisa, mentre que la capa profunda té una ubicació objectiu més gruixuda.
Com a resultat, s'utilitzen capes convolucionals poc profundes per predir objectius petits i capes convolucionals profundes per predir objectius grans. Es va afegir una quarta escala de predicció de característiques de mida 152 × 152 a les tres escales de predicció de característiques de l'estructura de la xarxa YOLOv3 per utilitzar plenament les característiques poc profundes de la xarxa per anticipar objectius petits.
Amb una mida de la imatge d'entrada de 608 × 608, la mida de la característiques de la imatge de sortida era de 152 × 152 després de la convolució i un mostreig doble de la imatge d'entrada, i la capa de característiques es va induir a través de la capa d'encaminament; aquesta extracció de característiques es va fusionar amb la característica de capa 11 per augmentar l'escala de predicció de la quarta característica.
A més, es va afegir el mòdul SPP per realitzar la fusió de característiques locals i globals agafant prestada la noció de SPPNet i combinant-la amb YOLOv3.
Abans de la capa de detecció YOLO, el mòdul SPP es va integrar entre la cinquena i la sisena capes convolucionals, i els mapes de característiques del mòdul SPP i els mapes de característiques agrupats es van tornar a connectar i es van passar a la següent capa de xarxa de detecció.

Per aconseguir la fusió a nivell de mapes de característiques de les característiques locals i globals, el nucli màxim d'agrupació del mòdul SPP hauria d'estar el més proper possible a la mida del mapa de característiques que s'ha d'agrupar.
Per minimitzar l'esforç computacional causat pel mòdul SPP, enriquir la capacitat d'expressió del mapa de característiques i augmentar l'impacte de detecció, el mòdul SPP d'aquesta investigació estava compost per dues branques paral·leles, cadascuna de les quals estava formada per una capa de agrupació màxima de 19 × 19 i un salt. connexió. La figura 6 mostra l'estructura de xarxa YOLOv3 millorada.

3.2. Funció de pèrdua millorada
La funció de pèrdua de YOLOv3 es compon de la pèrdua de coordenades centrals (pèrdua), pèrdua de coordenades d'amplada-alçada (pèrdua), pèrdua de confiança (lossconf) i pèrdua de classificació (pèrdues). La pèrdua de coordenades centrals es representa per:

on λcoord denota la pèrdua de pes de coordenades; λnoobj denota la pèrdua de confiança de pes sense un objecte; Iobjij indica si la caixa d'ancoratge jth de la cel·la i és responsable de l'objecte (1 o 0); Inobbyij denota la jª caixa d'ancoratge de la iª quadrícula que no és responsable de l'objecte; (xi,yi,wji,hjI, CjI, Pji) indica les coordenades, la confiança i la categoria de la caixa objectiu predites; i (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) denota les coordenades reals, la confiança i la categoria de la caixa objectiu.
La funció de pèrdua YOLOv3 es representa per l'equació (5), on la funció de pèrdua d'error quadrat mitjà (MSE) s'utilitza per a la regressió del quadre delimitador i l'entropia creuada s'utilitza com a funció de pèrdua en elssconf i locals.
pèrdua=lossxy + losswh − losscon f − losscls (5)
Tanmateix, utilitzar MSE com a funció de pèrdua de la regressió del quadre delimitador és desfavorable per a la detecció d'objectius petits, sensible a l'escala d'objectes i se centra en objectius a gran escala mentre no és amigable amb objectes a petita escala.
Per equilibrar la pèrdua d'objectius grans i petits i maximitzar els resultats de detecció debilitant la influència de la mida del quadre delimitador en la funció de pèrdua d'amplada i alçada, en aquest article es va utilitzar la funció de pèrdua de tipus IoU i la pèrdua mètrica generada per IoU es va utilitzar com a una equació de rendiment (6).
IoU =|A ∩ B||A ∪ B|(6)
Quan el quadre delimitador i el quadre de destinació no es superposen, IoU=0 no reflecteix l'espai de distància entre els dos quadres; quan el quadre de predicció i el quadre etiquetat se superposen completament, IoU=1, el punt central del quadre delimitador no es pot determinar i la bretxa de mida amb el quadre objectiu no es pot optimitzar més.
La pèrdua de DIoU [24] és independent de la mida; per tant, les grans mides no donaran lloc a una gran pèrdua. Com que una mida petita produeix una petita pèrdua, que pot solucionar el problema, aquest treball va utilitzar la pèrdua DIoU, la fórmula de càlcul de la qual es presenta a l'equació (7).
D IoU pèrdua=1 − IoU +ρ2 b, bgt c2(7)
on b i bgt denoten els punts centrals, ρ és la distància euclidiana i c és la longitud diagonal de la caixa més petita que cobreix les dues caixes.
La pèrdua de DIoU minimitza la distància entre dos fotogrames objectiu directament, convergeix ràpidament i està més en línia amb el mecanisme de regressió del fotograma objectiu, que té en compte la distància entre l'objectiu i l'àncora, la taxa de superposició i l'escala, fent que la regressió del fotograma objectiu sigui més estable, alhora que proporciona la direcció del degradat per al quadre delimitador quan no es solapa amb el marc objectiu.

For more information:1950477648nn@gmail.com






