Extracció de paràmetres de característiques millorades dels senyals de parla mitjançant l'algoritme d'aprenentatge automàtic (2)

May 30, 2023

3.7. Conjunt de dades Els processos de recollida i generació del conjunt de dades es van realitzar de la següent manera. En aquest estudi, es va utilitzar el conjunt de dades amb 120 h d'àudio per a l'entrenament del model. El conjunt de dades inclou enregistraments d'àudio de parla que consisteixen en frases amb un màxim de 15 paraules amb una durada total d'aproximadament 120 h.

Desert living cistanche

Ginseng del desert

A més, el conjunt de dades inclou una gran quantitat de text diferent per al desenvolupament del model lingüístic. Es van recollir més de 90.650 enunciats, 415.780 paraules i 65.810 paraules úniques que es van incloure al corpus de text, donant lloc a unes 120 h de dades de parla transcrites. Dividim el conjunt de dades en conjunts de formació, validació i proves. Estadístiques del conjunt de dades

es presenten a la taula 3.

Taula 3. Especificacions del conjunt de dades.

Table 3. The dataset specifications.

Dividim el conjunt de dades en tres carpetes corresponents als conjunts de formació, validació i prova. Cada carpeta conté enregistraments d'àudio i transcripcions. Els noms de fitxer d'àudio i de transcripció corresponents són els mateixos, tret que les gravacions d'àudio s'emmagatzemen com a fitxers WAV, mentre que les transcripcions s'emmagatzemen com a fitxers TXT mitjançant la codificació UTF-8. Totes les transcripcions es representen mitjançant l'alfabet llatí format per 29 lletres i el símbol apòstrof. Per evitar el sobreajustament, hem aplicat tècniques d'augment de dades basades en la pertorbació de la velocitat i la millora espectral.

Cistanche deserticola slice (11)

Cistanche deserticola

4. Mètode proposat

Una tasca important per als programadors a l'hora de desenvolupar sistemes de reconeixement de veu és la creació d'un mètode òptim per a l'expressió paramètrica dels senyals de parla [45]. Aquest mètode permet una excel·lent separació de sons i paraules parlades alhora que garanteix que els parlants siguin insensibles als patrons de pronunciació i als canvis en l'entorn acústic. La majoria dels errors en el reconeixement de paraules són causats per un canvi en el to del senyal a causa d'un canvi en el micròfon o una diferència en el to de la pronunciació [46]. Una altra causa comuna d'errors són les deformacions no lineals aleatòries de la forma de l'espectre, que sempre estan presents en el senyal de parla d'un altaveu [47,48]. Per tant, una de les tasques més importants en la creació de sistemes de reconeixement de parla efectius és la selecció d'una representació que sigui suficient per al contingut del senyal analitzat així com insensible a les veus dels parlants i a diversos entorns acústics.

Cistanche supplement near me—Improve memory2

Suplement de Cistanche a prop meu-Millorant la memòria

El sistema que s'utilitza per extreure paràmetres de característiques normalment té els requisits següents. El contingut informatiu, és a dir, el conjunt de paràmetres de característiques, ha d'assegurar la identificació fiable dels elements de parla recognoscibles. A més, cal minimitzar la sonoritat, és a dir, la màxima compressió del senyal d'àudio, i la correlació no estadística dels paràmetres. També s'ha d'aconseguir la independència del parlant, és a dir, la màxima eliminació de la informació relativa a les característiques del parlant del vector de caràcters. Finalment, s'ha de proporcionar l'homogeneïtat, que es refereix als paràmetres que tenen la mateixa variància mitjana i la capacitat d'utilitzar mètriques senzilles per determinar l'afinitat entre conjunts de caràcters [49]. Tanmateix, no sempre és possible satisfer tots els requisits simultàniament perquè aquests requisits són contradictoris. La descripció paramètrica dels elements de la parla ha de ser prou detallada per distingir-los de manera fiable i ha de ser el més lacònica possible.

Desert living cistanche

Cistanche d'herbes de Superman

A la pràctica, el senyal de veu que es rep d'un micròfon es digitalitza a una freqüència de mostreig de 8 a 22 kHz. Els valors numèrics en sèrie es divideixen en fragments de parla (frames) amb una durada de 10 a 30 ms, que corresponen a parts de parla quasi estacionàries. A partir de cada fotograma es calcula un vector de característiques, que s'utilitza posteriorment al nivell acústic del reconeixement de la parla. Actualment, hi ha una àmplia gamma de mètodes disponibles per a la representació paramètrica de senyals basats en anàlisis d'autocorrelació, filtratge lineal de maquinari, anàlisi espectral i LPC. L'enfocament més comú per a la parametrització de la parla és l'anàlisi espectral de fragments de senyal i el càlcul dels seus coeficients cepstrals.

Els MFCC s'han utilitzat com a característiques informatives per al senyal de parla [41]. Aquestes característiques s'utilitzen àmpliament en el reconeixement de la parla i es basen en dos conceptes principals: les escales cepstral i Mel. Els principals avantatges de l'algoritme són el seu alt nivell de familiaritat i la seva facilitat d'expressió. Les característiques MFCC estan separades dels senyals de parla gravats. L'algoritme MFCC utilitza els resultats dels algorismes de commutació de fonogrames i espectres. L'algorisme clàssic que s'utilitza per calcular els MFCC es mostra a la figura 5.

Figure 5. Classical scheme for calculating MFCCs.

Figura 5. Esquema clàssic de càlcul de MFCC.

Aquest estudi presenta un mètode ràpid per extreure els paràmetres de funció d'un senyal de veu. L'algorisme proposat per al càlcul ràpid dels MFCC es mostra a la figura 6.

Figure 6. Proposed framework for calculating MFCCs.

Figura 6. Marc proposat per al càlcul de MFCC.

Considerem la seqüència d'execució de l'algorisme proposat per a l'extracció ràpida dels paràmetres de la funció d'un senyal de veu.

4.1. Divisió en marcs

Després del filtratge preliminar, el senyal de veu es divideix en trames de 16 ms. Cada fotograma (excepte el primer) conté els 10 ms finals del fotograma anterior. Aquest procés continua fins al final del senyal. En aquest estudi, com que la freqüència de mostreig del senyal de parla és de 16 kHz, la longitud de trama és N=256 i la longitud de compensació és M=160. La superposició és del 62,5 per cent de la longitud del marc. En general, es recomana una cobertura del 50% al 75% de la longitud del marc.

4.2. Finestra de Hanning i valors decreixents

Es va utilitzar una mida de finestra Hanning d'1D. La finestra de Hanning també s'anomena finestra del cosinus elevat. La finestra de Hanning es pot considerar com la suma de l'espectre de freqüències de tres finestres de temps rectangulars. Pot utilitzar els lòbuls laterals per cancel·lar-se mútuament, eliminant les interferències d'alta freqüència i les fuites d'energia. Les finestres Hanning són funcions de finestra molt útils.

cistanche—Improve memory4

Suplement de Cistanche a prop meu-Millorant la memòria

Feu clic aquí per veure els productes Cistanche Improving Memory and Prevent Alzheimer's Disease

【Demanar més】 Correu electrònic:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

S'utilitza una caixa de pes per reduir la distorsió i suavitzar els fotogrames individuals. El senyal flotant que s'examina en aquest estudi consisteix en un to dens. La magnitud del to pla ve determinada per la magnitud del to pur a la freqüència f, que es filtra a través de la finestra de Hanning.

Un aspecte crític d'aquesta finestra és que posa les vores dels fotogrames a zero. En aquest cas, les energies curtes es poden calcular mentre passen per la finestra, i es poden transferir des de la seqüència que s'utilitza per calcular les energies d'amplitud més baixa. L'objectiu és eliminar els senyals de baixa energia del senyal calculant l'energia del senyal mentre suavitza el senyal d'aquesta finestra. Aquest procés requereix la següent equació d'energia del senyal:


image

on En és l'energia del fragment del senyal d'entrada i xi és el valor del senyal.

A més del procés de finestra que utilitza (11), el senyal es processa en el següent pas, la qual cosa redueix significativament el nombre de valors que entren al processador. La figura 7 presenta l'algorisme de processament paral·lel.

La mida de la finestra representa un nombre de mostres i una durada. És el paràmetre principal de l'anàlisi. La mida de la finestra depèn de la freqüència fonamental, la intensitat i els canvis en el senyal.

image

Figura 7. Algorisme de la finestra de Hanning per eliminar peces silencioses. 4.3. Interruptors de transformada de Fourier a temps curt (STFT) Existeix una comprensió intuïtiva del significat d'una alçada alta o baixa. STFT és una transformada relacionada amb Fourier que s'utilitza per determinar la freqüència sinusoïdal i el contingut de fase de les seccions locals d'un senyal a mesura que canvia amb el temps. A la pràctica, el càlcul STFT implica la divisió d'un senyal de temps més llarg en segments més curts d'igual longitud, seguit d'un càlcul separat de la transformada de Fourier a cada segment més curt. Això revela l'espectre de Fourier de cada segment més curt. Els senyals de temps discret són utilitzat a la pràctica. La corresponent conversió temps-freqüència és una conversió discreta de Fourier, que descriu la longitud del senyal Xn com a representativa del domini de freqüència de valor complex dels N coeficients. STFT, que descriu l'evolució dels components de la freqüència al llarg del temps, és una de les eines més utilitzades per a l'anàlisi i processament de la parla [50]. De manera similar al mateix espectre, un avantatge de STFT és que els seus paràmetres tenen interpretacions físiques i intuïtives. STFT normalment es visualitza utilitzant els espectres logarítmics 20log10 (X (h, k)). Aquests espectres de registre 2D es poden visualitzar mitjançant un mapa tèrmic conegut com a espectrograma. En la tercera etapa de l'algorisme, el procediment de commutació espectral STFT s'aplica als fotogrames que passen per la finestra de pes. La STFT del senyal s'obté obrint les finestres i determinant la DFT de cada finestra. En particular, la transformació per a les finestres Xn i Wn del senyal d'entrada es determina de la següent manera:

image

on l'índex k correspon als valors de freqüència, i wn és la funció de finestra, que normalment és una finestra de Hanning o una finestra gaussiana centrada al voltant de zero.

4.4. Transformació de Mel

A la quarta etapa, el senyal que es transfereix a la banda de freqüència es divideix en rangs mitjançant filtres triangulars. Els límits del fifiltre es calculen mitjançant la freqüència de guix. La transició al camp de freqüència de guix es basa en l'equació següent:

image

on f és el rang de freqüències.

L'interruptor invers es determina de la següent manera:

image

Considereu NN com el nombre de fifiltres (generalment s'utilitzen 26 fifiltres) i flflows, tan alt com el rang de freqüències objecte d'estudi. Aquest rang es transfereix a l'escala Mel i es divideix en intervals d'intersecció NN distribuïts uniformement. Els límits lineals adequats a la freqüència es determinen dins del camp fi, mentre que els coeficients de ponderació que s'obtenen a partir de la fifiltració es denoten amb H. Posteriorment, els fifiltres s'apliquen al mòdul quadrat dels coeficients obtinguts de la transformada de Fourier. Els valors que s'obtenen són logarítmics per la següent expressió:

image

L'algorisme de descomposició de valors singulars s'implementa en l'etapa final del càlcul dels MFCC.

5. Resultats experimentals

Hem implementat i provat el mètode proposat a Visual Studio 2019 C plus plus en un ordinador amb una CPU de 4,90 GHz, 32 GB de RAM i dues GPU Nvidia GeForce 2080Ti, tal com es mostra a la taula 4. El sistema es va provar en diferents entorns de dispositius per avaluar el rendiment del mètode d'extracció de característiques del senyal. En els experiments, durant el funcionament de l'algorisme (figura 8), quan la seqüència de superfícies del senyal era n=15, el nombre de valors es va reduir en un 40-50 per cent i el temps de processament va augmentar 1. 2-plega. En conseqüència, aquest algorisme va mostrar una eficiència significativament més alta. A més, aquest algorisme va permetre la separació i eliminació de zones de silenci mentre passava per la finestra de Hanning.

Hi ha diversos mitjans possibles per evitar el malbaratament d'ample de banda de memòria. Proposem una nova solució que augmenta el rendiment informàtic fent coincidir la mida de les trames de senyal amb una mida de bloc de memòria cau. Aquest tipus d'optimització pot afectar significativament el rendiment global del processament paral·lel. Tanmateix, es pot utilitzar en el processament de senyals digitals dividint el senyal en trames mitjançant implementacions en processadors multinucli. Tanmateix, a la pràctica, la selecció es realitza normalment a petita escala, corresponent a l'amplada del bus de dades que connecta la memòria cau amb la memòria principal i la mida del seu bloc. El nostre mètode implementa l'ús òptim d'aquestes memòries en computació paral·lela. L'organització de la memòria cau té un paper essencial en els algorismes de processament paral·lel quan es divideixen les dades en fluxos. En particular, la presència d'efectes de matriu vectorial en el processament de senyal digital i la mida dels seus fluxos s'han d'ajustar segons la mida dels blocs de memòria cau. Això es pot aconseguir mitjançant el mètode proposat, tal com es mostra a la figura 9.

Taula 4. Les especificacions detallades de la configuració experimental.

image

image

figura 8. (a) Senyal d'entrada inicial i (b) aparició del senyal després d'aplicar l'algorisme proposat.

image

Figura 9. Estructura informàtica paral·lela amb processadors RK3288.

En aquesta secció, discutim una anàlisi quantitativa per comparar el rendiment de diferents sistemes. Hem comparat el nostre mètode amb algoritmes de reconeixement de parla coneguts basats en enfocaments d'aprenentatge profund. Les mètriques d'avaluació són essencials per calcular diverses estratègies per al reconeixement de la parla i per avaluar el rendiment de diferents enfocaments. Tot i que hem utilitzat els resultats d'altres estudis per a la comparació, no estem segurs de si són certs perquè els codis font i els conjunts de dades d'aquests mètodes no estan disponibles públicament per verificar el rendiment real. La figura 10 mostra el resultat de l'eliminació de les parts silencioses durant el pas d'un fragment de senyal de parla a través de la finestra de Hanning basant-se en l'algorisme ràpid proposat. Els resultats de velocitat obtinguts de l'anàlisi es presenten a la taula 5.

image

Figura 10. Valor k de l'algorisme KNN (amb selecció de característiques).

Taula 5. Resultats experimentals del mètode proposat.

image

S'ha determinat un rang per tal de trobar el grau del barri que dóna el millor valor de precisió en l'algorisme KNN. L'interval especificat cobreix entre 1 i 25. A la figura 10, es va aplicar el gràfic de l'algorisme KNN amb selecció de característiques. Quan es va examinar el gràfic, quan el valor del barri era 1 al principi, la precisió de l'entrenament era molt superior a la precisió de la prova. A l'algoritme KNN creat amb les característiques seleccionades per correlació, es va determinar que la precisió del model era del 99,15 per cent en el conjunt de dades d'entrenament i del 97,35 per cent en el conjunt de dades de prova.

La taxa d'error de paraula (WER) o la taxa d'error de caràcters s'utilitzen normalment per avaluar la precisió de l'extracció de característiques d'un senyal de parla. Aquestes són matrius objectives que són útils per a una comparació justa de les tècniques de reconeixement. En els nostres estudis anteriors [51–56], vam calcular mètriques com ara la mesura F (FM), la precisió i la memòria. El FM és la mitjana ponderada que equilibra les mesures entre les taxes de precisió i de record. La precisió és la relació entre el nombre d'observacions positives predites correctament i el nombre total d'observacions positives previstes. El record és la relació entre el nombre d'observacions positives predites correctament i el nombre total d'observacions de la classe real, tal com s'indica a (9). Les equacions següents es poden utilitzar per calcular la precisió mitjana i les taxes de record dels mètodes d'extracció de característiques:

image

on TP indica el nombre de positius veritables, FP el nombre de positius falsos i FN el nombre de negatius falsos.

El FM es calcula utilitzant (10), considerant tant la precisió com la memòria.

image

La mitjana de FM, record i precisió del mètode proposat va ser del 98,4 per cent. La detecció falsa es va produir en l'1,6 per cent dels casos a causa del soroll no desitjat dels senyals al micròfon. L'interval de precisió del model estava entre 0 i 1, i les puntuacions d'estimació mètrica van assolir els seus millors valors a 1. A la taula 6 es presenta una avaluació del nostre mètode i d'altres mètodes d'extracció de característiques de la parla publicats recentment. El mateix nombre de característiques es va utilitzar per a una comparació justa. Es van analitzar un total de 325 mostres de parla de cada grup de subjectes amb antecedents similars. També es van examinar els efectes de diferents longituds de fotogrames segons el nombre de bancs de filtres al MFCC i diferents longituds de fotogrames en l'ordre del LPC per millorar la precisió.

Taula 6. Resultats de precisió quantitativa de l'extracció de característiques de la parla.

image

Com s'ha esmentat anteriorment, el WER és la mesura més comuna per al rendiment del reconeixement de parla. Es calcula comparant una transcripció de referència amb la sortida del reconeixement de veu. A partir d'aquesta comparació, és possible calcular el nombre d'errors, que normalment pertanyen a tres categories: (1) insercions quan una paraula no està present a la referència a la sortida del reconeixement automàtic de veu (ASR), (2) eliminacions quan es perd una paraula a la sortida de l'ASR, i (3) substitucions quan una paraula es confon amb una altra. El WER es pot calcular de la següent manera.

image

on S és el nombre de substitucions de paraules que es reconeixen incorrectament, D és el nombre d'eliminacions, I és el nombre d'insercions i N és el nombre de paraules de la transcripció de referència. El problema principal per calcular aquesta puntuació és l'alineació entre les seqüències de dues paraules. Això es pot determinar mitjançant la programació dinàmica utilitzant la distància de Levenshtein [67].

A partir de la taula 6, vam realitzar una anàlisi estadística per indicar la precisió mitjana dels mètodes comparats mitjançant la mètrica d'avaluació WER, tal com es mostra a la figura 11. L'extractor de característiques millorat va obtenir una precisió d'aproximadament el 98,4 per cent, mentre que els altres enfocaments van donar precisió entre 78 per cent i 96 per cent. Hem utilitzat els resultats proporcionats en els documents pertinents per a la comparació; tanmateix, l'exactitud d'aquests valors no és fàcilment verificable perquè els codis font i els conjunts de dades d'aquests mètodes no estan disponibles públicament per confirmar el seu rendiment real. No obstant això, en el cas de les escenes estàndard, es va demostrar experimentalment que el mètode proposat proporciona una excel·lent precisió d'extracció de característiques de la parla reduint el temps de càlcul, fins i tot quan les dades de la parla són sorolloses o de baixa qualitat.

Figure 11. Quantitative results of speech signal feature extraction approaches using vertical graphs.

Figura 11. Resultats quantitatius dels enfocaments d'extracció de característiques del senyal de parla mitjançant gràfics verticals.

A més, vam avaluar els resultats falsos positius dels mètodes seleccionats. Com es pot observar a la figura 12, l'enfocament proposat va tenir menys errors. A més, el mètode de càlcul paral·lel altament eficient va reduir significativament els errors d'extracció i selecció de característiques del senyal de so. L'ajustament excessiu va ser un dels principals problemes durant la formació, i gairebé tots els models d'aprenentatge automàtic ho pateixen. Hem intentat reduir el risc d'ajustament excessiu mitjançant una tècnica de selecció de característiques que pretén, en canvi, classificar la importància de les característiques existents al conjunt de dades i descartar-ne les menys importants (no es creen característiques noves).

image

Figura 12. Resultats visibles dels experiments d'extracció de característiques de senyal de parla fals positius.

La taula 7 mostra els resultats de rendiment dels mètodes que es van utilitzar en entorns de reconeixement de veu en funció de diferents propietats. El nostre enfocament proposat no pateix sorolls de fons no desitjats i innecessaris i no es veu afectat per veus humanes de baixa qualitat, com ara veus ronques, veus produïdes amb mal de coll o fins i tot sons d'humans amb pèrdua total de veu. El nostre mètode pretén superar els problemes de l'equip d'enregistrament inadequat, el soroll de fons, els accents i dialectes difícils i els diferents tons d'una veu. En un entorn normal, els millors resultats per detectar i extreure amb precisió els reptes de les característiques de la parla es van obtenir mitjançant el mètode proposat amb un temps de processament reduït.

Taula 7. Revisió del rendiment de detecció i extracció de funcions de parla mitjançant diverses funcions.

image

Els resultats dels mètodes de reconeixement de la parla es van classificar com a potents, normals o febles per a les set categories. El poderós criteri demostra que l'algoritme pot superar tot tipus de reptes. En canvi, el criteri normal indica que l'algorisme pot fallar en determinats casos perquè els límits de les paraules no estan definits prèviament. Finalment, el criteri feble suggereix que l'algorisme no és fiable sota soroll de fons o vibracions.

6. Limitacions

És difícil concloure que els mètodes proposats fins ara no presenten cap mancança. El nostre mètode proposat també pot provocar errors a causa de diversos ambients de soroll. Per superar aquest problema, teníem com a objectiu reduir el nombre de característiques del conjunt de dades creant noves característiques a partir de característiques existents [69]. Atès que el sobreajust era un dels principals problemes per entrenar diferents models durant la competició, enriquir les dades d'entrenament afegint mostres de dades de diferents recursos podria ser una possible solució per millorar els resultats. Independentment dels problemes esmentats anteriorment, els resultats experimentals van revelar que el nostre mètode era molt robust i eficaç per a les tasques d'extracció de característiques de la parla, amb una precisió mitjana del 98,4% i FM del 99,5%.

7. Conclusions

S'ha proposat un nou enfocament informàtic paral·lel d'alt rendiment que utilitza un mètode d'aprenentatge automàtic per als sistemes de reconeixement de veu. Els problemes d'acceleració en màquines amb recursos informàtics limitats es poden resoldre mitjançant sistemes distribuïts. Es pot augmentar la velocitat de càlcul en els sistemes de reconeixement de senyals i es pot millorar el rendiment de les plataformes multinucli mitjançant la creació i l'ús d'algoritmes eficients i ràpids. Els resultats demostren que el model proposat redueix el temps de processament i millora la precisió d'extracció de característiques en un 98,4 per cent mitjançant l'ús eficaç de MFCC. S'ha observat que les característiques amb valors de correlació baixos extretes mitjançant la selecció de característiques també són efectives en l'èxit del model. L'anàlisi estadística es va realitzar amb les dades preprocessades i es va produir informació significativa a partir de les dades mitjançant l'algoritme d'aprenentatge automàtic K-nearest neighbors (KNN).

Els estudis futurs se centraran a millorar la precisió del nostre mètode mitjançant l'ús d'enfocaments d'aprenentatge profund i l'optimització de la memòria cau dels processadors multinucli per detectar i extreure senyals de parla sense una pèrdua de qualitat significativa. A més, tenim previst construir un model d'anàlisi espectral basat en un processament paral·lel amb un rendiment d'anàlisi robust que permetrà l'establiment de dispositius incrustats amb baixos recursos computacionals mitjançant conjunts de dades de veu Taris [70] a l'entorn 3D CNN i 3D U-Net [71– 75]

Referències

1. Meng, YJ; Liu, WJ; Zhang, RZ; Du, HS Extracció i reconeixement de paràmetres de funció de parla basats en la interpolació. Appl. Mech. Mater. 2014, 602–605, 2118–2123. [CrossRef] 2. Musaev, M.; Rakhimov, M. Entrenament accelerat per a xarxes neuronals convolucionals. A Proceedings of the 2020 International Conference on Information Science and Communication Technologies (ICISCT), Tashkent, Uzbekistan, 4–6 November 2020; pàgines 1–5. [CrossRef] 3. Ye, F.; Yang, J. Un model de xarxa neuronal profunda per a la identificació d'altaveus. Appl. Ciència. 2021, 11, 3603. [CrossRef] 4. Musaev, M.; Rakhimov, M. A Method of Mapping a Block of Main Memory to Cache in Parallel Processing of the Speech Signal. A Proceedings of the 2019 International Conference on Information Science and Communication Technologies (ICISCT), Karachi, Pakistan, del 9 al 10 de març de 2019; pàgines 1–4. [CrossRef] 5. Jiang, N.; Liu, T. Un algorisme de segmentació i agrupació de la parla millorat basat en SOM i k-means. Matemàtiques. Probl. Eng. 2020, 2020, 3608286. [CrossRef] 6. Hu, W.; Yang, Z.; Chen, C.; Sol, B.; Xie, Q. Un enfocament de segmentació de vibracions per al sistema multiacció de la torreta de control numèric. Procés de vídeo d'imatge de senyal. 2021, 16, 489–496. [Ref creuat]

7. Popescu, TD; Aiordachioaie, D. Detecció de fallades dels coixinets d'elements rodants mitjançant la segmentació òptima dels senyals vibratoris. Mech. Syst. Procés del senyal. 2019, 116, 370–391. [CrossRef] 8. Shihab, MSH; Aditya, S.; Setu, JH; Imtiaz-Ud-Din, KM; Efat, MIA Una tècnica híbrida d'extracció de característiques GRU-CNN per a la identificació dels altaveus. A Proceedings of the 2020 23rd International Conference on Computer and Information Technology (ICCIT), Dhaka, Bangla Desh, 19-21 de desembre de 2020; pàgines 1–6. [CrossRef] 9. Korkmaz, O.; Atasoy, A. Reconeixement d'emocions a partir del senyal de parla mitjançant coeficients cepstrals de freqüència mel. A Proceedings of the 9th International Conference on Electrical and Electronics Engineering (ELECO), Bursa, Turquia, del 26 al 28 de novembre de 2015; pàgines 1254–1257. 10. Ayvaz, U.; Gürüler, H.; Khan, F.; Ahmed, N.; Whangbo, T.; Abdusalomov, A. Reconeixement automàtic d'altaveus utilitzant coeficients cepstrals de freqüència Mel a través de l'aprenentatge automàtic. CMC-Informàtica. Mater. Continuació. 2022, 71, 5511–5521. 11. Al-Qaderi, M.; Lahamer, E.; Rad, A. Un sistema d'identificació d'altaveus de dos nivells mitjançant la fusió de classificadors heterogenis i la cooperació de funcions complementàries. Sensors 2021, 21, 5097. [CrossRef] 12. Batur Dinler, Ö.; Aydin, N. Un conjunt de paràmetres de característiques òptimes basat en xarxes neuronals recurrents d'unitat recurrent amb porta per a la detecció de segments de parla. Appl. Ciència. 2020, 10, 1273. [CrossRef] 13. Kim, H.; Shin, JW Millora de la parla amb micròfon dual basada en TF-GSC amb supressió de fuites i recuperació del senyal. Appl. Ciència. 2021, 11, 2816. [CrossRef] 14. Lee, S.-J.; Kwon, H.-Y. Una estratègia de preprocessament per a la reducció de soroll de dades de parla basada en la detecció de segments de parla. Appl. Ciència. 2020, 10, 7385. [CrossRef] 15. Rusnac, A.-L.; Grigore, O. Arquitectures CNN i mètodes d'extracció de característiques per al reconeixement imaginari de la parla EEG. Sensors 2022, 22, 4679. [CrossRef] [PubMed] 16. Wafa, R.; Khan, MQ; Malik, F.; Abdusalomov, AB; Cho, YI; Odarchenko, R. L'impacte de la metodologia àgil en l'èxit del projecte, amb un paper moderador de l'adaptació laboral de la persona a la indústria informàtica del Pakistan. Appl. Ciència. 2022, 12, 10698. [CrossRef] 17. Aggarwal, A.; Srivastava, A.; Agarwal, A.; Chahal, N.; Singh, D.; Alnuaim, AA; Alhadlaq, A.; Lee, H.-N. Extracció de funcions bidireccionals per al reconeixement d'emocions de la parla mitjançant l'aprenentatge profund. Sensors 2022, 22, 2378. [CrossRef] [PubMed] 18. Marini, M.; Vanello, N.; Fanucci, L. Optimització dels paràmetres d'extracció de funcions dependents de l'altaveu per millorar el rendiment del reconeixement automàtic de la parla per a persones amb disartria. Sensors 2021, 21, 6460. [CrossRef] 19. Tiwari, S.; Jain, A.; Sharma, Alaska; Almustafa, KM Fonocardiograma basat en senyals multiclasse Sistema de suport a la presa de decisions per al diagnòstic cardíac. Accés IEEE 2021, 9, 110710–110722. [CrossRef] 20. Mohtaj, S.; Schmitt, V.; Möller, S. Un model basat en l'extracció de característiques per a la identificació del discurs de l'odi. arXiv 2022, arXiv: 2201.04227. 21. Kuldoshbay, A.; Abdusalomov, A.; Mukhiddinov, M.; Baratov, N.; Makhmudov, F.; Cho, YI Una millora per al mètode de classificació automàtica d'imatges d'ultrasò utilitzats a CNN. Int. J. Wavelets Multiresolució Inf. Procés. 2022, 20, 2150054. 22. Passricha, V.; Aggarwal, RK Un híbrid de CNN profund i LSTM bidireccional per al reconeixement automàtic de la veu. J. Intel. Syst. 2020, 29, 1261–1274. [CrossRef] 23. Mukhamadiyev, A.; Khujayarov, I.; Djuraev, O.; Cho, J. Mètode de reconeixement automàtic de la parla basat en enfocaments d'aprenentatge profund per a la llengua uzbeka. Sensors 2022, 22, 3683. [CrossRef] [PubMed] 24. Li, F.; Liu, M.; Zhao, Y.; Kong, L.; Dong, L.; Liu, X.; Hui, M. Extracció de característiques i classificació del so cardíac mitjançant xarxes neuronals convolucionals 1D. EURASIP J. Adv. Procés del senyal. 2019, 2019, 59. [CrossRef] 25. Chang, L.-C.; Hung, J.-W. Un estudi preliminar d'extracció de característiques de parla robusta basat en la maximització de la probabilitat d'estats en models acústics profunds. Appl. Syst. Innov. 2022, 5, 71. [CrossRef] 26. Ramírez, J.; Górriz, JM; Segura, JC Detecció d'activitat de veu. Fonaments i robustesa del sistema de reconeixement de veu. En reconeixement i comprensió de la parla robusta; Grimm, M., Kroschel, K., Eds.; I-TECH Education and Publishing: Londres, Regne Unit, 2007; pàgines 1–22. 27. Oh, S. DNN Mètode d'extracció de funcions de parla robusta i eliminació de soroll de senyal mitjançant un filtre LMS de predicció mitjana millorat per al reconeixement de la parla. J. Converg. Inf. Tecnol. 2021, 11, 1–6. [CrossRef] 28. Abbaschian, BJ; Sierra-Sosa, D.; Elmaghraby, A. Tècniques d'aprenentatge profund per al reconeixement d'emocions de la parla, des de bases de dades fins a models. Sensors 2021, 21, 1249. [CrossRef] 29. Rakhimov, M.; Mamadjanov, D.; Mukhiddinov, A. A High-Performance Parallel Approach to Image Processing in Distributed Computing. A Proceedings of the 2020 IEEE 14th International Conference on Application of Information and Communication Technologies (AICT), Uzbekistan, Tashkent, 7–9 October 2020; pàgines 1–5. [CrossRef] 30. Abdusalomov, A.; Mukhiddinov, M.; Djuraev, O.; Khamdamov, Estats Units; Whangbo, TK Extracció automàtica d'objectes destacats basada en un llindar adaptatiu localment per generar gràfics tàctils. Appl. Ciència. 2020, 10, 3350. [CrossRef] 31. Abdusalomov, A.; Whangbo, TK Una millora per al mètode de reconeixement de primer pla mitjançant la tècnica d'eliminació d'ombres per a entorns interiors. Int. J. Wavelets Multiresolució Inf. Procés. 2017, 15, 1750039. [CrossRef] 32. Abdusalomov, A.; Whangbo, TK Detecció i eliminació d'ombres d'objectes en moviment mitjançant informació de geometria i color per a fluxos de vídeo interiors. Appl. Ciència. 2019, 9, 5165. [CrossRef] 33. Mery, D. Computer Vision for X-ray Testing; Springer International Publishing: Cham, Suïssa, 2015; pàg. 271, ISBN 978-3319207469. 34. Mark, S. Les imatges de la parla recalibren els límits de la parla i la percepció. Atenció. Percepció. Psicofísica. 2016, 78, 1496–1511. [CrossRef] 35. Mudgal, E.; Mukuntharaj, S.; Modak, MU; Rao, YS Reconeixement de veu en temps real basat en plantilles mitjançant filtres digitals a DSP-TMS320F28335. A Proceedings of the 2018 Fourth International Conference on Computing Communication Control and Automation (ICCUBEA), Pune, Índia, 16-18 d'agost de 2018; pàgines 1–6. [Ref creuat]

Potser també t'agrada