Pētījums par audio atpazīšanu, pamatojoties uz dziļo neironu tīklu mūzikas mācībā
Oct 10, 2023
Solfedžo ir svarīgs mūzikas pamatkurss, un audio atpazīšanas apmācība ir viena no svarīgajām saitēm. Uzlabojoties datora veiktspējai, audio atpazīšana ir plaši izmantota viedās valkājamās ierīcēs. Pēdējos gados dziļās mācīšanās attīstība ir paātrinājusi audio atpazīšanas izpētes procesu. Tomēr mūzikas mācību vidē ir daudz skaņas traucējumu, kas noved pie audio klases izpildījuma, kas nevar apmierināt faktisko pieprasījumu. Lai atrisinātu šo problēmu, tiek piedāvāta uzlabota audio atpazīšanas sistēma, kuras pamatā ir YOLO-v4, kas galvenokārt uzlabo tīkla struktūru.
Redzes dziedāšana un ausu apmācība nav atdalāmas no atmiņas. Mūzikas apguves procesā redzes dziedāšana un ausu trenēšana ir ļoti svarīga prasme. Dziedošās auss apmācības mērķis ir ļaut skolēniem praktizēt savas muzikālās prasmes un atmiņu, klausoties un dziedot noteiktas notis.
Dziedošās auss apmācības galvenais saturs ietver augstumu, ritmu, balsi, melodiju, harmoniju utt. Izmantojot redzes dziedāšanas ausu apmācību, mēs varam nepārtraukti vingrot ausis, ļaujot precīzāk noteikt dažādas notis un ritmus, kā arī ātri konvertēt notis, ko dzirdam, pārvērš simbolos mūzikas kartē, tādējādi uzlabojot mūsu spēju atcerēties.
Redzes dziedāšana un ausu apmācība var arī palīdzēt mums labāk izprast un apgūt mūzikas likumus. Izmantojot ausis, lai tieši sajustu un saprastu mūziku, mēs varam dziļāk izprast mūzikas ritmu un melodiju, tādējādi ātrāk uzlabojot savas atmiņas spējas.
Turklāt redzes dziedāšana un ausu apmācība var arī palīdzēt mums attīstīt labu mūzikas izjūtu un spēcīgas muzikālas emocijas. Pateicoties apmācībai, mūsu izpratne un sajūtas par mūziku kļūs arvien dziļākas, tādējādi uzlabojot mūsu mīlestību un izpratni par mūziku.
Atmiņa ir ļoti svarīgs faktors mūzikas apguves procesā. Labas atmiņas prasmes ir viens no nepieciešamajiem nosacījumiem jebkura instrumenta apguvei un mūzikas komponēšanai. Izmantojot redzes dziedāšanu un ausu apmācību, mēs varam uzlabot atmiņu un labāk apgūt mūzikas paņēmienus un prasmes. Saskaroties ar sarežģītu repertuāru, mēs ātrāk atceramies notis un ritmus, palīdzot labāk izpildīt mūzikas darbus.
Īsāk sakot, redzes dziedāšanas auss apmācība un atmiņa nav atdalāmas, un abas papildina viena otru. Ar nepārtrauktu redzes dziedāšanas un ausu apmācības apmācību mēs varam uzlabot savas muzikālās prasmes un atmiņas spējas, lai labāk apgūtu mūziku. Var redzēt, ka mums ir jāuzlabo atmiņa, un Cistanche deserticola var ievērojami uzlabot atmiņu, jo Cistanche deserticola ir tradicionāls ķīniešu ārstniecības materiāls, kam ir daudz unikālu efektu, no kuriem viens ir atmiņas uzlabošana. Maltās gaļas efektivitāti nodrošina dažādas tajā esošās aktīvās sastāvdaļas, tostarp skābe, polisaharīdi, flavonoīdi utt. Šīs sastāvdaļas var dažādos veidos veicināt smadzeņu veselību.

Noklikšķiniet uz zināt veidus, kā uzlabot smadzeņu darbību
Pirmkārt, Mel frekvences cepstrum numurs tiek izmantots, lai apstrādātu sākotnējo audio un iegūtu atbilstošās funkcijas. lv, mēģiniet pielietot YOLO-v4 modeli ... dziļās mācīšanās jomā ... audio atpazīšanas jomā un uzlabot to, apvienojot to ar telpiskās piramīdas baseina moduli, lai stiprinātu datu vispārināšanas spēju dažādos audio formātos. Otrkārt, grupēšanas metode ansambļa apguvē tiek izmantota, lai sapludinātu divu dažādu kanālu neatkarīgos apakšmodeļus. Eksperimentu rezultāti liecina, ka, salīdzinot ar citām dziļās mācīšanās tehnoloģijām, uzlabotais YOLO-v4 modelis var uzlabot audio atpazīšanas veiktspēju, un tam ir labāka veiktspēja dažādu audio formātu datu apstrādē, kas liecina par labāku vispārināšanas spēju.
1. Ievads
Mūzika ir abstrakta mākslas forma, kuras izteiksmes līdzeklis ir skaņa. Mūzikas mācīšanas procesā solfedžo var stiprināt skolēnu muzikālās atmiņas spējas, dot iespēju skolēniem precīzi atpazīt mūzikas darbus un tādējādi iegūt labāku "mūzikas uztveri". Kā svarīga saikne solfedžo, audio atpazīšanas apmācība ir ļoti sarežģīta jaunākajiem studentiem. Tas ir tāpēc, ka skolēniem ir jāapgūst visa veida atslēgas, jānošķir dažādu nošu garums un ilgums, kā arī dažādu nošu toņu atšķirība.
Audio signālu analīze, kuras pamatā ir iegultās viedās ierīces, ir piesaistījusi arvien vairāk pētnieku uzmanību [1–7]. Viedās valkājamas ierīces ar audio atpazīšanas funkcijām var palīdzēt skolēniem atrisināt iepriekš minētās problēmas un realizēt mūzikas mācīšanas palīdzību. Audio atpazīšanas uzdevumam ir nepieciešams iepriekš apstrādāt savāktos audio signālus …atpūsties, iegūt vērtīgas īpašības, lai no tiem atšķirtu mūzikas partitūras, un … visbeidzot tos klasificēt atbilstoši šīm pazīmēm. Klasifikācija ir ļoti svarīga datu ieguves metode [8–10]. Klasifikācija…kācijas attiecas uz klasiskās…katācijas funkcijas ģenerēšanu saskaņā ar noteiktiem noteikumiem, pamatojoties uz apmācību kopas datiem. is funkcija var kartēt testa kopas datus vienā no dotajām kategorijām, tādējādi realizējot nezināmu datu kategoriju prognozēšanu. Pašlaik plaši izplatītie klasiskie ir lēmumu koki, loģistikas regresija, atbalsta vektoru mašīna (SVM), Naive Bayes, k-tuvākā kaimiņa algoritms (KNN), BP neironu tīkls un dziļā mācīšanās [11–13].
Iepriekšējām mašīnmācīšanās metodēm bieži ir manuāli jāizņem līdzekļi, kas var attēlot sākotnējos datus kā klases ievadi. Tomēr dziļā mācīšanās var automātiski iegūt paraugu augstas dimensijas iezīmes (bez manuālas funkciju ekstrakcijas), ja vien ievades dati pēc iespējas vairāk aptver sākotnējo datu informāciju, kas ir piemērota liela mēroga datiem. *Padziļinātā apmācības metode var realizēt konkrētus audio atpazīšanas uzdevumus, izmantojot lielu audio datu apjomu, ko savāc viedās ierīces. *Konvolucionālais neironu tīkls (CNN), kā sava veida dziļās mācīšanās arhitektūra, tiek plaši izmantots attēlu klasifikācijā, runas atpazīšanā, dabiskās valodas apstrādē un citās jomās, jo tam ir izcila veiktspēja vietējo funkciju apguvē [14]. Atšķirībā no citiem neironu tīklu modeļiem (piemēram, Boltzmann mašīna un atkārtots neironu tīkls), CNN raksturo tas, ka galvenā darbība ir konvolūcijas darbība. *e YOLO tīkls gūst mācības no CNN klasifikācijas tīkla struktūras un parāda labas priekšrocības attēlu atpazīšanas jomā, kas ir piesaistījusi daudzu pētnieku uzmanību.
*Tāpēc šis pētījums mēģina pielietot YOLO-v4 modeli audio atpazīšanas jomā un uzlabo tā tīkla struktūru. Turklāt grupēšanas metode ansambļa apguvē tiek izmantota, lai sapludinātu divus neatkarīgus dažādu kanālu apakšmodeļus, un sapludinātās sistēmas klasifikācijas veiktspēja ir vēl vairāk uzlabota salīdzinājumā ar vienu apakšmodeli.
2. Saistītie darbi
Mūsdienās, parādoties lielam skaitam viedierīču, izcila datora veiktspēja un dziļās mācīšanās tehnoloģiju attīstība ir kopīgi veicinājusi pētniecības procesu audio jomā. Apvienojumā ar šī pētījuma galveno pētījuma saturu pašreizējais pētījuma statuss tiks iepazīstināts no diviem aspektiem: konvolucionālais neironu tīkls un audio atpazīšana.
*Konvolucionālā neironu tīkla struktūra radās no Jana Lekuna pētījuma 1998. gadā, ko sauca par Le Net{1}} mākslīgo neironu tīklu. *Konvolucionālo neironu tīklu, tāpat kā citus neironu tīklus, var apmācīt ar atpakaļejošās izplatīšanas algoritmu [15]. 2012. gadā Alekss Križevskis un citi pirmo reizi pieņēma CNN tehnoloģiju sarežģītos datorredzes uzdevumos. Izmantojot 3 pilnībā savienotus slāņus, 5 konvolūcijas slāņus un Softmax klasifikatoru, tiek izveidots konvolucionālais neironu tīkls ar 8 slāņiem, kas tiek nosaukts AlexNet. AlexNet izmanto ReLU aktivizēšanas funkciju, un tajā pašā laikā tas izmanto arī regularizāciju (dropout), lai novērstu pārmērību. 2014. gadā Google datorredzes komanda izvirzīja GoogLeNet tīklu [16] ar 22 slāņu tīkla dziļumu, kas satur jaunu struktūru, incidentu. Tas integrē dažādu dziļumu un viena mēroga funkcijas, un tiek uzlabota noteikšanas precizitāte. Pamatojoties uz GoogLeNet tīklu, parādījās YOLO un SSD algoritmi. Abas metodes ir balstītas uz vienu pilnīgu tīklu, kas var pabeigt ievadi no sākotnējā attēla līdz objekta pozīcijas un kategorijas izvadei.
Audio atpazīšanas aspektā Yang un Zhao [17] ierosināja akustisko ainu klasifikācijas metodi, kuras pamatā ir atbalsta vektora mašīna (SVM), kas uzlaboja skaņas tekstūru, lai uzlabotu klasifikācijas precizitāti. Greko et al. [18] ierosināja balss atpazīšanas sistēmu, kuras pamatā ir heiristiskā dziļās mācīšanās metode. Demirs u.c. [19] ierosināja jaunu piramīdas kaskādes CNN metodi vides skaņas klasifikācijai. Zhu et al. [20] piedāvāja uzlabotu YOLO-v4 algoritmu skaņas attēlveidošanas instrumentiem, kas efektīvi uzlaboja akustiskās fāzes mākoņa attēla noteikšanas precizitāti. *Visas iepriekš minētās metodes parāda izcilu veiktspēju, veicot audio atpazīšanas uzdevumus vienā akustiskā ainā, taču mūzikas mācību vidē ir daudz skaņas traucējumu, un ir nepieciešams apstrādāt dažādus audio formāta datus.
*Tāpēc šajā pētījumā tiek piedāvāta audio atpazīšanas sistēma, kuras pamatā ir uzlabotais YOLO-v4 tīkla modelis. *Galvenie jauninājumi un ieguldījumi ir šādi: (1) mēģiniet pielietot YOLO-v4 tīkla arhitektūru, kas ir izcila dziļās mācīšanās jomā, audio atpazīšanas jomā un uzlabot to, apvienojot telpiskās piramīdas baseina moduli. *Uzlabotā YOLO-v4 tīkla arhitektūra efektīvi izmanto audio failu telpisko informāciju, tādējādi stiprinot datu vispārināšanas spēju dažādos audio formātos. (2) *E grupēšanas metode ansambļa apguvē tiek izmantota, lai sapludinātu divus neatkarīgus dažādu kanālu apakšmodeļus, un tiek uzlabota sapludinātās sistēmas klasifikācijas veiktspēja.
3. Audio funkciju iegūšana un apstrāde
Labākā audio signāla parametru attēlojuma iegūšana ir viens no svarīgākajiem uzdevumiem, lai nodrošinātu labāku atpazīšanas veiktspēju. *e Iezīmju iegūšana šajā posmā ir ļoti svarīga klasifikatora klasifikācijai nākamajā posmā, jo tā tieši ietekmēs klasifikācijas efektivitāti.
Klasifikācijas uzdevumā, īpaši audio klasifikācijas uzdevumā, Mel frekvences cepstrum koeficientam (MFCC), kas raksturo spektrālo formu, ir sena vēsture. Lai gan MFCC iegūšanas process izraisīs datu saspiešanu ar zaudējumiem, tā klasifikācija un atpazīšanas efekts ir diezgan pieejams pat tad, ja datu pārraides ātrums ir ļoti zems. Turklāt, salīdzinot ar citām klasifikācijas pazīmēm, MFCC tiek plaši izmantots, jo tas vairāk atbilst cilvēka ausu dzirdes frekvences reakcijas līknei.

*Iemesls, kāpēc cilvēki sarežģītās skaņas vidēs var spriest par dažādām vidēm, ir gliemežnīcas nopelns. *e cochlea var uzskatīt par filtru banku, lai palīdzētu cilvēkiem filtrēt 20-20 kHz audio. *Problēma ir tāda, ka gliemežnīcas jutība pret frekvencēm dzirdes diapazonā nav lineāra, taču pastāv kartēšanas sakarība. MFCC var simulēt cilvēka auss frekvences reakciju. MFCC funkciju ieguve sastāv no septiņām darbībām, un viss process ir parādīts 1. attēlā.
Parastiem audio signāliem ir tāda parādība, ka zemas frekvences enerģija ir liela, bet augstfrekvences enerģija ir maza. Ja tas tiek pārraidīts tieši, tas izraisīs augstu signāla-trokšņa attiecību zemās frekvencēs un nepietiekamu signāla-trokšņa attiecību augstās frekvencēs. Lai kompensētu šo audio signāla zudumu pārraides laikā, tiek ieviests priekšuzsvars, lai kompensētu ieejas signālu, lai varētu izcelt audio signāla augstfrekvences raksturlielumus. Uzsvars parasti tiek panākts, izmantojot augstfrekvences filtru [21–23].

Kadrēšana sadala audio paraugus, kas iegūti no analogās-digitālās konvertēšanas (ADC) mazos kadros, kuru garums ir diapazonā no 20 līdz 40 milisekundēm. Kad priekšuzsvars un kadrēšana ir pabeigta, katram rāmim jāpievieno Haminga logs. Logu veidošana ir paredzēta datu apstrādes apjoma kontrolei, un vienlaikus tiek apstrādāti tikai logā esošie dati. *e frekvenču diapazons ātrā Furjē transformācijas spektrā ir ļoti plašs, kas noved pie tā, ka runas signāls neatbilst lineārajai skalai [24–26]. *tāpēc ir nepieciešams izlaist Mel skalas filtru banku, kā parādīts 2. attēlā.
2. attēlā parādīta trīsstūrveida filtru kopa, ko izmanto, lai aprēķinātu filtru spektrālo komponentu svērto summu, lai apstrādātā izvade tuvinātu Mel skalu. *Katra filtra amplitūdas-frekvences reakcija ir trīsstūrveida. *e Mel spektru noteiktai frekvencei f aprēķina šādi:

13 pirmās kārtas diferenciālās pazīmes atspoguļo izmaiņas starp cepstrum kadriem MFCC pazīmēs, savukārt 39 otrās kārtas diferenciālās pazīmes atspoguļo izmaiņas starp kadriem pirmās kārtas diferenciālajās pazīmēs. * Pirmās kārtas starpība tiek aprēķināta šādi:

4. SPP-YOLO-v4 tīkla struktūra
4.1. Telpiskās piramīdas baseina (SPP) modulis. SPP var izvairīties no informācijas izkropļojumiem, ko izraisa mērogošana, stiepšana, apgriešana un citas darbības, un nodrošināt izvadi, ko neietekmē ievades lielums, ko nevar panākt ar bīdāmo logu apvienošanas tehnoloģiju [27]. Otrkārt, SPP var apvienot ar vairākām skalām, savukārt bīdāmo logu apvienošanai tiek izmantota tikai viena loga skala. *SPP moduļa pamatstruktūra ir parādīta 3. attēlā. Redzams, ka, tā kā ievades lielums ir elastīgs, SPP var apvienot datu īpašības dažādos audio formātos. *Transformētā pazīmju vektora dimensija ir tāda pati kā pilnībā savienotā slāņa dimensija, vienlaikus mazinot vispārināšanas problēmu.
4.2. SPP-YOLO-v4. YOLO-v4 ir augstas precizitātes reāllaika vienpakāpes noteikšanas algoritms, kas integrē YOLO-v1, YOLO-v2 un YOLO-v3. YOLO-v4 konstruē CSP pārrobežu daļējo tīklu (CSPNet) atlikušajā modulī, kurā iezīmju slānis ir ieeja un augstākā slāņa līdzekļu informācija ir izvade. * parāda, ka YOLO-v4 mācību mērķi ResNet modulī atšķiras starp izvadi un ievadi. *Tāpēc tiek realizēta atlikušā mācīšanās un samazināti modeļa parametri, tādējādi uzlabojot funkciju apguves spējas. Ņemot vērā mūzikas mācīšanas pielietojuma vidi, tiek veiktas dažas izmaiņas, pamatojoties uz sākotnējo tīklu, un galīgā tīkla struktūra ir parādīta 4. attēlā.
Pirmkārt, objektu slānis tiek salocīts trīs reizes, un pēc tam ievades līdzekļu slānis tiek maksimāli apvienots, izmantojot dažādu izmēru maksimālos apvienotos kodolus. Pēc konvolūcijas un augšējo paraugu ņemšanas dažādi pazīmju slāņi tiek virknē savienoti, lai realizētu iezīmju saplūšanu. *lv, veiciet paraugu samazināšanu, saspiediet augstumu un platumu un, visbeidzot, salieciet ar iepriekšējo līdzekļa slāni, lai iegūtu vairāk funkciju sapludināšanas (5 reizes). * Klasifikācijas modulis izmanto no tīkla iegūtos līdzekļus, lai pieņemtu klasifikācijas spriedumus. Kā piemēru ņemam 13 × 13 režģi, kas ir vienāds ar ievades Mel spektrogrammas sadalīšanu 13 × 13 kvadrātos; tad katrs kvadrāts tiks iepriekš iestatīts ar trim iepriekšējiem kadriem. *Tīkla klasifikācijas rezultāti pielāgos šo trīs iepriekšējo lodziņu pozīcijas un visbeidzot filtrēs pēc nemaksimālās slāpēšanas (NMS) algoritma [28], lai iegūtu galīgos klasifikācijas rezultātus.

5. Audio atpazīšanas sistēma, kuras pamatā ir SPPYOLO-v4
5.1. Sistēmas arhitektūra. Kā parādīts 5. attēlā, pēc audio ievades piedāvātā audio atpazīšanas sistēma vispirms sadala audio secības datus divās daļās. *Pirmā daļa nāk no stereo kanāla, bet otrā daļa ir saspiesta mono. *Abu kanālu audio signāli tiek iegūti ar MFCC spektrogrammu un kā funkcijas tiek ievadīti SPP-YOLO-v4 modelī. *lv, ir integrētas divas SPP-YOLO-v4 modeļu grupas, un integrācijā tiek izmantota sakraušanas metode. Pēc abu modeļu integrētas apguves beidzot tiek izvadīti audio klasifikācijas rezultāti. * SPP-YOLO-v4 modeļa informācija ir parādīta 4. attēlā.
5.2. Integrētās mācīšanās sakraušana. Kā parādīts 5. attēlā, sistēma izmanto ansambļa mācīšanās tehnoloģiju, lai iegūtu galīgo klasifikācijas rezultātu. *Ansambļa mācīšanās pamatideja ir izveidot spēcīgu klasifikatoru, apvienojot vairākus vājus klasifikatorus. Pat ja daži vāji klasifikatori izdara nepareizas prognozes, tos var labot citi vāji klasifikatori ar pareizām prognozēm, tādējādi panākot sistēmas veiktspējas uzlabošanas efektu.
Pieņemot, ka x ir ievade, mi (i � 1, 2, ... 2, . . . , k), integrētā klasifikatora galīgo izvadi y(x) var izteikt kā


klasifikācijas mērķis. Pašlaik populārie ansambļa apguves algoritmi ietver sakraušanu, iepakošanu maisos, pastiprināšanu, ansambļa atlasi utt. *Šajā pētījumā izvēlētais ansambļa apguves algoritms ir sakraušanas metode.
Stacking ir otrās pakāpes mācīšanās process ar pirmās kārtas mācību procesa izvadi kā ievadi, ko sauc arī par "meta-mācīšanos". *Kraušanas metode ir kļuvusi par populāru ansambļa mācību metodi, ne tikai tāpēc, ka tās ieviešana ir diezgan vienkārša, bet arī tāpēc, ka tā var ievērojami uzlabot sistēmas vispārināšanas spēju, kas ļoti atbilst šī pētījuma mērķim. *Kraušanas metodes pamatprincips ir parādīts 6. attēlā.
6. Eksperiments un rezultātu analīze
6.1. Eksperimentālā vide un datu kopa. *Šī pētījuma aparatūras platforma ir Intel Core i3-M350 CPU@ Dualcore 2,20 GHz, 8 GB DDR2 atmiņa, Nvidia RTX2080Ti GPU un 11 GB video atmiņa. *e PyCharm integrētais izstrādes rīks ir izstrādāts Python 3.5.0 valodā. *e YOLO anotācijas sistēma, kas rakstīta Python, tiek izmantota, lai pārveidotu skaitlisko formātu tā, lai YOLO to varētu lasīt. *Salīdzināšanas metodes ir Gausa maisījuma modelis (GMM), CNN un R-CNN.

*Eksperimentālā datu kopa ir ierakstīti audio faili reālajā mācību vidē. *Datu kopa sastāv no četru dažādu apzīmējumu audio tipiem (D1, D2, D3 un D4). Visi audio faili tiek sagriezti 30-otrajos klipos. *Ir 12 audio failu formāti, tostarp MPEG, MP3 un WMA. Katrs ieraksts tiek veikts citā vietā, un vidējais ieraksta ilgums ir 3–5 minūtes. *Ierakstīšanas aprīkojumā ir iekļauts divu kanālu Soundman OKM II Classic/studio A3 auss mikrofons un Roland Edirol R09 viļņu formas ierakstītājs ar 44,1 kHz iztveršanas frekvenci un 24-bitu izšķirtspēju.
*Izmantotā datu kopa satur 1404 audio failus, un katra veida audio failu skaits ir 351. Aptuveni 70% datu tiek izmantoti audio atpazīšanas modeļa apmācībai, bet atlikušie 30% tiek izmantoti testēšanai. *Sistēmas iestatījumi ir norādīti 1. tabulā.


6.3. SPP-YOLO-v4 veiktspējas pārbaude. Lai pārbaudītu piedāvātā uzlabotā YOLO-v4 (SPP-YOLO-v4) veicināšanas ietekmi uz vispārināšanas spēju, tas tiek salīdzināts ar tradicionālo YOLO-v4 modeli. Eksperimentā tika atlasīti 3 no 12 audio failu formātiem: MPEG, MP3 un WMA. *SPP-YOLOv4 vispārināšanas spēja ir norādīta 2. tabulā.
No 2. tabulas var secināt, ka SPP-YOLO-v4 kopējā precizitāte ir augstāka nekā tradicionālā YOLO-v4, kas pārbauda tā vispārināšanas spēju attiecībā uz datiem dažādos audio formātos. *Tāpēc, ka salīdzinājumā ar sākotnējo metodi SPP-YOLO-v4 SPP satur vairāk slāņu, taču tas arī palielina apstrādes laiku.
6.4. Testa rezultātu salīdzinājums. 3. tabulā ir sniegti treniņu zaudējuma, mAP un tā tālāk rezultāti visām kategorijām pēc 8000 treniņu kārtām. Var redzēt, ka piedāvātās metodes apmācības modelis var efektīvi identificēt audio tipus. Tam ir noteiktas priekšrocības attiecībā uz precizitāti, atsaukšanas ātrumu un F1 punktu skaitu, un tā zaudējuma vērtība ir arī zemākā no visām metodēm, tikai 0,0122. *Tādēļ piedāvātās metodes stabilitāte un precizitāte ir labāka. * galvenokārt ir saistīts ar SPP-YOLO-v4 augsto izšķirtspēju un uztverošo lauku (RF), un SPP moduļa pievienošana savienojuma slānī saglabā SPP sniegtās priekšrocības. Apmācības laika ziņā SPP-YOLO-v4 ir tikai nedaudz vairāk nekā GMM. *e CNN ir jāapmāca daudz konvolūcijas operāciju, tāpēc tā apmācības laiks ir ilgāks.

Visbeidzot, eksperimentā tiek izmantoti dati no 12 dažādiem audio formātiem, lai pārbaudītu un salīdzinātu četras metodes. 4. tabulā ir norādītas testa precizitātes un pārbaudes laika vērtības. Redzams, ka šajā pētījumā piedāvātās metodes vidējā precizitāte ir 99.0%, un vidējais noteikšanas laiks ir 0.449ss. *Tādēļ piedāvātā metode nodrošina labāku veiktspēju starp četrām salīdzinātajām metodēm. Var secināt, ka SPP-YOLO-v4 pārtveršana un maksimālā apvienošana sniedza ievērojamas priekšrocības. Maksimālā apvienošana atlasa maksimālo vērtību no blakus esošajiem apgabaliem, lai audio secībā nedaudz izdzēstu maksimālo frekvences troksni. *Tāpēc konvolūcijas apakšparaugu ņemšanu var labāk darbināt nākamajā paraugu ņemšanas slānī. * Aptuveni šīs priekšrocības SPP var uzlabot pamattīkla veiktspēju.

7. Secinājumi
*ir pētījums piedāvā audio atpazīšanas sistēmu, kas piemērota mūzikas mācību videi. Izmantojiet SPP, lai uzlabotu YOLO-v4 tīkla arhitektūru, tas ir, izmantojiet SPP, lai atlasītu lokālos apgabalus dažādos viena un tā paša konvolūcijas slāņa mērogos, lai uzzinātu daudzpakāpju sistēmas īpašības. Turklāt grupēšanas metode ansambļa apguvē tiek izmantota, lai sapludinātu divu dažādu kanālu neatkarīgus apakšmodeļus. *Eksperimentālie rezultāti liecina, ka piedāvātā metode var uzlabot audio tipu atpazīšanas precizitāti un tai ir labāka veiktspēja dažādiem audio failu formātiem. Audio ierakstīšanas nosacījumu ierobežojumu dēļ eksperimentālajā datu kopā ir maz audio tipu, un vēl ir jāpārbauda dažādu ierīču ierakstīto audio failu klasifikācijas veiktspēja. Nākotnē tiks veikti papildu testi par šiem diviem jautājumiem.
Datu pieejamība
* Dati, kas izmantoti, lai pamatotu šī pētījuma secinājumus, pēc pieprasījuma ir pieejami no attiecīgā autora.
Interešu konflikti
*Autori paziņo, ka viņiem nav interešu konfliktu.
Atsauces
[1] S. Vu, D. Džans, Z. Džans, N. Jaņs, M. Li un M. Džou, "Neironu mašīntulkošana no atkarības uz atkarību", IEEE/ACM Transactions on Audio, Speech and Language Apstrāde, sēj. 26, Nr. 11, 2132.–2141. lpp., 2018. gads.
[2] J. Zou, W. Li, C. Chen un Q. Du, "Scene klasifikācija, izmantojot lokālas un globālas iezīmes ar sadarbības reprezentācijas saplūšanu", Information Sciences, vol. 348, Nr. 2, 209.–226. lpp., 2016. gads.
[3] H. Phans, L. Hertels, M. Māss, P. Kohs, R. Mazurs un A. Mertins, "Uzlabota audio ainu klasifikācija, pamatojoties uz etiķešu koka iegulšanu un konvolucionālajiem neironu tīkliem", IEEE/ACM Transactions on Audio, runas un valodas apstrāde, sēj. 25, Nr. 6, 1278.–1290. lpp., 2017. gads.
[4] S. Bayatli, "Neuzraudzīta pārsūtīšanas noteikumu svēršana uz kārtulām balstītā mašīntulkošanā, izmantojot maksimālās entropijas pieeju", Journal of Information Science and Engineering, sēj. 36, Nr. 2, 309.–322. lpp., 2020. gads.
[5] A. Rakotomamonjy, "Uzraudzīta reprezentācijas mācīšanās audio ainu klasifikācijai", IEEE/ACM Transactions on Audio, Speech, and Language Processing, sēj. 25, Nr. 6, 1253.–1265. lpp., 2017. gads.
[6] W. Yang and S. Krishnan, "Apvienojot laika iezīmes ar lokālu bināro modeli akustisko ainu klasifikācijai", IEEE/ACM Transactions on Audio, Speech, and Language Processing, sēj. 25, Nr. 6, 1315.–1321. lpp., 2017. gads.
[7] AS Dhanjal un W. Singh, "Automātiskā mašīntulkošanas sistēma daudzvalodu runai indiešu zīmju valodā", Multimedia Tools and Applications, sēj. 81, Nr. 3, 4283.–4321. lpp., 2021. gads.
[8] MA . Alamirs, "Jauns akustiskās ainas klasifikācijas modelis, izmantojot konvolucionālo neironu tīklu un dažādu ansambļu klasifikatoru vēlu saplūšanu", Applied Acoustics, sēj. 172, Nr. 3, 112.–122. lpp., 2020. gads.
[9] JG Makin, DA Moses un EF Chang, "Mašīnas garozas aktivitātes tulkošana tekstā ar kodētāja-dekodētāja ietvaru", Nature Neuroscience, sēj. 23, Nr. 4, 575.–582. lpp., 2020. gads.
[10] S. Waldekar un G. Saha, "Divu līmeņu kodolsintēzes bāzes akustisko ainu klasifikācija", Applied Acoustics, sēj. 170, Nr. 5, raksta ID 107502, 2020. gads.
For more information:1950477648nn@gmail.com






