Jauna telpiskā un laika nepārtraukta zīmju valodas atpazīšana, izmantojot uzmanīgu daudzfunkciju tīklu (2)

Jun 01, 2023

3.5. Secību mācīšanās

Secību apguve Pēc tam, kad ir iegūti rezultāti no telpisko un laika iezīmju ekstraktora spīduma elementa veidā, tie ir jāsakārto pilnā teikumā. Tāpēc mums ir jāizmanto secības mācīšanās, lai nodrošinātu, ka spīdums tiek pārvaldīts, veidojot labu teikumu. Pašreizējā pētījumā visizplatītākā metode attiecas uz divvirzienu ilgtermiņa īstermiņa atmiņu (Bi-LSTM) un konnekcionistu laika klasifikāciju (CTC) [17, 23] problēmām, kuras var atrisināt, izmantojot CTC, un vairāki jaunākie darbi [17, 23] ierosina. CTC kā pilnīgs apmācības process CSLR.

cistanche extract powder

Cistanche ekstrakta pulveris

Noklikšķiniet šeit, lai skatītu Cistanche produktus

【Jautājiet vairāk】 E-pasts:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Ilgtermiņa īstermiņa atmiņa (LSTM) [44] ir atkārtotā neironu tīkla (RNN) variants, un to plaši izmanto secību modelēšanā. LSTM lieliski modelē ilgtermiņa atkarības; tā var apstrādāt veselas ievades secības un izmantot to iekšējo stāvokli, lai modelētu stāvokļa pārejas. Tomēr šo priekšējo RNN trūkums ir tāds, ka slēptie stāvokļi tiek apgūti tikai no vienvirziena virziena. Pēc iezīmju secības saņemšanas kā ievades RNN rada slēptu stāvokli, kā aprakstīts zemāk esošajā vienādojumā.

ht=RNN(ht−1,ot),

kur ht apzīmē slēpto stāvokli, kur sākotnējais stāvoklis h0 ir fiksēts nulles vektors, un t ir laika solis. RNN tiek izmantots, lai prognozētu zīmju spīdumus atbilstoši telpisko pazīmju secības ievadei.

Turklāt SL uzdevumi ir diezgan sarežģīti. Tāpēc tam ir nepieciešamas ne tikai funkcijas, kas saņemtas no vienvirziena konteksta, bet arī palīdzība, izmantojot divvirzienu informāciju, lai uzzinātu, kā parādās vārdi, kas ir pirms un pēc citiem vārdiem teikumā. Līdz ar to mēs izmantojam Bi-LSTM [45], lai uzzinātu attēlu secību sarežģītās dinamiskās atkarības, pārveidojot tās, izmantojot telpiskos un laika attēlojumus spīduma pazīmju sekvencēs. Saskaņā ar iepriekš sniegto skaidrojumu, Bi-LSTM metode var veikt divvirzienu darbu ar LSTM metodi. Tas nozīmē, ka Bi-LSTM metode var labāk klasificēt secīgos datus. Bi-LSTM aprēķinu, kas izmanto divvirzienu slēptos stāvokļus, var uzskatīt arī par atkārtotiem LSTM aprēķiniem, kas tiek apstrādāti no priekšpuses uz aizmuguri un pēc tam no aizmugures uz priekšu. Pēc tam katra laika posma slēptais stāvoklis tiek izvadīts caur pilnībā savienotu slāni un softmax slāni [17].

cistanche powder

Cistanche pulveris

pie=W(ht plus b),

yt,j=e at,j ∑ke at,j ,

kur b ir novirzes vektors un y(t,j) apzīmē marķējuma j varbūtību laika posmā t. Mūsu TSL uzdevumā etiķete j ir vārdu krājums, kas tiek iegūts no teikuma. Praksē Bi-LSTM ievērojami uzlabo informācijas apjomu, kam tīkls var piekļūt, kas savukārt uzlabo algoritmā pieejamās informācijas kontekstu. Informācija satur zināšanas par to, kurš vārds ir aiz vai pirms pašreizējā kadra teikuma pazīmju secības ievadē.

Bi-LSTM nosūta slēptos stāvokļus kā izvadi uz CTC slāni katram laika posmam. Tā kā šī Bi-LSTM rezultātos nav pievērsta uzmanība spīduma izkārtojumam, mēs izmantojam CTC, lai apstrādātu video secību kartēšanu o={ot} T 0 t=1, lai izveidotu zīmi. spīduma secība `={` i} IL =1 (L Mazāks vai vienāds ar T) ar labāku izkārtojumu. CTC izmanto daudzās jomās, tostarp rokraksta atpazīšanā [46], runas atpazīšanā [47] un zīmju valodas atpazīšanā [17,23]. Šajā domēnā to izmanto kā vērtēšanas funkciju, nesaskaņojot ievades un izvades secības. CSLR CTC ir pazīstams kā modulis, kas izstrādāts visaptverošiem uzdevumiem, kas ietver laika datu klasifikāciju bez segmentācijas. Izmantojot dinamisko programmēšanu, CSLR var atrisināt izlīdzināšanas problēmu, izveidojot tukšu etiķeti (-), kas ļauj sistēmai radīt optimālus rezultātus tādu datu attēlošanai, kuriem nav etiķešu (piemēram, epentēzes dati un ar žestu nesaistītu datu segmenti). Konkrēti, CTC ģenerē tukšu etiķeti "-", lai paplašinātu vārdu krājumu V, kur V=Vorigin ∪ {-}. Šīs tukšās etiķetes mērķis ir attēlot pāreju un paziņot par tukša spīduma esamību, kas nesniedz informāciju mācību procesam, jo ​​π={πt} T 0 t{{20 }}, kur πt ∈ V. Rezultātā CTC var pārvaldīt izejas parametrus no telpisko un laika pazīmju ekstraktora un arī Bi-LSTM kā izlīdzināšanas moduli, apkopojot visu iespējamo ceļu varbūtības. Visam izlīdzināšanas ceļam π ir varbūtība, ka ievades secība tiek dota šādi [17]:

Cistanche deserticola experiment

Cistanche deserticola eksperiments

p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, πt

Nākamajā solī mēs definējam kartēšanas darbību “daudzi pret vienu”, kas noņem tukšu vietu un dublē vārdus no līdzināšanas ceļa. Piemēram, B (II-am- -a- -ārsts)=Es, esmu, a, ārsts. Rezultātā mēs varam aprēķināt zīmes spīduma secības l nosacīto varbūtību kā visu to maršrutu varbūtību kopsummu, kurus var kartēt uz l no B, tālāk aprakstītajā veidā [17]:

p(π|o) = ∑ π∈B−1 p(π|o)

kur B −1 (l)={π|B(π)=l} ir B apgrieztā darbība. Visbeidzot, pazīmju secības CTC zudumi ir definēti šādi [17]:

Lctc=− ln p(` |o)

Nosacīto varbūtību p(π|X) var aprēķināt pēc nosacītās neatkarības pieņēmuma.

4. Eksperimentu rezultāti un diskusija

cistanche—Improve memory2

Cistanche papildinājums netālu no manis-Uzlabo atmiņu

Šajā sadaļā mēs izskaidrosim mūsu eksperimenta detaļas ar ierosināto konfigurāciju, kā paskaidrots iepriekšējā sadaļā.

4.1. Datu kopas

Šajā sadaļā mēs izskaidrojam datu kopas, kuras izmantojām šī eksperimenta laikā. Mēs izmantojām divas datu kopas, pirmā ir CSL datu kopa [8,40,41] un otrā ir RWTH-PHOENIX datu kopa [33,39]. Abas šīs datu kopas ir nepārtrauktas zīmju valodas datu kopas, kuras tiek izmantotas, lai tulkotu dažas žestu sērijas pilnā teikumā.

4.1.1. CSL datu kopa

CSL datu kopa ir izmantota vairākos darbos [8,40,41]. Šajā datu kopā ir 100 teikumi un 178 vārdi, kas parasti tiek izmantoti ikdienas saziņā. Šajā datu kopā ir vidēji 5 vārdi vienā teikumā. Katru teikumu 50 parakstītāji izpildīja 5 reizes. Tādējādi kopējais videoklipu skaits ir 25,000, padarot šo par vienu no lielākajām datu kopām. Lai apmācītu mūsu CSL modeli, mēs sadalījām datu kopu datos apmācībai ar 20,{11}} videoklipiem un testēšanai ar 5000 videoklipu ar vienu un to pašu teikumu, bet ar dažādiem parakstītājiem.

4.1.2. RWTH-PHOENIX datu kopa

RWTH-PHOENIX datu kopa [33,39] ir vācu zīmju valodas datu kopa, kas ir Vācijas televīzijas staciju publisko laikapstākļu raidījumu ieraksts. Šis video ir apstrādāts tā, lai tā izmērs būtu 210 × 260. Ir 6841 dažāds teikums, ko parakstījuši 9 dažādi parakstītāji. Visi parakstītāji valkāja tumšas krāsas drēbes uz gaiša fona. Kopumā ir 1232 vārdi ar aptuveni 80,{11}} spīdumiem. Šī datu kopa ir sadalīta atbilstoši iepriekš noteiktam formātam, kas sastāv no 5672 apmācības paraugiem, 540 validācijas/izstrādāšanas paraugiem un 629 testa paraugiem.

4.2. Datu priekšapstrāde

Pirmā lieta, kas mums bija jādara, bija mūsu datu kopas iepriekšēja apstrāde, lai tā atbilstu mūsu piedāvātajam modelim. Mēs veicām izmēru maiņu un apgriešanu, kā parādīts 3. attēlā; kreisajā pusē redzams, ka sākotnējie dati tika izmērīti ar Full HD vai 1920 × 1080 izšķirtspēju. Mums tas bija jāapgriež un jāmaina līdz 224 × 224 izšķirtspējai, jo mūsu telpiskais modulis saņem ievadi, kas ir tāda paša izmēra kā ResNet50 ievade. Pēc tam mēs ievadījām datus mūsu telpiskajā modelī, kas radītu 7 × 7 tensoru no viena attēla.

Pēc tam iepriekš apstrādātais pilna kadra attēls tika izmantots atslēgas punkta līdzekļu ģenerēšanai. Mēs izmantojām HRNet modeli, lai paredzētu 133 galvenos punktus no šiem RGB attēliem. Tomēr mūsu piedāvātajā modelī mēs izmantojam tikai 27 ķermeņa augšdaļas atslēgas punktus. Ievades lielums atslēgas punkta iezīmēm ir 27 × 3, jo mums ir 3-ass (x, y un z) koordinātu dati katram punktam. Modeļa ievades izmērs ir N × 224 × 224 × 3 pilna kadra funkcijai un N × 1 × 27 × 3 atslēgas punkta ievadei, kur N ir kadru skaits. Lai uzlabotu datu kopas variācijas, mēs sekojam palielinājumam no [12], ieskaitot nejaušu apgriešanu, horizontālu apgriešanu un nejaušu laika mērogošanu. Izlases apgriešana tiek izmantota arī kā daļa no priekšapstrādes, lai apgrieztu sākotnējo attēlu.

cistanche—Improve memory7

Cistanche papildinājums netālu no manis-Uzlabo atmiņu

4.3. Novērtēšanas metrika

Lai novērtētu mūsu piedāvātā modeļa atpazīšanas veiktspēju, mēs izmantojam vārdu kļūdu līmeņa (WER) metriku, kas ir metrika, ko parasti izmanto CSLR, lai novērtētu paredzētā teikuma atpazīšanas precizitāti, kā parādīts zemāk redzamajā vienādojumā [17]:

WER=S plus I plus DT=S plus I plus DS plus C plus D

kur S ir sākotnējā vārda aizstāšanu skaits, I ir ievietojumu skaits, kas nav sākotnējā teikumā, D ir svītrojumu skaits, kam vajadzēja būt sākotnējā teikumā, C ir pareizo vārdu skaits, kas atbilst sākotnējais teikums, un T ir kopējais vārdu skaits teikumā vai ko var iegūt no aizvietojumu, svītrojumu un pareizo vārdu kopsummas. CSL gadījumā katra rakstzīme tiek izmantota, lai attēlotu vārdu.

4.4. Eksperimentējiet ar ievades straumēm

Šis eksperiments galvenokārt koncentrējas uz vienas plūsmas un vairāku straumju ievades salīdzināšanu mūsu modelī. Mērķis ir atrast labāko ievades straumes konfigurāciju. Šajā eksperimentā mēs izmantojam tikai RWTH-PHOENIX datu kopu. Mūsu modelis saņemtu divas atsevišķas ievades, pilna kadra un atslēgas punkta ievadi. Vienas plūsmas ievade izmanto tikai RGB funkciju no pilnrāmja attēla. Ir divi vienas plūsmas ievades eksperimenti. Pirmajā tiek izmantota tikai pilna kadra funkcija no RGB attēla, bet otrā tiek izmantotas atslēgas punkta funkcijas no atslēgas punkta ievades. Mūsu piedāvātā vairāku straumju ievade sastāv no RGB un atslēgas punkta funkcijām. Salīdzināšanas rezultāts, izmantojot vienu straumi un vairāku plūsmu, ir parādīts 1. tabulā. Šeit redzams, ka, izmantojot vairāku straumju funkciju, mēs varam iegūt labāku rezultātu nekā izmantojot vienu straumi. Galvenā plūsma tiek iegūta no pilna kadra RGB funkcijas, un papildu straumē tiek izmantotas atslēgas punkta funkcijas. Papildu atslēgas punktu straume palīdz modelim labāk mācīties, jo īpaši tvert plaukstas formas detaļas.

1. tabula. WER veiktspējas salīdzinājums, izmantojot vienas plūsmas un vairāku straumju ievadi.

Table 1. WER Performance comparison using single stream and multi-stream input.


4.5. Eksperimentējiet ar uzmanības moduli

Šī eksperimenta mērķis bija izvēlēties labāko uzmanības moduļa konfigurāciju. Šajā eksperimentā mēs izmantojam labākā rezultāta konfigurāciju no iepriekšējā eksperimenta rezultāta un to pašu datu kopu. Telpisko uzmanību mēs apzīmējam kā modeli ar sevis uzmanības slāni katras funkcijas telpiskā moduļa beigās. Agrīna laika uzmanība ir sevis uzmanības slānis pēc pirmās laika apvienošanas, un vēlīnā uzmanība ir uzmanības slānis pēc otrās laika apvienošanas. Šeit mēs salīdzināsim visas iepriekš minētās konfigurācijas un telpiskās un laika uzmanības kombināciju. Rezultāts parādīts 2. tabulā. Telpiskās uzmanības rezultāts ir sliktāks par laika uzmanību. Telpiskais līmenis satur funkciju secību katram kadram. Kā minēts [20], sevis uzmanības slānim ir vieglāk apgūt īsāku ceļu starp ilgām atkarībām. Tāpēc telpiskā uzmanība nespēj samazināt WER garās secības dēļ. No otras puses, mēs varējām iegūt uzlabotu rezultātu, izmantojot īslaicīgu uzmanību, ievietojot to pēc apvienošanas, lai iegūtu īsāku secības garumu. Novēlota uzmanība, kurai ir visīsākais secības garums, iegūst vislabāko rezultātu. Turklāt uzmanības moduļa kombinācija telpiskā un laika ziņā ir sliktāka nekā tikai vienas uzmanības izmantošana. Pamatojoties uz šiem rezultātiem, mēs izmantojam labāko konfigurāciju turpmākajiem eksperimentiem.

2. tabula. WER veiktspējas salīdzinājums, izmantojot dažādu uzmanības konfigurāciju

Table 2. WER Performance comparison using different attention configuration


4.6. Ablācijas eksperiments STAMF tīklā

Turklāt mēs veicam ablācijas eksperimentu, izmantojot to pašu datu kopu un labāko ievades plūsmas un uzmanības moduļa konfigurāciju. 3. tabula par eksperimentu, kurā izmantota vēlīna laika uzmanība bez apvienošanas, pierāda, ka secības garums ietekmē uzmanības veiktspēju. Eksperimenti, kuros izmanto apvienošanas slāņus ar īsāku secību, iegūst labākus rezultātus. Mēs arī veicam ablācijas eksperimentu, lai uzzinātu veiktspēju, izmantojot dažādus secības mācīšanās modeļus. Rezultāts 4. tabulā parāda, ka, izmantojot LSTM, kam ir tikai vienvirziena informācija, ir zemāka veiktspēja nekā Bi-LSTM, kam ir divvirzienu informācija.

3. tabula. WER veiktspējas salīdzinājums, izmantojot dažādas vēlīnās uzmanības konfigurācijas.

Table 3. WER Performance comparison using different late temporal attention configurations.

4. tabula. WER veiktspējas salīdzinājums, izmantojot dažādu secību mācīšanās konfigurāciju.

Table 4. WER Performance comparison using different sequence learning confifiguration.


4.7. Eksperimentējiet STAMF tīklā

Šajā sadaļā mēs izskaidrojam pilnu apmācības procesu mūsu piedāvātajam modelim, ko sauc par spatiotemporal attentive multi-funkciju (STAMF). Tas attieksies uz to, kā mēs soli pa solim ievietojam ievades datus telpiskajā modulī, laika modulī un secības mācību modulī. Šajā sadaļā mēs izmantojam vairāku straumju ievadi un vēlīnās laika uzmanības konfigurāciju.

4.7.1. Īstenošanas informācija

Mēs veicam pilnīgu apmācību un testēšanu, izmantojot ievades kadrus ar izmēriem 224 × 224. Optimizētājam mēs izmantojam Adam optimizētāju ar 10–4 kā mācīšanās ātrumu un dalām to ar 2 10. un 15. epohā CSL un 30., 40. un 60. laikmets RWTH PHOENIX. Mēs iestatījām partijas lielumu uz 4 un veicam 80 epochas RWTH-PHOENIX un 20 epochas CSL. Apmācība un testēšana tika veikta, izmantojot NVIDIA Tesla V100 un 128G RAM.

Sākumā mēs izvilkām šo līdzekli no RGB straumēm, izmantojot ResNet50, un izmantojām HRNet, lai iegūtu atslēgas punktu, un pēc tam izvilkām atslēgas punkta līdzekļus, izmantojot ResNet50. Ņemiet vērā, ka mums bija darīšana ar secīgiem datiem vai videoklipu. Tāpēc mums bija jākonfigurē ievades lielums atkarībā no video garuma. Tehnisku iemeslu dēļ visu datu ievades lielumam bija jābūt identiskam. Tāpēc mums ir jāzina garākais videoklips mūsu datu kopā, un pēc tam ievades kadra garums ir jāpapildina, lai tas atbilstu lielākajam kadra numuram.

Šīs secīgi iegūtās funkcijas izmantoja temporālais modulis. Katra secīgā straume izgāja cauri diviem sakrautiem laika apvienojumiem. Katra laika apvienošana sastāvēja no 1-dimensiju konvolucionālā tīkla un maksimālā apvienošanas slāņa, kas samazināja secības garumu uz pusi. Pēc tam abu straumju temporālās apvienošanas izvade tika savienota ar uzmanības slāni, un pēdējai laika apvienošanai pēc uzmanības slāņa tā beigās tika savienota kā laika moduļa izvade.

Laika izvadi apstrādāja secības mācību modulis. Procesā tika izmantots Bi-LSTM slānis, kas savienots ar CTC, lai iegūtu galīgo izlīdzināšanu un veidotu spīdumu pēdējā teikumā.

4.7.2. Kvantitatīvs rezultāts

Pēdējie teikumi tika salīdzināti ar pamata patiesību, lai aprēķinātu WER rezultātu kā kvantitatīvu rezultātu. CSL mēs sadalījām datu kopu 80 procentos apmācības datiem un 20 procentiem testēšanas datiem. Kā parādīts 5. tabulā, mūsu piedāvātais vairāku funkciju modelis (STMF), izmantojot pilna kadra un atslēgas punkta funkcijas, var sasniegt labāku rezultātu un samazināt WER līdz 0,8, salīdzinot ar modeli, kurā tiek izmantota tikai pilna kadra funkcija [23]. Mūsu labāko rezultātu ieguva piedāvātais daudzfunkciju modelis, izmantojot uzmanības mehānismu (STAMF), kas WER sasniedza 0, 7. Uzmanības slānis joprojām nedaudz uzlaboja rezultātu, lai gan CSL datu kopā nebija bojātu kadru. Tas pierāda, ka uzmanības slānim ir ietekme uz modeli. Piedāvātais vairāku funkciju modelis pats par sevi ir pārāks par jaunākajām metodēm, un uzmanības slānis palīdz samazināt WER punktu skaitu CSL datu kopā. Galvenais CSL aspekts rada būtisku ietekmi, jo tas var sniegt efektīvu informāciju salīdzinājumā ar citu daudzfunkciju metodi [17], kurā tiek izmantota roku, sejas un ķermeņa poza.

RWTH-PHOENIX datu kopai mēs izmantojām mākslīgo konfigurāciju, lai sadalītu apmācības un testēšanas datus. Datu kopa tika sadalīta 5672 video paraugos apmācībai, 540 video paraugiem pašpārbaudei un 629 video paraugiem testēšanai. Kā parādīts 6. tabulā, mūsu piedāvātā daudzfunkciju modeļa (STMF) rezultātam, izmantojot pilna kadra un atslēgas punkta funkcijas, bija 24 procenti WER, un mūsu labākais rezultāts bija 20,5 procenti, kas iegūts piedāvātajā modelī, izmantojot uzmanības moduli (STAMF). treniņa rezultātā. Testa rezultāti ir otrie labākie salīdzinājumā ar [17], jo tajos kā ievade tiek izmantots vairāk funkciju. Tomēr ir izrādījies, ka uzmanības modulis sniedz ievērojamu ieguldījumu RWTHPHOENIX datu kopas WER rezultāta samazināšanā. Atšķirībā no mūsu rezultāta CSL datu kopai, mūsu piedāvātais modelis ar vairāku plūsmu nesasniedza optimālu rezultātu. Tas ir tāpēc, ka RWTH-PHOENIX datu kopā ir daudz bojātu kadru; tiem ir izplūdusi daļa, īpaši roku zonā. Šis rāmis sniedz nekonsekventu atslēgas punkta informāciju trūkstošās vai nepareizās atslēgas punkta pozīcijas dēļ un padara modeli mazāk optimālu. Šī problēma tiek atrisināta, pievienojot uzmanības slāni mūsu piedāvātajam daudzfunkciju modelim, kas palīdz atlasīt pareizo informāciju un rada ievērojamus uzlabojumus salīdzinājumā ar piedāvāto daudzfunkciju modeli bez uzmanības.

5. tabula. WER veiktspējas salīdzinājums CSL datu kopā.

Table 5. WER Performance comparison on the CSL dataset.

6. tabula. WER veiktspējas salīdzinājums RWTH-PHOENIX datu kopā.

Table 6. WER Performance comparison on the RWTH-PHOENIX dataset.


4.7.3. Kvalitatīvs rezultāts

Mēs arī veicām sava modeļa kvalitatīvu novērtējumu, izmantojot atpazīšanas rezultāta vizualizāciju. 8. attēlā ir parādīta informācija par mūsu kvalitatīvo novērtējumu, izmantojot trīs teikumu paraugus. Pirmais teikums sastāv no 10 vārdiem un kopējais kadru skaits ir 220. Otrais teikums sastāv no 12 vārdiem un kopējais kadru skaits ir 168. Trešais teikums sastāv no 9 vārdiem un kopējais kadru skaits ir 135.

Parauga rezultāts parāda, ka daži spīdumi modeļi nav pareizi prognozēti, un mēs to apzīmējam ar sarkanu atzīmi. Tomēr tas joprojām var paredzēt lielāko daļu pareizo vārdu. Vislielākais kļūdu skaits ir pirmajā teikumā, kuram ir visgarākais kadra numurs. Šajā teikumā teikuma sākumā ir vairāk kļūdu, jo vairāki agrīno vārdu žesti ir tikai nedaudz atšķirīgi, tāpēc ir grūti atšķirt robežas. Tomēr ierosinātais modelis ar vairākām funkcijām un uzmanību (STAMF) varēja identificēt vairāk vārdu, taču tie tika nepareizi marķēti. Turklāt modeļa konfigurācija ar uzmanību nodrošina labāku atpazīšanas rezultātu vēl diviem paraugiem, salīdzinot ar piedāvāto modeli bez uzmanības.

Figure 8.


8. attēls. Atpazīšanas rezultāta kvalitatīvs novērtējums, izmantojot citu RWTH-PHOENIX datu kopas konfigurāciju [33,39]. Nepareizi prognozētie spīdumi ir atzīmēti sarkanā krāsā.

5. Secinājumi

Šajā rakstā mēs piedāvājam jaunu spatiotemporal uzmanīgu daudzfunkciju (STAMF) CSLR, kuras mērķis ir apgūt telpiskās un laika korelācijas un svarīgo informāciju no vizuālo pazīmju secības un atslēgas punktu iezīmēm, izmantojot pilnīgu pieeju. Mūsu sistēmā tika izstrādāts telpiskais modulis ar pilna kadra funkciju no RGB datiem un galvenajiem punktiem no ķermeņa galvenajiem punktiem, ieskaitot rokas kā daudzfunkcijas. Šīs kombinācijas, kas tika izmantotas kā vairāku straumju līdzekļu ievade, nodrošināja izcilu veiktspēju salīdzinājumā ar jaunāko pieeju, kas izmanto tikai pilnrāmja kadru, vai salīdzinot ar metodi 8. attēls. Atpazīšanas rezultāta kvalitatīvs novērtējums, izmantojot citu RWTH konfigurāciju. -PHOENIX datu kopa [33,39]. Nepareizi prognozētie spīdumi ir atzīmēti sarkanā krāsā. 5. Secinājumi Šajā rakstā mēs piedāvājam jaunu CSLR paredzētu telpisko un laika uzmanīgo daudzfunkciju (STAMF), kuras mērķis ir uzzināt telpiskās un laika korelācijas un svarīgo informāciju no vizuālo pazīmju secības un galveno punktu iezīmēm gala līdz beigu pieeja. Mūsu sistēmā tika izstrādāts telpiskais modulis ar pilna kadra funkciju no RGB datiem un galvenajiem punktiem no ķermeņa galvenajiem punktiem, ieskaitot rokas kā daudzfunkcijas. Šīs kombinācijas, kas tika izmantotas kā vairāku straumju līdzekļu ievade, nodrošināja izcilu veiktspēju salīdzinājumā ar modernāko pieeju, kurā tiek izmantots tikai pilnrāmja kadrs, vai salīdzinājumā ar metodi, kas izmanto citu vairāku funkciju kombināciju, īpaši CSL datu kopai. Pēc tam mēs piedāvājam laika moduli, kas sastāv no laika apvienošanas un laika uzmanības, lai uztvertu svarīgo informāciju laika domēnā. Vēlīnas laika uzmanības pievienošana var iegūt svarīgo iezīmi no secības, kurā ir nepareiza informācija, un sniedz ievērojamus uzlabojumus salīdzinājumā ar mūsu piedāvāto daudzfunkciju modeli. Tas arī palīdz secības apguvei labāk mācīties un uzlabo veiktspēju, kā tas ir CSL datu kopas eksperimentā. Plaši eksperimenti ar plaši izmantotām datu kopām parāda mūsu piedāvātā modeļa pārākumu pār modernāko modeli, WER rādītājiem samazinoties par vairāk nekā 50 procentiem CSL datu kopai un par 5 procentiem RWTH-PHOENIX datu kopai. Nākotnē mēs plānojam ieviest pārneses mācību tehniku ​​ar mūsu pašreizējo modeli, kā arī pielietot mūsu iesākto darbu reālā nozarē.

Atsauces

1. Drjū, P.; Rybach, D.; Deselaers, T.; Zahedi, M.; Ney, H. Runas atpazīšanas metodes zīmju valodas atpazīšanas sistēmai. In Proceedings of the INTERSPEECH 2007, Starptautiskās runas komunikācijas asociācijas 8. ikgadējā konference, Antverpene, Beļģija, 2007. gada 27.–31. augusts; 2513.–2516.lpp.

2. Ong, SCW; Ranganath, S. Automātiskā zīmju valodas analīze: aptauja un nākotne ārpus leksiskās nozīmes. IEEE Trans. Pattern Anal. Mačs. Intell. 2005, 27, 873–891. [CrossRef] [PubMed]

3. Voglers, C.; Metaksas, D. Amerikāņu zīmju valodas vienlaicīgo aspektu atpazīšanas ietvars. Aprēķināt. Vis. Image Underst. 2001, 81, 358–384. [CrossRef]

4. Boudens, R.; Vindridžs, D.; Kadirs, T.; Zisermans, A.; Breidijs, M. Lingvistiskās iezīmes vektors zīmju valodas vizuālajai interpretācijai. Eiropas Datorredzes konferences (ECCV) materiālos, Prāgā, Čehijā, 2004. gada 11.–14. maijā; 390.–401.lpp.

5. Kasukurthi, N.; Rokads, B.; Bidāni, S.; Denisans, DA Amerikāņu zīmju valodas alfabēta atpazīšana, izmantojot dziļo mācīšanos. arXiv 2019, arXiv:1905.05487.

6. Kollers, O.; Zargarāns, S.; Nejs, H.; Bowden, R. Deep Sign: stabilas statistiskas nepārtrauktas zīmju valodas atpazīšanas iespējošana, izmantojot hibrīdus CNN-HMM. Int. J. Comput. Vis. 2018, 126, 1311–1325. [CrossRef]

7. Pū, J.; Džou, V.; Li, H. Paplašināts konvolucionālais tīkls ar iteratīvu optimizāciju nepārtrauktai zīmju valodas atpazīšanai. In Proceedings of the Twenty-Seventh International Joint Conference on Artificial Intelligence, Stokholma, Zviedrija, 2018. gada 13.–19. jūlijs; 885.–891.lpp.

8. Pū, J.; Džou, V.; Li, H. Iterative Alignment Network for Continuous Sign Language Recognition. IEEE Computer Society konferences par datoru redzi un modeļu atpazīšanu materiālos, Longbīčā, Kalifornijā, ASV, 2019. gada 15.–20. jūnijā; 4160.–4169. lpp.

9. Kumar, N. Kustības trajektorijā balstīta cilvēka sejas un roku izsekošana zīmju valodas atpazīšanai. In Proceedings of the 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Mathura, Indija, 2017. gada 26.–28. oktobris; 211.–216.lpp.

10. Bhuyan, MK; Ghoah, D.; Bora, PK Rokas žestu atpazīšanas sistēma ar lietojumiem zīmju valodā. In Proceedings of the Ikgadējā Indijas konference 2006, INDICON, Ņūdeli, Indija, 2006. gada 15.–17. septembris; 1.–6.lpp.

11. Das, SP; Talukdars, AK; Sarma, KK Zīmju valodas atpazīšana, izmantojot sejas izteiksmi. Proceedings of the Procedia Computer Science, Kerala, Indija, 2015. gada 10.–13. augusts; 210.–216.lpp.

12. Rastgoo, R.; Kiani, K.; Escalra, S.; Sabokrou, M. Zīmju valodas produkcija: apskats. 2021. gada IEEE/CVF konferences par datorredzes un modeļu atpazīšanas semināriem (CVPRW) darbā, Nešvilā, TN, ASV, 2021. gada 19.–25. jūnijs; 3446.–3456.lpp.

13. Dongs, S.; Van, P.; Abbas, K. Aptauja par dziļo mācīšanos un tās pielietojumiem. Aprēķināt. Sci. Rev. 2021, 40, 100379. [CrossRef]

14. Athitsos, V.; Neidle, C.; Sclaroff, S.; Nešs, Dž.; Stefans, A.; Yuan, Q.; Thangali, A. Amerikāņu zīmju valodas leksikas video datu kopa. IEEE Computer Society 2008. gada konferences par datoru redzes un modeļu atpazīšanas semināriem, CVPR Workshops, Ankoridža, Aļaska, 2008. gada 23.–28. jūnijs; 1.–8.lpp.

15. Bungeroth, J.; Šteins, D.; Drjū, P.; Nejs, H.; Morisejs, S.; Veids, A.; Zijl, LV ATIS zīmju valodas korpuss. In Proceedings of the 6th International Conference on Language Resources and Evaluation, LREC 2008, Marakeša, Maroka, 2008. gada 28.–30. maijs; 2943.–2946.lpp.

16. Papastratis, I.; Chatzikonstantinou, C.; Konstantinidis, D.; Dimitropoulos, K.; Daras, P. Mākslīgā intelekta tehnoloģijas zīmju valodai. Sensori 2021, 21, 5843. [CrossRef] [PubMed]

17. Džou, H.; Džou, V.; Džou, Y.; Li, H. Telpiski-temporāls vairāku signālu tīkls nepārtrauktai zīmju valodas atpazīšanai. In Proceedings of the AAAI 2020 — The Thirty-Ceturth AAAI Conference on Artificial Intelligence, Ņujorka, NY, ASV, 2020. gada 7.–12. februāris; 13009.–13016.lpp.

18. Gündūzs, C.; Polat, H. Turku zīmju valodas atpazīšana, pamatojoties uz daudzplūsmu datu saplūšanu. Turku J. Elektr. Inž. Aprēķināt. Sci. 2021, 29, 1171–1186. [CrossRef]

19. Bohačeks, M.; Hruz, M. Uz zīmju pozām balstīts transformators vārdu līmeņa zīmju valodas atpazīšanai. In Proceedings of the 2022 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops, WACVW, Waikoloa, HI, USA, 2022. gada 4.–8. janvāris; 182.–191.lpp.

20. Vaswani, A. Attention Is All You Need. In Proceedings of the Conference on Neural Information Processing Systems, Longbīča, Kalifornija, ASV, 2017. gada 4.–9. decembris; 1.–11.lpp.

21. Džou, M.; Ng, M.; Cai, Z.; Cheung, KC, uz sevis uzmanības balstīti, pilnībā uzsākti tīkli nepārtrauktai zīmju valodas atpazīšanai. Priekšpuse. Artif. Intell. Appl. 2020, 325, 2832–2839.

22. Camgöz, NC; Kollers, O.; Hadfifield, S.; Bowden, R. Zīmju valodas transformatori: kopīga pilnīga zīmju valodas atpazīšana un tulkošana. IEEE Datoru biedrības konferences par datoru redzi un modeļu atpazīšanu materiāliem, Sietla, Vašingtona, ASV, 2020. gada 14.–19. jūnijs; 10020.–10030.lpp.

23. Min, Y.; Hao, A.; Chai, X.; Chen, X. Vizuālās izlīdzināšanas ierobežojums nepārtrauktai zīmju valodas atpazīšanai. In Proceedings of the IEEE International Conference on Computer Vision (ICCV), Monreāla, BC, Kanāda, 2021. gada 10.–17. oktobris; 11542.–11551.lpp.

24. Guo, D.; Džou, V.; Vangs, M.; Li, H. Zīmju valodas atpazīšana, pamatojoties uz adaptīviem HMM ar datu palielināšanu. In Proceedings of the IEEE International Conference on Image Processing (ICIP), Fīniksa, AZ, ASV, 2016. gada 25.–28. septembris; 2876.–2880.lpp.

25. Huangs, Dž.; Džou, V.; Li, H.; Li, W. Zīmju valodas atpazīšana, izmantojot 3D konvolucionālos neironu tīklus. IEEE International Conference on Multimedia and Expo (ICME) materiālos Turīnā, Itālijā, 2015. gada 29. jūnijs–3. jūlijs; 1.–6.lpp.

26. Guo, D.; Džou, V.; Li, H.; Wang, M. Tiešsaistes agrīnā un vēlā saplūšana, pamatojoties uz adaptīvo HMM zīmju valodas atpazīšanai. ACM Trans. Multimed. Aprēķināt. Commun. Appl. 2017, 14, 1.–18. [CrossRef]

27. Al-hammadi, M.; Muhameds, G.; Biedrs, S. Rokas žestu atpazīšana zīmju valodā, izmantojot 3DCNN. IEEE Access 2020, 8, 79491–79509. [CrossRef]

28. Rēža, H.; Joze, V. MS-ASL: liela mēroga datu kopa un etalons amerikāņu zīmju valodas izpratnei. arXiv 2019, arXiv:1812.01053.

30. Li, D.; Opazo, CR; Yu, X.; Li, H. Vārdu līmeņa dziļās zīmju valodas atpazīšana no video: jauna liela mēroga datu kopa un metožu salīdzinājums. 2020. gada IEEE ziemas konferences par datorredzes lietojumiem, WACV, Snowmass Village, CO, ASV, 2020. gada 1.–5. 1448.–1458.lpp.

30. Pū, J.; Džou, V.; Li, H. Zīmju valodas atpazīšana ar multimodālām iezīmēm. In Proceedings of the Pacific Rim Conference on Multimedia, Xi'an, China, 2016. gada 15.–16. septembris; 252.–261.lpp.

31. Dzjans, S.; Saule, B.; Van, L.; Bai, Y.; Li, K.; Fu, Y. Skeleton Aware Multi-modālā zīmju valodas atpazīšana. IEEE Datoru sabiedrības konferences par datoru redzējumu un modeļu atpazīšanas semināriem, Nešvilā, TN, ASV, 2021. gada 19.–25. jūnijā; 3408.–3418.lpp.

32. Sidigs, AAI; Lukmans, H.; Mahmuds, S.; Mohandes, M. KArSL: Arābu zīmju valodas datu bāze. ACM Trans. Āzijas zema resursa. Lang. Inf. Apstrāde 2021, 20, 1.–19. [CrossRef]

33. Kollers, O.; Forsters, J.; Ney, H. Nepārtraukta zīmju valodas atpazīšana: Ceļā uz liela vārdu krājuma statistiskās atpazīšanas sistēmām, kas apstrādā vairākus parakstītājus. Aprēķināt. Vis. Image Underst. 2015, 141., 108.–125. [CrossRef]

34. Kollers, O.; Camgoz, NC; Ney, H. Vāji uzraudzīta mācīšanās ar vairāku straumju CNN-LSTM-HMM, lai atklātu secīgu paralēlismu zīmju valodas videoklipos. IEEE Trans. Pattern Anal. Mačs. Intell. 2020, 42, 2306–2320. [CrossRef] [PubMed]

35. Camgoz, NC; Hadfifield, S.; Kollers, O.; Bowden, R. SubUNets: Rokas forma no gala līdz galam un nepārtraukta zīmju valodas atpazīšana. In Proceedings of the 2017 IEEE International Conference on Computer Vision (ICCV), Venēcija, Itālija, 2017. gada 22.–29. oktobris; 3075.–3084.lpp.

36. Dongs, C.; Lojs, CC; Viņš, K.; Tang, X. Attēla superizšķirtspēja, izmantojot dziļos konvolucionālos tīklus. IEEE Trans. Pattern Anal. Mačs. Intell. 2014, 38, 295–307. [CrossRef] [PubMed]

37. Bresem, KK; Adams, LC; Erkslēbens, C.; Hamms, B.; Niehues, SM; Vahldiek, JL Salīdzinot dažādas dziļās mācīšanās arhitektūras krūškurvja rentgenogrammu klasifikācijai. Sci. Rep. 2020, 10, 13590. [CrossRef]

38. Saule, K.; Sjao, B.; Liu, D.; Wang, J. Deep augstas izšķirtspējas reprezentācijas mācīšanās cilvēka pozas novērtēšanai. IEEE Computer Society konferences par datoru redzi un modeļu atpazīšanu materiālos, Longbīčā, Kalifornijā, ASV, 2019. gada 15.–20. jūnijā; 5686.–5696. lpp.

39. Kollers, O.; Zargarāns, S.; Ney, H. Re-Sign: Re-Aligned end-to-End Sequence Modeling with Deep Recurrent CNN-HMM. Notiek 2017. gada IEEE konferences par datoru redzi un modeļu atpazīšanu (CVPR), Honululu, HI, ASV, 2017. gada 21.–26. jūlijs; 3416.–3424.lpp.

40. Džou, H.; Džou, V.; Li, H. Dinamiskā pseido etiķetes dekodēšana nepārtrauktai zīmju valodas atpazīšanai. 2019. gada IEEE starptautiskās konferences par multimediju un izstādi (ICME) materiāliem Šanhajā, Ķīnā, 2019. gada 18.–21. jūlijā; 1282.–1287.lpp.

41. Xiao, Q.; Čangs, X.; Džans, X.; Liu, X. Video balstīta zīmju valodas atpazīšana bez laika segmentācijas. In Proceedings of the Thirty-Second AAAI Conference on Artificial Intelligence, Ņūorleāna, LA, ASV, 2018. gada 2.–7. februāris; 2257.–2264.lpp.

42. Graves, A.; Fernandess, S.; Gomess, F.; Schmidhuber, J. Connectionist Temporal Classification: Labeling Unsegmented Sequence Data with Recurrent Neural Networks. In Proceedings of ICML '06: Proceedings of 23. International Conference on Machine learning, Pitsburgh, PA, ASV, 2006. gada 25.–29. jūnijs; 369.–376.lpp.

44. Graves, A.; Livickis, M.; Fernandess, S.; Bertolami, R.; Bunke, H.; Šmidhūbers, J. Jauna konnekcionistu sistēma neierobežotai rokraksta atpazīšanai. IEEE Trans. Pattern Anal. Mačs. Intell. 2009, 31, 855–868. [CrossRef]

44. Guo, D.; Džou, V.; Li, H.; Wang, M. Hierarhiskā LSTM zīmju valodas tulkošanai. In Proceedings of the AAAI Conference on Artificial Intelligence, Ņūorleāna, LA, ASV, 2018. gada 2.–7. februāris; 6845.–6852.lpp.

45. Rahmans, MM; Vatanobe, Y.; Nakamura, K. Divvirzienu LSTM valodas modelis koda novērtēšanai un labošanai. Symmetry 2021, 13, 247. [CrossRef]

46. ​​Hu, V.; Cai, M.; Čens, K.; Dings, H.; Saule, L.; Liang, S.; Mo, X.; Huo, Q. Secību diskriminējoša apmācība bezsaistes rokraksta atpazīšanai, izmantojot interpolētu CTC un bezrežģa MMI mērķa funkciju. In Proceedings of the International Conference on Document Analysis and Recognition, ICDAR, Kioto, Japāna, 2017. gada 9.–15. novembris; 1.sējums, 61.–66.lpp.

47. Jošimura, T.; Hajaši, T.; Takeda, K.; Watanabe, S. Pilnīga automātiskā runas atpazīšana, kas integrēta ar CTC balstītu balss darbību noteikšanu. In Proceedings of ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing, Barselona, ​​Spānija, 2020. gada 4.–8. maijs; 6999.–7003.lpp.

48. Guo, D.; Vangs, S.; Tian, ​​Q.; Wang, M. Dense Temporal Convolution Network for Sign Language Translation. Divdesmit astotās starptautiskās apvienotās mākslīgā intelekta konferences (IJCAI-19) dokumentos, Makao, Ķīna, 2017. gada 10.–16. augusts; 744.–750.lpp.

49. Van, S.; Guo, D.; Džou, V.; Ža, Z.; Wang, M. Konekcionistu laika saplūšana zīmju valodas tulkošanai. 26. ACM starptautiskās konferences par multimediju materiāliem, Seula, Koreja, 2018. gada 22.–26. oktobris; 1483.–1491.lpp.

50. Jaņs, Z.; Shi, Z. SF-Net: Strukturētu funkciju tīkls nepārtrauktai zīmju valodas atpazīšanai. arXiv 2019, arXiv:1908.01341.

51. Cheng, KL; Jans, Z.; Čens, K.; Tai, Y. Pilnībā konvolucionāli tīkli nepārtrauktai zīmju valodas atpazīšanai. Eiropas Datorredzes konferences materiālos, Glāzgovā, Apvienotajā Karalistē, 2020. gada 23.–28. augustā; 697.–714.lpp.

53. Kollers, O.; Nejs, H.; Bowden, R. Deep Hand: Kā apmācīt CNN uz 1 miljonu roku attēlu, kad jūsu dati ir nepārtraukti un vāji marķēti. In Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Lasvegasa, NV, ASV, 2016. gada 27.–30. jūnijs; 3793.–3802.lpp.

53. Slimane, FB Kontekstam ir nozīme: Sevis uzmanība zīmju valodas atpazīšanai. arXiv 2021, arXiv:2101.04632.

55. Niu, Z.; Mak, B. Daudzstāvu zīmju spīdumu stohastiskā smalkgraudaina marķēšana nepārtrauktai zīmju valodas atpazīšanai. Eiropas Datorredzes konferences materiālos, Glāzgovā, Apvienotajā Karalistē, 2020. gada 23.–28. augustā; 1.–16.lpp.

55. Cui, R.; Liu, H.; Džans, C. Dziļi neironu ietvars nepārtrauktai zīmju valodas atpazīšanai ar iteratīvu apmācību. IEEE Trans. Multimed. 2019, 21, 1880–1891. [CrossRef]

56. Pū, J.; Džou, V.; Hu, H.; Li, H. Nepārtrauktas zīmju valodas atpazīšanas veicināšana, izmantojot krusteniskās modalitātes palielināšanu. 28th ACM International Conference on Multimedia, Sietlā, Vašingtonā, ASV, 2020. gada 12.–16. oktobris; 1497.–1505.lpp.

Jums varētu patikt arī