Udforskning af selvovervågede synstransformere til ganggenkendelse i det vilde, del 3
Nov 24, 2023
Vi bruger en simpel upsample til at interpolere mellem tilstødende samlinger (figur 3). Men naivt at gøre det på skelettet resulterer i falske led på tværs af skelettet, uanset valget af skeletformater (f.eks. OpenPose eller COCO), da ledordenen ikke bevarer nogen semantisk betydning.
Ledsekventering refererer til at bevæge kroppens led i en bestemt rækkefølge. Denne form for træning spiller en vigtig rolle i at opretholde fysisk sundhed og forbedre kroppens hukommelse.
Først og fremmest kan ledsekventering fremme koordineret bevægelse af forskellige dele af kroppen, øge muskelstyrken og forbedre hjerte-lungefunktionen, som alle er med til at opretholde et godt helbred. Samtidig kan regelmæssig ledjustering reducere kroppens stivhed og smerte, forbedre kropsholdning og balance og forsinke nedgangen i fysisk funktion forårsaget af alder.
For det andet kan fælles sekventering også forbedre hukommelsen. Forskning viser, at motion kan stimulere væksten og forbindelserne af hjerneneuroner og derved fremme udvekslingen af information mellem neuroner, hvilket kan hjælpe med at forbedre hukommelsen og indlæringsevnen. Den sekventerede bevægelse af led kræver, at hjernen giver præcise instruktioner til forskellige kropsdeles bevægelser, hvilket er til stor hjælp for udviklingen af hjernens koordinations- og hukommelsesevner.
Endelig kan ledsekventering også lindre stress og angst og forbedre følelsesmæssig stabilitet. Motion kan frigive nogle stoffer i kroppen, såsom dopamin og endorfiner, som kan hjælpe med at lindre følelsesmæssige problemer og forbedre kroppens følelse af lykke og tilfredshed. Disse faktorer har også en positiv indvirkning på at forbedre hukommelsen.
Sammenfattende er der en positiv sammenhæng mellem ledsekventering og hukommelse. Gennem regelmæssige ledsekvensøvelser kan du fremme en sund krops- og hjerneudvikling, forbedre hukommelsen og indlæringsevner og forbedre følelsesmæssig stabilitet. Lad os være opmærksomme på et godt helbred og nyde livets skønhed sammen! Det kan ses, at vi skal forbedre hukommelsen, og Cistanche deserticola kan forbedre hukommelsen markant, fordi Cistanche deserticola er et traditionelt kinesisk medicinsk materiale, der har mange unikke effekter, hvoraf en er at forbedre hukommelsen. Effektiviteten af hakket kød kommer fra de forskellige aktive ingredienser, det indeholder, herunder syre, polysaccharider, flavonoider osv. Disse ingredienser kan fremme hjernens sundhed på forskellige måder.

Klik på kend kosttilskud for at forbedre hukommelsen
Denne observation er i tråd med arbejdet af Yang et al. [44], som foreslår et træstrukturskeletbillede (TSSI) for at foreslå de rumlige forhold mellem leddene. Den er baseret på en dybde-første trægennemløbsrækkefølge af led, som bevarer skelettets strukturelle information. Figur 3 (til højre), viser virkningerne af forskellige skeletformater og upsample metoder. Til denne størrelsesændringsmetode brugte vi TSSI-format og bikubisk interpolation.
Desuden eksperimenterede vi med to opskaleringsmetoder, som kunne læres under træningen. Vi brugte et simpelt lineært lag på hvert fladt skelet for at øge antallet af led. Dette er den mest ligetil måde at transformere hvert skelet på, men det tager ikke højde for nogen rumlige relationer mellem leddene. For at imødegå dette, anvender vi også et sæt 2D-dekonvolutionelle lag på skeletsekvensen til at ændre størrelsen, mens der også tages hensyn til den strukturelle information; til denne metode anvender vi også TSSI-formatet.
Tabel 1 viser resultaterne for hver størrelsesændringsmetode for alle arkitekturer. Modellerne blev trænet og evalueret på CASIA-B i 200 epoker, og vi viser resultater for normal gang. For resten af vores eksperimenter valgte vi at upsample skeletsekvensen med bikubisk interpolation.


Selvom der er flere mulige selvovervågede fortræningsprocedurer, valgte vi en kontrastiv fortræningstilgang, da det er den samme procedure for selve genfindingsopgaven med ganggenkendelse. Kontrastive tilgange tilskynder repræsentationer, der tilhører den samme klasse, til at være tæt på det latente rum, mens de samtidig er fjernt fra repræsentationer, der tilhører forskellige klasser.
Især bruger vi Supervised Contrastive [45]til fortræning. SupCon-tab fungerer på en multi-viewet batch: hver prøve i batchen har flere udvidede versioner af sig selv. Det viste sig naturligt at være mere robust over for datakorruption, det letter behovet for omhyggelig udvælgelse af tripletter, da gradienten tilskynder til at lære af hårde eksempler og er mindre følsom over for hyperparametre.

3.4. Dataforøgelse
Træning på en selvovervåget kontrastiv måde med SupCon-tab indebærer brugen af dataforøgelse for at give flere forstærkede "visninger" af den samme skeletsekvens. Forstørrelser, der bruges til vores gåskeletsekvenser, er på linje med andre værker på dette område [10,12, 30]. Den primære forstærkning, der bruges, er tilfældig tidsmæssig beskæring med en periodelængde på T=64 rammer.
I betragtning af at skeletter spores i en variabel varighed af tid, bruger vi beskæring for at sikre, at alle sekvenser har samme længde. Desuden kan en gående person ændre retning og udføre andre handlinger på tværs af den sporede varighed; følgelig inducerer beskæring mere variabilitet for den samme sekvens.
Desuden ændrer vi gangtempoet ved at sætte farten ned eller fremskynde gåturen. Vi brugte hastighedsmodifikatorer af {{{0}}.5, 0.75, 1, 1.25, 1.5, 1.75, 2.0}. Dette er tilpasset fra arbejdet af Wang et al. [48] til selvovervåget indlæring af videorepræsentationer. Desuden er pacemodifikation tidligere blevet brugt i ganganalyse [33].
Vi bruger også tilfældig vending med en sandsynlighed på {{0}}.5, sekvensvending med en sandsynlighed på 0.5, additiv gaussisk støj for hvert led med σ=0.005, og tilfældigt frafald af 5% af leddene med en sandsynlighed på 0,01 for at simulere manglende led fra poseestimeringsmodellen.

3.5. Initialiseringsmetoder
For at måle virkningen af selvovervåget fortræningsydelse på de foreslåede arkitekturer, udforsker vi tre forskellige initialiseringsmetoder. Tabel 2 viser de forskellige datasæt, der er brugt i litteraturen. Mens CASIA-B [6] og FVG[29] er kontrollerede datasæt, mest brugt til evaluering, bruger vi DenseGait [12] og GREW [7] til selvovervåget fortræning for de fem arkitekturer. DenseGait og GREW er to af de største realistiske gangdatabaser, samlet i udendørs omgivelser, som formentlig indeholder størstedelen af gangvariationer, adfærd og kompleksiteter, der er til stede i hverdagen. Vi vælger disse datasæt for at have mere generelle gangrepræsentationer, for at give mulighed for generelle overvågningsscenarier for gangautentificering.

DenseGait Pretraining DenseGait er et storstilet "i naturen" gangdatasæt, der indsamles automatisk fra overvågningsstrømme. Den indeholder 217 K sporede skeletsekvenser, ekstraheret ved hjælp af AlphaPose [22], i forskellige miljøer og kameravinkler fra multigeografiske placeringer. Da DenseGait indsamles automatisk, er dets annoteringer i form af sporingsidentifikatorer støjende, og datasættet kan indeholde sekvenser om det samme emne, selvom dette er en sjælden forekomst. Dette er dog tilfældet for størstedelen af umærkede datasæt i stor skala, der indeholder prøver, der tilhører den samme semantiske klasse, hvilket anses for at være irrelevant under træning. Vi fortræner hver arkitektur på DenseGait og bruger de trænede parametre til yderligere downstream-ydelsesevaluering af de kontrollerede datasæt.
GREW Pretraining GREW er et andet udendørs "i naturen" datasæt, men er omhyggeligt kommenteret, så det indeholder gående emner på tværs af flere dage og forskellige typer tøj. For at overholde kravene i det selvovervågede regime skal vi dog kassere annoteringerne og behandle hver gangsekvens som en separat person. GREW er 2× mindre end DenseGait, der indeholder 128 K skeletsekvenser, samtidig med at hver fodgænger spores i en mindre gennemsnitlig varighed [12]. Vi træner også hver arkitektur på GREW og bruger de trænede parametre til downstream-ydelsesevaluering.
Tilfældig initialisering Denne initialiseringsmetode svarer til ingen fortræning (dvs. træning fra bunden). Hver arkitektur trænes med tilfældig vægtinitialisering på downstream-datasættene. Denne metode er en baseline til at sammenligne præstationsgevinsten ved fortræning.
3.6. Evaluering
Nedstrøms opgaveudførelse evalueres på to forskellige måder til ganggenkendelse. Vi tester direkte genfindingsmulighederne i forudtrænede arkitekturer uden at finjustere til en specifik opgave. Denne metode svarer til nul-skudsoverførsel. Ydermere finjusterer vi hver arkitektur ved hjælp af en 10× mindre indlæringshastighed end under fortræning, med en gradvist mindre indlæringshastighed i begyndelsen af netværket, tilsvarende tolayer-wise learning rate decay (LLRD) [50] politik.
Evalueringen af downstream-ydelsen udføres på to populære ganggenkendelsesdatasæt: CASIA-B [6] og FVG [29]. Begge datasæt indeholder et lille antal emner under strenge gangprotokoller, som styres over forskellige forvirrende faktorer: kameravinkel, tøj, tilbehør og ganghastighed.
CASIA-B er et indendørs datasæt, der indeholder 124 motiver optaget fra 11 synkroniserede kameraer. Hver enkelt går under tre forskellige forhold: normal gang, tøjskift og taskebæring. Siden den blev udgivet, har den været en fast bestanddel til benchmarking af ganganalysemodeller, idet den er et af de mest brugte datasæt på dette område. Vi bruger de første 62 emner som træningssættet og resten af de 62 til præstationsevaluering. For gangartgenkendelse vælger vi at evaluere ydeevne på en per-vinkel basis i en "leave-one-out" indstilling, hvor gallerisættet indeholder alle gangvinkler undtagen sondevinklen.
Front-View Gait er et andet populært datasæt til gangartgenkendelse, der har 226 forsøgspersoner, der går udendørs under forskellige protokoller. Til forskel fra CASIA-B har FVG yderligere forvirrende faktorer: ganghastighed, rodet baggrund og tidens gang (dvs. nogle forsøgspersoner har registreret gåture, der strækker sig over et år). Desuden optages alle motiver med en fremadvendt kameravinkel, som betragtes som den sværeste vinkel til ganggenkendelse, da den indeholder den mindste mængde af opfattede ledbevægelsesvariationer. Vi brugte de første 136 emner til træning og resten til præstationsevaluering. Præstationsevaluering for ganggenkendelse overholder de protokoller, som forfatterne har skitseret, hvor vi bruger den normale gangsekvens i gallerisættet og de øvrige betingelser i sondesættet.

For alle evalueringsscenarier bruger vi deterministisk beskæring i midten af gangsekvensen og bruger ingen test-tidsforstørrelser.
4. Eksperimenter og resultater
4.1. Evaluering af CASIA-B
Vi fortræner hver arkitektur på henholdsvis DenseGait og GREW og evaluerer ydeevnen på CASIA-B og FVG. I det første sæt af eksperimenter er vi interesseret i at inevaluere ydeevnen af CASIA-B i et finjusteringsscenarie efter fortræning med progressivt større træningsprøver. Vi trænede hvert netværk på de første 62 identiteter, med alle tilgængelige gangvarianter, og beholdt resten til test. Genkendelsesevaluering blev udført ved at bruge de første 4 normale gangprøver som gallerisæt, og resten er et probesæt. Figur 4 viser nøjagtigheden for hver af de tre gangvariationer (normalt - NM, tøj - CLm og bæretaske - BG) for CASIA-B. Til dette scenarie blev tilfældigt samplet K={1, 2, 3, 5, 7, 10} gåture pr. emne, pr. vinkel og trænet modellen. Selvom ydeevnen er relativt ens mellem arkitekturer, er det klart, at fortræning giver et betydeligt løft i ydeevne sammenlignet med tilfældig initialisering, uanset valget af fortræningsdatasæt.
Desuden ser SimpleViT, CrossFormer og Twins-SVT ud til at have lignende høj ydeevne, mens Token2Token halter lidt. Dette tyder på, at den progressive tokeniseringsmetode, der bruges i Token2Token, som er specielt designet til billedlignende strukturer, ikke effektivt fanger karakteristikaene ved gangsekvenser. Der er en mærkbar forskel mellem fortræningsdatasættene: DenseGaits synes at tilbyde en ensartet præstationsforøgelse i de to gangvariationer (CL ogBG) sammenlignet med GREW. Dette er udtryk for, at DenseGait indeholder mere udfordrende og realistiske scenarier, der bedre forbereder modellen til forhold, hvor gangmønsteret er påvirket af eksterne faktorer.



Arkitekturerne er trænet til at kortlægge gangsekvenser til et indlejringsrum, hvor nærheden mellem punkter afspejler ligheden mellem de tilsvarende gangsekvenser. Det betyder, at indlejringerne af usete gangsekvenser fra den samme identitet skal være tæt på hinanden i indlejringsrummet og danne klynger, mens indlejringerne af forskellige identiteter skal være længere væk fra hinanden og danne distinkte klynger. Dette er vigtigt, da det giver modellen mulighed for at generalisere til usete gangsekvenser og nøjagtigt identificere individet ved at anvende en nærmeste-nabo-tilgang. I figur 5 præsenterer vi clustering for indlejringerne for hver identitet i testsættet af CASIA-Bafter dimensionalitetsreduktion med t-SNE [51]. Vi brugte den 256-dimensionelle indlejringsvektor og projicerede den i to dimensioner. SimpleViT og CrossFormer ser ud til at have den bedste adskillelse af identiteter, uanset kameraets synspunkt.

4.2. Evaluering af FVG
På samme måde evaluerede vi ydeevnen af hver arkitektur på FVG, som er kvalitativt forskellig fra CASIA-B, da den kun indeholder en enkelt betragtningsvinkel. Vi finjusterer forudtrænede netværk på en brøkdel af={0.1, 0.2, 0.3, {{10 }}.5, 0.7, 1.0} af de 12 løb pr. person i træningssættet. Finjusteringsresultater er præsenteret i figur 6. Resultaterne følger samme tendens som dem for CASIA-B: SimpleViT og CrossFormer har konsekvent høje ydeevner, og brugen af et fortræningsdatasæt er gavnligt for downstream-ydeevnen. Yderligere ser det ud til, at fortræning på DenseGait fortsætter med en konstant forbedring af nøjagtigheden. Som bemærket af Cosma og Radoi [12], indeholder DenseGait emner, der spores i længere tid, og dette giver mere variation i det kontrastive læringsmål, svarende til tilfældig beskæring til selvovervåget fortræning til naturlige billeder. I lighed med resultaterne på CASIA-B halter tøjvariationen alvorligt bagefter det normale gangscenario.
I tabel 4 præsenterer vi mere finkornede resultater på testsættet af FVG mellem fortrænede modeller, svarende til CASIA-B-scenariet. Fortræningsresultater er konsistente: fortræning på DenseGait korrelerer direkte med forbedringen i downstream-nøjagtigheden. Mens fortræning på begge datasæt forbedrer ydeevnen i alle scenarier, er forbedringen særligt signifikant i CBG-scenariet (Cluttered Background), som normalt består i at have flere mennesker i videoen, svarende til hvad der ville forventes urealistiske indstillinger. Denne forbedring kommer sandsynligvis fra det faktum, at DenseGait og GREW blev samlet i naturlige, ukontrollerede miljøer, hvilket gør dem mere realistiske og udfordrende, og dermed bedre forberedt modellen til lignende forhold som dem i CBG-scenariet. Rangeringen mellem modellerne ligner CASIA-B: SimpleViT, CrossFormer og Twins-SVT overgår konsekvent CaiT og Token2Token. For både CASIA-B og FVG halter CaiT lidt efter andre modeller.

4.3. Spatiotemporal følsomhedstest
En særlig egenskab ved vision-transformatorer er det vilkårlige valg af patch-dimensioner, som kan vise sig at være afgørende for den endelige ydeevne. I tilfælde af billedbehandling er patch-dimensioner ikke særlig vigtige på grund af den translationelle invarians af det semantiske indhold i et billede.
For skeletsekvenser svarer patch-dimensioner imidlertid til specifikke og fortolkbare egenskaber ved inputtet: patch-højde repræsenterer mængden af rumlig information indeholdt i en patch (dvs. antallet af skeletled inkluderet), mens de tidsmæssige dimensioner repræsenterer mængden af inkluderet tidsmæssig information ( dvs. antal billeder). Balancen mellem de to bør nøje overvejes ved brug af tilpassede synstransformere til ganganalyse. I figur 7 viser vi et varmekort, hvor hver celle er ydeevnen af en trænet model (tilfældigt initialiseret) på CASIA-B til normal gang. Vi træner hver model i 50 epoker for en rimelig sammenligning og for at måle konvergenshastigheden ved et fast antal trin.
Vi konstruerede to varmekort, et til SimpleViT og et til CaiT, da de har en lignende underliggende rygrad, og det er ligetil at ændre patchstørrelserne. Den samme proces kan udføres for de andre testede arkitekturer. Vi konkluderer, at mindre patchstørrelser svarer til en positiv stigning i modelleringsydeevne for skeletsekvenser, mens afvejningen mellem rumlige og tidsmæssige dimensioner ikke er afgørende, da ydeevnen er ens - varmekortmatricen er ret symmetrisk med den anden diagonal. Derfor klarer mindre firkantede patchstørrelser såsom (2, 4) på tværs af rumlige og tidsmæssige dimensioner sig bedst til denne opgave, mens større patchstørrelser såsom (32, 32) indeholder for lidt diskriminerende information. Men mindre patchstørrelser øger blot antallet af patches, hvilket kræver mere computerkraft. Til vores opsætning af to NVIDIA RTX 3060 GPU'er rapporterede vi fejl i hukommelsen for nogle kombinationer af mindre patchstørrelser.

Den mest sandsynlige årsag til den forbedrede ydeevne med mindre patchstørrelser er, at arkitekturen bedre kan fange kompleksiteten af gangmønsteret ved at beregne mere indviklede interaktioner mellem patches. Pletter med størst mulige rumlige størrelser og mindst mulige tidsmæssige størrelser kan betragtes som fulde repræsentationer af skeletter, hvorimod pletter med størst mulige tidsmæssige størrelser og mindst mulige rumlige størrelser fanger hele det enkelte leds bevægelser. Som det kan ses, opnås den højeste nøjagtighed, når plasterstørrelsen inkorporerer en balance mellem både rumlig og tidsmæssig information, som svarer til små bevægelser af tæt forbundne led.
5. Diskussion og konklusioner
I dette arbejde leverede vi en omfattende evaluering af fem populære varianter af vision-transformatoren tilpasset til skeletsekvensbehandling. Vores indsats er i tråd med de seneste fremskridt inden for dyb læring for i det væsentlige at forene de forskellige modaliteter under transformatorarkitekturen. Vi foreslog en spatial upsampling-metode for skeletter (bicubicupsampling med TSSI-skeletformat) for kunstigt at øge antallet af led, således at sekvensen kan forbruges korrekt af transformatorkoderne. Desuden blev hver arkitektur trænet under træningsparadigmet for selvovervågning på to generelle og store gangdatasæt (dvs. DenseGait og GREW), og efterfølgende evalueret på to datasæt til ganggenkendelse i kontrollerede miljøer (dvs. CASIA-B og FVG). Vi valgte at anvende det selvovervågede læringsparadigme for at opnå generelle gangfunktioner, ikke begrænset til en bestemt gåvariation eller kamerasynspunkt.
Vores resultater antyder behovet for høj kvantitet, høj kvalitet og forskelligartede datasæt til fortræning af ganganalysemodeller. Vi viste, at fortræning på DenseGait tilbyder konsekvente nøjagtighedsforbedringer i forhold til GREW, på grund af stigningen i størrelse, antallet af variationer og den gennemsnitlige gåtid [12]. Den største fordel er dog i situationer med lave mængder træningsdata til rådighed. Vores resultater viser, at træning fra bunden fører til væsentligt dårligere resultater end finjustering, selv med beskedne mængder data (dvs. 10 sekvenser pr. person). I øjeblikket udføres de fleste gangtilgange indendørs i strengt kontrollerede miljøer, som ikke kan generaliseres til kompleksiteten af interaktioner i den virkelige verden. Forskellige træningsdatasæt er afgørende for at udføre nøjagtige adfærdsanalyser i naturen, især da gangart er et biometrisk træk, der let påvirkes af eksterne miljøfaktorer såvel som interne og følelsesmæssige komponenter.

Vores ablationsundersøgelse viser, at mindre rumlige-temporale pletter er gavnlige for bedre resultater nedstrøms. Denne indsigt informerer om fremtidige udviklinger af arkitekturforskellesekvenser, som tidligere har været afhængige af at behandle et individuelt skelet på en enkelt patch [12].
Udover samtidige bestræbelser på at bringe ganganalyse ind i realistiske omgivelser, muliggør vores arbejde videre overgangen af gangautentificering og adfærdsanalyse fra indendørs, kontrollerede miljøer til udendørs, virkelige omgivelser. In-the-wild ganggenkendelse vil blive allestedsnærværende med udviklingen af smarte sensorer og effektive neurale arkitekturer, der behandler bevægelsesdrevet adfærd i realtid.


Referencer
1. Kyeong, S.; Kim, SM; Jung, S.; Kim, DH Gangmønsteranalyse og klinisk undergruppeidentifikation: En retrospektiv observationsundersøgelse. Medicin 2020, 99, e19555. [CrossRef] [PubMed]
2. Michalak, J.; Troje, NF; Fischer, J.; Vollmar, P.; Heidenreich, T.; Schulte, D. Legemliggørelse af tristhed og depression - gangmønstre associeret med dysforisk stemning. Psykosom. Med. 2009, 71, 580-587. [CrossRef] [PubMed]
3. Willems, TM; Witvrouw, E.; De Cock, A.; De Clercq, D. Gangrelaterede risikofaktorer for træningsrelaterede underbenssmerter under skoløb. Med. Sci. Sportsøvelse. 2007, 39, 330-339. [CrossRef] [PubMed]
4. Singh, JP; Jain, S.; Arora, S.; Singh, UP Synsbaseret ganggenkendelse: En undersøgelse. IEEE Access 2018, 6, 70497–70527. [CrossRef]
5. Makihara, Y.; Nixon, MS; Yagi, Y. Ganggenkendelse: Databaser, repræsentationer og applikationer. Comput. Vis. Ref. Vejledning 2020,1–13.
6. Yu, S.; Tan, D.; Tan, T. En ramme til evaluering af virkningen af synsvinkel, påklædning og bæreevne på ganggenkendelse. I Proceedings of the 18th International Conference on Pattern Recognition (ICPR'06), Hong Kong, Kina, 20.-24. august 2006; bind 4, s. 441-444.
7. Zhu, Z.; Guo, X.; Yang, T.; Huang, J.; Deng, J.; Huang, G.; Du, D.; Lu, J.; Zhou, J. Ganggenkendelse i naturen: Et benchmark. InProceedings af IEEE International Conference on Computer Vision (ICCV), Montreal, BC, Canada, 11.-17. oktober 2021.
8. Chao, H.; Hej.; Zhang, J.; Feng, J. Gaitset: Angående gangart som et sæt til genkendelse af gangart på tværs. I Proceedings of the AAAI Conference on Artificial Intelligence, Honolulu, HI, USA, 27. januar-1. februar 2019; Bind 33, s. 8126–8133.
9. Fan, C.; Peng, Y.; Cao, C.; Liu, X.; Hou, S.; Chi, J.; Huang, Y.; Li, Q.; He, Z. Gaitpart: Temporal del-baseret model for gangartgenkendelse. I Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Seattle, WA, USA, 13.-19. juni 2020; s. 14225–14233.
10. Cosma, A.; Radoi, IE WildGait: At lære gangrepræsentationer fra rå overvågningsstrømme. Sensorer 2021, 21, 8387. [CrossRef][PubMed]
For more information:1950477648nn@gmail.com






