Selvitä itsevalvottuja näkömuuntajia kävelyn tunnistamiseen villissä osassa 1
Nov 24, 2023
Abstrakti:
Kävelytapa (kävely) on tehokas biometrinen mittari, jota käytetään ainutlaatuisena sormenjälkien ottomenetelmänä, joka mahdollistaa huomaamattoman käyttäytymisanalyysin suorittamisen etäältä ilman subjektin yhteistyötä.
Me kaikki tiedämme, että liikunta edistää terveyttä. Tämän lisäksi liikunta parantaa muistia. Kävely on yksinkertaisin ja helpoin harjoittelumuoto, ja monet ihmiset nauttivat rentoutumisesta kävellessä tai lenkkeilyssä. Nyt enemmän tutkimuksia osoittaa, että kävely tekee voimakkaita asioita aivoille.
Ensinnäkin kävely stimuloi aivojen hermostoa, mikä auttaa vahvistamaan aivojen toimintaa. Kun keho liikkuu, sykemme ja verenkiertomme lisääntyvät, mikä myös stimuloi aivoja tuottamaan lisää hermosoluja ja synapseja. Näiden neuronien ja synapsien väliset yhteydet voivat luoda uusia hermoverkkoja ja nopeampia ajatusprosesseja.
Toiseksi kävely voi lievittää stressiä ja ahdistusta, mikä on erittäin tärkeää muistin parantamiseksi. Kun mieli ja keho ovat jännittyneessä, masennuksessa tai ahdistuneessa tilassa, aivot vapauttavat hormonia, jota kutsutaan kortisoliksi. Kortisoli vahingoittaa aivojen hermosoluja ja synapseja, mikä voi johtaa muistin menettämiseen. Kävely lievittää stressiä ja ahdistusta, vähentää kortisolin tuotantoa kehossa ja auttaa ylläpitämään terveitä hermosoluja ja synapsia.
Lopuksi kävely lisää verenkiertoa aivoissa. Jotkut tutkimukset osoittavat, että hyvä verenkierto voi parantaa muistia. Iän myötä aivojen verisuonet tukkeutuvat vähitellen, mikä johtaa riittämättömään hapen saantiin aivoihin. Kävely voi parantaa sydämen terveyttä, jolloin sydän pystyy toimittamaan happea ja ravinteita aivoihin tehokkaammin, mikä edistää muistia ja aivojen toimintaa.
Siksi kävely on loistava liikuntamuoto niin nuorille kuin vanhoillekin. Fyysisen terveyden parantamisen lisäksi kävely voi myös parantaa muistia. Kävelkäämme matkaa joka päivä tehdäksemme itsestämme terveempiä ja parempia! Voidaan nähdä, että meidän on parannettava muistia, ja Cistanche deserticola voi parantaa muistia merkittävästi, koska Cistanche deserticola on perinteinen kiinalainen lääkeaine, jolla on monia ainutlaatuisia vaikutuksia, joista yksi on parantaa muistia. Jauhetun lihan teho perustuu sen sisältämiin erilaisiin vaikuttaviin ainesosiin, mukaan lukien happo, polysakkaridit, flavonoidit jne. Nämä ainesosat voivat edistää aivojen terveyttä monin tavoin.

Napsauta Tiedä 10 tapaa parantaa muistia
Toisin kuin perinteisemmät biometriset todennusmenetelmät, kävelyanalyysi ei edellytä tutkittavan nimenomaista yhteistyötä ja se voidaan suorittaa matalaresoluutioisissa olosuhteissa ilman, että kohteen kasvot ovat esteettömät/näkyvät. Useimmat nykyiset lähestymistavat on kehitetty kontrolloidussa ympäristössä puhtailla, kultastandardin mukaisilla huomautuksilla varustetuilla tiedoilla, jotka ovat johtaneet hermoarkkitehtuurien kehittämiseen tunnistamista ja luokittelua varten.
Vasta äskettäin kävelyanalyysi on uskaltanut käyttää monipuolisempia, laajempia ja realistisempia tietojoukkoja esikoulutettuihin verkkoihin itsevalvotulla tavalla. Itseohjattu harjoitusohjelma mahdollistaa monipuolisten ja vankkojen kävelyesitysten oppimisen ilman kalliita manuaalisia ihmismerkintöjä. Tässä työssä muuntajamallin yleisen käytön johdosta kaikilla syväoppimisen alueilla, mukaan lukien tietokonenäkö, tutkimme erilaisten näkömuuntaja-arkkitehtuurien käyttöä, joita sovelletaan suoraan itseohjautuvaan kävelyntunnistukseen.
Mukaamme ja koulutamme uudelleen yksinkertaisia ViT-, CaiT-, CrossFormer-, Token2Token- ja TwinsSVT-tiedostoja kahdella erilaisella laajamittaisella kävelytietojoukolla: GREW ja DenseGait. Tarjoamme laajoja tuloksia nollasta ja hienosäätöstä kahdella kävelyntunnistustietojoukolla, CASIA-B:llä ja FVG:llä, ja tutkimme visuaalisen muuntajan käyttämän spatiaalisen ja ajallisen kulkutiedon välistä suhdetta.
Tuloksemme osoittavat, että muuntajamallien suunnittelu liikkeen prosessoimiseksi käyttää hierarkkista lähestymistapaa (eli CrossFormer-malleja) hienojakoisemmissa liikemessuissa suhteellisen paremmin kuin aiemmat koko luuranko -lähestymistavat.
Avainsanat:
kävelyn tunnistus; biometrinen todennus; visio muuntaja; asennon arvio; itseohjattu oppiminen; kontrastiivinen oppiminen.
1. Esittely
Se, miten liikumme, sisältää merkittäviä vihjeitä itsestämme. Erityisesti kävelyämme (kävelytapaamme) on tutkittu tarkasti lääketieteessä [1], psykologiassa [2] ja urheilutieteissä [3]. Tietojenkäsittelytiedeyhteisö on viime aikoina kiinnittänyt enemmän huomiota kävelyanalyysiin [4,5], mikä on samaan aikaan kuin syväoppimisen eksponentiaalinen edistyminen ja laskentalaitteistojen laaja saatavuus.
Tekoälyllä toimivat kävelyanalyysijärjestelmät ovat onnistuneet tunnistamaan kohteet [6–10], arvioimaan demografisia tietoja, kuten sukupuolen ja iän [11], ja arvioimaan ulkoisia ominaisuuksia, kuten vaatteita [12], käyttämättä mitään ulkoisen ulkonäön vihjeitä. Nämä tulokset eivät ole yllättäviä, kun otetaan huomioon suuri määrä yksilöllisiä eroja kävelyssä, jotka johtuvat eroista tuki- ja liikuntaelimistön rakenteessa, geneettisissä ja ympäristötekijöissä sekä kävelijän tunnetilasta ja persoonasta [13].
Nykyiset järjestelmät on todella koulutettu ja testattu vain valvotuissa sisäympäristöissä. Useimmat menetelmät käyttävät CASIA-B-tietoaineistoa [6] kävelyntunnistusmallien vakiovertailuna, joka sisältää 124 kohdetta, jotka kävelevät sisätiloissa tiukasti kontrolloidusti useilla kameroilla kuvattuna. Reaalimaailman monimutkaisuutta ei voida täysin mallintaa tällaisilla hillityillä skenaarioilla. Vasta äskettäin painopiste on ollut kävelyn mallintamisessa "luonnossa" tietojoukoilla, kuten DenseGait [12], GREW [7] ja Gait3D [14].

Laajamittainen puhtaan ja täysin merkityn tietojoukon kerääminen merkitsee valtavaa työtä sekä taloudellisten resurssien että varatun ajan kannalta. GREW-tietojoukon [7] kerrottiin, että sen kerääminen ja merkitseminen kesti 3 kuukautta jatkuvaa työtä. Vaikka tällaiset lähestymistavat ovat olleet hyödyllisiä kehitettäessä hermoarkkitehtuuria kävelyn prosessoimiseksi [8,9], ne eivät ole riittävän monipuolisia, jotta niitä voitaisiin käyttää oikein rennommissa, todellisissa ympäristöissä.
Tekoälyyhteisö on vähitellen siirtymässä pois tästä lähestymistavasta muilla aloilla, ja sekä näön [15] että kielen [16] itseohjatun oppimisen menetelmät ovat saavuttaneet merkittävää vetovoimaa ja usein ohittaneet perinteiset ohjatut menetelmät. Äskettäin edistynyt itseohjattu oppiminen osoitti, että itseohjatut mallit ovat vahvempia ja esittelevämpiä käyttäytymismalleja, joita ei ole määritelty koulutuksen aikana.
Esimerkiksi DINO [17], näönmuuntaja, joka on koulutettu itsevalvotussa järjestelmässä, oppi luokkakohtaisia ominaisuuksia, jotka mahdollistavat valvomattoman objektin segmentoinnin käyttämättä tällaisia merkintöjä koulutuksen aikana. Cosmaand Radoi [10] ehdotti ensimmäistä kontrastiivista menetelmää itseohjautuvaan oppimiseen gaitaanalyysiä varten kouluttamalla ST-GCN [18] pienemmällä DenseGait-versiolla [12]. Heidän menetelmänsä sai kohtuullisia tuloksia myötävirran tunnistustehtävissä ja osoitti, että esikoulutetun tietojoukon koon ja nollakuvan siirtosuorituskyvyn välillä on vahva korrelaatio.
Vaikka monet lähestymistavat kävelyanalyysiin ovat käyttäneet taustavähennyksestä erotettuja siluetteja [6, 8, 9], siluettien poimiminen todellisissa valvontaskenaarioissa edellyttää kehittyneempien tekniikoiden käyttöä, kuten instanssien segmentointia [19], mikä aiheuttaa korkeat laskennalliset kustannukset. Siluettien sekvenssit vievät paljon tallennustilaa eivätkä ole riittävän joustavia käytettäviksi muissa vierekkäisissä tehtävissä, kuten toimintojen tunnistamisessa. Lisäksi siluetit koodaavat hienovaraisia ulkoasun vihjeitä, minkä vuoksi on epäselvää, missä määrin liikettä tunnistuksessa hyödynnetään [20].
Toisaalta 2D-posestimaatiomalleista on tullut yhä tarkempia ja laskennallisesti tehokkaampia [21,22]. Luurankot ovat halpoja poimia ja tällä hetkellä luotettavampia kuin 3D-verkot ja 3D-asennot, erityisesti etänä. Lisäksi 2D-rungot ovat huomattavasti kevyempiä kuin siluetit pitkäaikaisen säilytyksen kannalta.
Nykyiset luurankosekvenssien käsittelyarkkitehtuurit hyödyntävät ihmisen luurangossa olevaa luonnollista spatiaalista kuvaajarakennetta, mikä tuo mallin suunnitteluun induktiivisen harhan. Mallit, kuten suositut ST-GCN [18] ja MS-G3D [23], ovat saaneet vaikuttavia tuloksia luurankopohjaisessa toiminnan tunnistamisessa.
Samanaikaisesti muuntajamallien käyttö on kasvanut räjähdysmäisesti lähes kaikilla syväoppimisen alueilla siitä lähtien, kun niitä alettiin soveltaa luonnollisen kielen käsittelyyn.
Muuntajat katsotaan yleisemmäksi arkkitehtuuriksi, jossa on vähän induktiivisia poikkeamia. Aluksi muuntajilla on ollut vaikeuksia sovittaa yhteen CNN-malleja kuvien luokittelussa [24], mutta ne ylittävät tällä hetkellä muut mallit ja osoittavat lupaavia tuloksia itsevalvotuissa skenaarioissa, enemmän kuin muun tyyppiset arkkitehtuurit, muuntajat ovat osoittaneet vaikuttavaa oppimiskykyä ja nousevaa käyttäytymistä itsensä alla. -valvonta [17].
Cosma ja Radoi [12] olivat ensimmäiset, jotka ehdottivat GaitFormeria, joka on suora sovitus visiomuuntajan kooderimallista kävelyntunnistusta varten. Se käyttää yksittäisiä luurankoja "laastarina" ja suoritti lähinnä vain ajallista huomioimista, huomioimatta avaruudellisia huomiosuhteita.
GaitFormer koulutettiin itseohjatulla tavalla ja ylitti muut kävelyntunnistusmenetelmät jopa ilman hienosäätöä. Tällainen aikaisempi työ on rohkaisevaa ja tasoittaa tietä syvällisemmälle tutkimukselle muuntajaarkkitehtuurien mahdollisesta soveltamisesta kävelyanalyysiin. Voidaanko näkömuuntajamalleja mukauttaa luurangon kävelyesitysten itseohjautuvaan oppimiseen?
Näkömuuntajien tärkein arkkitehtoninen ongelma on paikallisen ja globaalin tiedon määrittävien kuvapaikkojen välisten oikeiden suhteiden määrittäminen. Kävelyyn sovellettaessa patch-mittojen valinta vastaa luurankosekvenssin koodatun ajallisen ja spatiaalisen tiedon määrää.
Tässä työssä esittelemme laajan tutkimuksen viidestä erilaisesta näkömuuntajasta, jotka on mukautettu kävelyntunnistusta varten. Tutkimme klassista ViT-mallia [24], CaiT [25], CrossFormer [26], TwinsSVT [27] ja token-token ViT [28].

Kutakin arkkitehtuuria koulutetaan erikseen kontrastivastaisesti itsevalvotulla tavalla kahdella suurella mittakaavalla "villiin" -tietosarjaan 2D-käytävän luurankosekvenssit: DenseGait – automaattisesti kerätty tietojoukko rawsurveillance-virroista ja GREW, pienempi tietojoukko, joka sisältää puhtaita ihmismerkintöjä.
Tutkimme siirtoominaisuuksia kahden ohjatun tietojoukon välillä kävelyntunnistusta varten, CASIA [6] ja FVG [29]. Jokaisen tietojoukon osalta analysoimme suoran (nollakuvan) siirron ja tiedon tehokkuuden hienosäädön aikana harjoittelemalla asteittain suurempia tietojoukkoja. Lisäksi teemme ablaatiotutkimuksen SimpleViT:n ja CaiT:n patch-koon tila- ja aikaulottuvuuksien välisestä suhteesta. , vakiorunko useimmille visiomuuntajille tähän mennessä.
Loput paperista on järjestetty seuraavasti. Teemme korkean tason yleiskatsauksen asiaan liittyvistä töistä kävelyntunnistusmalleista ja näkömuuntajista. Havaitsemme, että kävelyn esitysmallit hyötyvät suuresti itseohjatusta koulutuksesta, jotta niissä on kestävämpiä ja yleisempiä upotuksia, ja muuntajamallit ovat osoittaneet suurta mallinnuskapasiteettia itseohjatuissa harjoitusohjelmissa.
Lisäksi kuvaamme matemaattisesti viittä vertailemaansa arkkitehtuuria ja kuvailemme suoritettavaa tietojen esikäsittelyä ja luurankomuunnoksia siten, että näkömuuntajien on toimittava saumattomasti runkosekvenssien kanssa. Kuvaamme myös tietojen lisäyksiä, koulutus- ja vertailutietojoukkoja sekä kokeellisia asetuksia.
Esittelemme tuloksia CASIA-B:llä ja FVG:llä kummallekin viidestä arkkitehtuurista ja kahdesta 'pretraining in-the-wild' -tietojoukosta. Lopuksi teemme ablaatiotutkimuksen spatiaalisen ja ajallisen tilkkukoon välisestä suhteesta ja annamme lyhyen keskustelun tuloksistamme. Tuomme lähdekoodimme julkisesti saataville GitHubissa (https://github.com/cosmaadrian/gait-vit, käytetty 28. helmikuuta 2023) läpinäkyvyyden ja toistettavuuden vuoksi.
2. Liittyvät työt
Tässä osiossa teemme lyhyen yleiskatsauksen olemassa olevista menetelmistä kävelyntunnistukseen kontrolloiduissa ympäristöissä ja "luonnossa". Lisäksi kuvailemme muuntajamallien pääasiallisia kehityskulkuja ja erityisesti niiden soveltamista näköalalla.
2.1. Kävelyn tunnistus
Samoin kuin kasvojen tunnistaminen, kävelyntunnistus perustuu metriseen oppimiseen. Toisin kuin perinteiset biometriset todennusmenetelmät, jotka perustuvat yhteen kuvaan (esim. kasvojentunnistus) ja vaativat laajaa yhteistyötä (esim. iirispohjainen biometrinen todennus), kävelyominaisuudet käsitellään liikkeen tilannekuvien sarjana. Tällainen eledynamiikka vaatii enemmän monimutkaisuutta informatiivisimman osasekvenssin määrittämisessä, mutta mahdollistaa huomaamattoman etätunnistuksen käytön.
Tässä yhteydessä tehtävä sisältää enkooderiverkon koulutuksen kartoittamaan kävelysekvenssit upotustilaan, jossa upotuksen samankaltaisuus vastaa kävelyn samankaltaisuutta. Samalle henkilölle kuuluvien kävelyjen upotusten tulee olla lähellä upotustilaa ja eri identiteetistä tulevien tulee olla kauempana. Tässä upotustilassa voidaan päätellä hankkimalla kulkusekvenssin upotus ja hyödyntämällä lähin naapuri. lähestymistapa tunnettujen kävelyretkien tietokantaan.
Nykyiset lähestymistavat kävelyperusteisessa tunnistuksessa on jaettu kahteen luokkaan: ulkonäköön perustuva [8,9] ja mallipohjainen [10,12,30]. Ulkonäköön perustuvilla menetelmillä saadaan ensin jokaisesta videoruudusta kävelevien kohteiden siluetit taustavähennys- tai segmentointialgoritmeilla.
Sitten siluettien sarja syötetään CNN-pohjaisiin arkkitehtuureihin, jotka poimivat tilallisia ja ajallisia piirteitä, jotka yhdistetään lopulliseksi upotukseksi tunnistamista varten. Mallipohjaiset lähestymistavat poimivat luurangot RGB-videoista poseestimation-malleilla [21,22]. Luurankosekvenssejä käsitellään yleensä malleilla, jotka luottavat graafikonvoluutioihin [10,30] askeleen upotuksen saamiseksi.
GaitSet, Chaon et al. [8], pitää kävelyä järjestäytymättömänä siluettijoukkona. Kirjoittajat väittävät, että tämä esitys on joustavampi kuin siluettisekvenssi, koska se on vankka erilaisille kehysjärjestelyille tai useiden kävelysuuntien ja muunnelmien yhdistelmälle. Ne käyttävät konvoluutiokerroksia kullekin siluetille kuvatason ominaisuuksien saamiseksi ja yhdistävät ne sarjatason ominaisuudeksi Set Poolingin kanssa. He saavat lopullisen tuloksen käyttämällä HorizontalPyramid Matching -versiota [31].
Fan et ai. [9] huomasi, että tietyillä ihmisen siluetin osilla tulisi olla spatiotemporaalinen ilmaisunsa, koska jokaisella niistä on ainutlaatuinen kuvio. Niiden arkkitehtuuri, GaitPart, hyödyntää polttokonvoluutiokerroksia (FConvs), jotka ovat erikoistunut konvoluutiotyyppi, jolla on rajoitetumpi vastaanottava kenttä. Kirjoittajat väittävät, että FConv:t auttavat heidän arkkitehtuuriaan oppimaan hienojakoisempia piirteitä liikkuvan kehon eri osille. He esittelevät myös mikroliikkeen sieppausmoduulit, joita käytetään poimimaan pienten ajallisten sekvenssien piirteitä.
Teepe et ai. [30] ehdottaa GaitGraphia, joka hyödyntää mukautettua graafikonvoluutioverkkoa nimeltä ResGCN [32] luurankosarjasta saatujen spatiotemporaalisten piirteiden koodaamiseen. Li et ai. [33] ehdottavat PTP:tä, joka on rakenne, joka kokoaa yhteen useita ajallisia piirteitä yhdestä kävelysyklistä perustuen niiden analyysiin kävelyn tärkeimmistä vaiheista.
Ne hyödyntävät myös graafisen konvoluutioverkkoa spatiaalisten piirteiden poimimiseen, joka toimii yhdessä PTP:n kanssa. Kirjoittajat esittelevät uuden datan lisäysmenetelmän, joka muuttaa kävelyä niin, että siinä on useita askeleita realistisemmassa syklissä.
Aiemmista töistä poiketen pyrimme kuitenkin tutkimaan kävelyntunnistusarkkitehtuurien suorituskykyä itsevalvotuissa skenaarioissa. Tietokonenäköalan valtavan kehityksen inspiroimana ehdotamme olemassa olevien näkömuuntaja-arkkitehtuurien mukauttamista toimimaan luurankosekvenssien avulla kuvien sijaan ja testaamaan niiden mallinnuskykyä itsevalvotuissa skenaarioissa. Useimmat muut työt [8, 9, 30] keskittyvät kehittämään hermoarkkitehtuureja, joilla saavutetaan vaikuttavia tuloksia ohjattujen tietojoukkojen kävelytunnistuksessa.
Aiomme kuitenkin poistaa erittäin kalliiden manuaalisten merkintöjen tarpeen kävelytietosarjoista ja tutkia tapoja, joilla itseohjattu oppiminen soveltuu kävelyanalyysiin.

Aiemmat tällä alalla tehdyt työt [10,12] osoittivat potentiaalin oppia hyviä kävelymuotoja heikosti merkityistä tietojoukoista. Cosmaand Radoi [12] ehdotti GaitFormeria, ensimmäistä muuntajapohjaista arkkitehtuuria luurankosekvenssien prosessoimiseksi, inspiraationa ViT [24] -mallista. Kuten [12], yritämme tutkia muiden näkömuuntajamallien suorituskykyä, joilla on erilainen spatiaalinen ja ajallinen dynamiikka patch-käsittelymekanismissa. Aiemmin on ehdotettu laajamittaisia tietojoukkoja kävelyntunnistukseen [7,12], mikä mahdollistaa yleisten arkkitehtuurien kehittämisen esitysoppimista varten.
For more information:1950477648nn@gmail.com






