AttentionMNIST: Hiiren napsautuksen huomionseurantatietojoukko käsinkirjoitettujen numeroiden ja aakkosten tunnistamiseen

Feb 22, 2024

Useat huomioon perustuvat mallit, jotka tunnistavat esineitä vilkkujen sarjan kautta, ovat raportoineet tuloksia käsinkirjoitettujen numeroiden tunnistamisesta. Käsinkirjoitettujen numeroiden tai aakkosten tunnistukseen ei kuitenkaan ole saatavilla huomionseurantatietoja. Tällaisten tietojen saatavuus mahdollistaisi huomioihin perustuvien mallien arvioinnin suhteessa ihmisen suorituskykyyn. Keräämme hiiren napsautusten huomionseurantatietoja 382 osallistujalta, jotka yrittävät tunnistaa kuvista käsinkirjoitettuja numeroita ja aakkosia (isot ja pienet kirjaimet) peräkkäisen otannan avulla. Vertailutietoaineistojen kuvat esitetään ärsykkeinä. Kerätty tietojoukko, nimeltään AttentionMNIST, koostuu sarjasta näyte (hiiren napsautus) sijainteja, pr.jokaisessa näytteenotossa määrätyt luokkamerkinnät ja kunkin näytteenoton kesto. Keskimäärin osallistujamme havaitsevat vain 12,8 % kuvasta tunnistamista varten. Ehdotamme perusmallia sijainnin ja luokkien ennustamiseksi, jonka osallistuja valitsee seuraavassa näytteenotossa. Kun se altistuu samoihin ärsykkeisiin ja kokeellisiin olosuhteisiin kuin osallistujamme, paljon siteerattu huomioon perustuva vahvistusmalli jää ihmisen tehokkuuden alapuolelle.

Chinese herb cistanche

Kiinalainen cistancheyrtti- Ehkäise Alzheimerin taudin tuotteita

Koneoppimismallit (ML), jotka tunnistavat esineitä vilkkujen sarjan kautta, ovat herättäneet kiinnostusta viime vuosina niiden skaalautuvuuden ja tehokkuuden vuoksi. Monet näistä malleista, kuten 1–7, ovat raportoineet kokeellisia tuloksia käsinkirjoitettujen numeroiden tunnistamisen MNIST-vertailutietojoukosta. Valitettavasti MNIST:n huomionseurantatietoja ei ole saatavilla. Tämä estää huomioimiseen perustuvien mallien arvioimisen ihmisen suoritukseen verrattuna. Pudotimme tähän aukkoon keräämällä tietojoukon aikuisilta osallistujilta, jotka yrittivät tunnistaa kuvista käsinkirjoitettuja numeroita ja aakkosia peräkkäisen näytteenoton avulla. Toisin kuin silmän liikkeen huomionseuranta (emAT), osallistuja napsauttaa kuvan sijaintia, jonka hän haluaa nähdä (hiiren napsautuksen huomionseuranta (mcAT)). Välittömästi sen jälkeen hän valitsee luokka(t), joihin hän ennustaa objektin kuuluvan tähänastisten havaintojensa perusteella. Siten jokaisessa näytteenottojaksossa tietomme koostuvat valitusta kuvan sijainnista, ennustetuista luokkatunnisteista ja osallistujan viimeisestä jaksosta kuluneesta ajasta. Jokaisen kuvan jälkeen osallistuja saa suoritukseensa (tarkkuus ja tehokkuus) perustuvan palkinnon.

Anti Alzheimer's disease

Cistanche tubulosa-Anti Alzheimerin taudin edut

mcAT:n edut emAT:iin verrattuna käsinkirjoitettujen numeroiden/aakkosten tunnistamisessa.

(1) lihassa on merkittävää sisäistä ja ihmisten välistä vaihtelua kiinnittymispaikassa, erityisesti staattisten ärsykkeiden (kuvat) osalta8,9. Tilastollisesti merkittävien johtopäätösten tekemiseen tarvitaan siis suuri määrä silmän kiinnitysdataa. mcAT ei ole herkkä joillekin katseenseurantadatalle tavallisille teknisen kohinan lähteille10. (2) Silmien liikkeet voivat johtua sekä vapaaehtoisista että tahattomista mekanismeista11. Tehtäväriippuvaisen päätöksenteon helpottamiseksi esitämme osallistujille riittävästi aikaa, kontekstia ja vahvistussignaaleja, jotka voidaan esittää myös ML-malliin. (3) EMAT-tietojen tarkkuus ja tarkkuus riippuvat katseenseurantaohjelmasta, kun taas samat mcAT ovat riippumattomia mistään laitteesta. (4) On haastavaa synkronoida silmän liikkeet hänen luokkavalintansa kanssa. Tämän ratkaisemiseksi meidän tapauksessamme näytteenottopaikka ja luokka(t) valitaan samassa jaksossa. (5) Lopuksi menetelmämme mahdollistaa tiedonkeruun käyttämällä Amazon Mechanical Turkia (MTurk), kuten 12,13, joka on kustannus- ja aikatehokas ja helposti toistettavissa.

Avustukset.

Keräämme AttentionMNIST-nimisen mcAT-tietojoukon MTurkin avulla 382 osallistujalta. Palkitaan käsinkirjoitettujen numeroiden ja aakkosten (isot ja pienet) tarkasta ja tehokkaasta tunnistamisesta kuvista peräkkäisen otannan avulla. Kuvat vertailutietojoukoista (MNIST, EMNIST) esitetään ärsykkeinä. Keskimäärin kirjataan 169,1 vastausta numero-/aakkosluokkaa kohden. Tämän tietojoukon avulla näytämme seuraavaa: • Osallistujat tarvitsevat keskimäärin 4,2, 4,7 ja 4,9 näytettä tunnistaakseen numerot, isot ja pienet kirjaimet, jotka vastaavat vain 11,3 %, 13,4 % ja 13,7 % kuva-alasta. . Luokittelun tarkkuus paranee useilla näytteillä. • Perustasona esitetty malli voi ennustaa luokka(t) ja sijainnin, jotka osallistuja valitsee seuraavassa näytteenottojaksossa 74,4 %:n ja 67,7 %:n tarkkuudella. Molemmat lasketaan keskiarvoina kaikista otannoista ja tietojoukoista. Luokkaennusteen tarkkuus kasvaa ja sijainnin ennusteen tarkkuus laskee näytteiden lisääntyessä. • Kun se altistuu samoille ärsykkeille ja olosuhteille kuin osallistujamme, paljon siteerattu vahvistukseen perustuva toistuva huomiomalli (RAM)3 vaatii 3,7, 8,5 ja 7,6 näytettä tunnistaakseen numerot, isot ja pienet kirjaimet, mikä vastaa 8,9 %. , 21.0%, 18,7 % kuva-alasta. Muita huomioon perustuvia vahvistusmalleja (esim.1,2,4,5,7,14) voidaan arvioida samalla tavalla ihmisen suorituskykyyn verrattuna.

Cistanche supplement near me-Improve memory2

Cistanche-lisä lähellä minua - Muistin parantaminen

Napsauta tästä nähdäksesi Cistanche Muistia parantavia ja Alzheimerin tautia estäviä tuotteita

【Kysy lisää】 Sähköposti:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Liittyvä työ

Hiiren napsautusten ajallinen järjestys mcAT:ssä on samanlainen kuin silmän liikkeen skannauspolku10. mcAT voi tehokkaasti korvata emAT:n, koska ne korreloivat merkittävästi 10, 12, 13, 15–17. mcAT-tutkimuksissa on käytetty erilaisia ​​ärsykkeitä, kuten kuvia elävistä ja elottomista kohteista10, kuvia luonnollisista kohtauksista12,13, staattisia verkkosivuja13, hakusivujen asetteluja16 ja kahta aakkosnumeeristen merkkijonojen luetteloa visuaalista vertailua varten17. mcAT:tä ei kuitenkaan ole käytetty käsin kirjoitettujen numeroiden/aakkosten luokittelutehtäviin tai huomioihin perustuvien luokitusmallien arvioimiseen. mcAT-tutkimuksissa on käytetty ominaisuuksia, kuten kontaktiaika, suhteellinen kiinnitystiheys kiinnostavilla alueilla (AOI), suhteellinen osuus potilaista, jotka napsautivat vähintään kerran AOI:ssa10, kiinnitysten lukumäärä koetta kohden, uudelleenfiksaatio kokeiden sisällä, viipymäajat ja skannausreitit17 , kiinnityskartat12,13, AOI ja tiedonkulkumalli16. Aikaleimattujen napsautuspaikkojen sekvenssi ja ennustetut luokkatunnisteet muodostavat raakadatan, joka on tarpeen huomioimiseen perustuvien mallien tai ihmisten tehokkuuden ja tarkkuuden arvioimiseksi luokitustehtävissä. Näistä tiedoista voidaan johtaa erilaisia ​​ominaisuuksia. McAT-tietojoukkomme, jolla on useita etuja katseenseurantadataan verrattuna, täyttää ratkaisevan aukon huomiopohjaisessa mallitutkimuksessa tekoälyssä, ML:ssä ja muilla aloilla. Tietojoukkomme mahdollistaa huomioihin perustuvien mallien arvioinnin verrattuna ihmisen suorituskykyyn. Tämä mahdollistaa muun muassa tehokkaiden ja reaaliaikaisten, käytännössä laajasti käytössä olevien optisten merkintunnistusjärjestelmien kehittämisen (ks. esim.18–20). Visuaalisia kiinnityksiä ohjaavia periaatteita voidaan olettaa ja testata aineistomme avulla. Onnistuneita periaatteita voidaan soveltaa kehittämään järjestelmiä todellisiin visuaaliseen tunnistustehtäviin, joissa tehokkuus on avainasemassa, kuten autonomisessa ajossa.

Data

Tietomme koostuvat T-jaksojen sarjasta jokaiselle osallistujalle. Kunkin jakson data koostuu (1) osallistujan napsauttaman kuvan sijainnista (yksi napsautus kuvassa jaksoa kohden), (2) osallistujan valitsemasta luokasta (luokista) ja (3) ajasta, jonka osallistuja on napsauttanut. osallistuja rekisteröi nykyisen näytteen (eli kuvan viimeisten ja nykyisten napsautusten välillä kulunut aika). Tässä osiossa selitetään tiedonkeruuprosessimme, mukaan lukien ärsykkeiden valinta, osallistujat, visuaaliset tehtävät, suorituskykypisteytykset ja tietojen suodatus.

Stimulien valinta. Stimulit valitaan kuvista kahdessa vertailutietojoukossa: (1)

MNIST21-tietojoukko koostuu 70,000 merkitystä kuvasta (28×28 pikseliä), joissa on 10 käsinkirjoitettua numeroa {0, 1, ..., 9}. (2)

EMNIST22-tietojoukko koostuu 145 600 kuvasta (28×28 pikseliä) käsinkirjoitetuista englanninkielisistä aakkosista isoilla ja pienillä kirjaimilla muodostaen tasapainoisen luokan. Kaikki kuvat on merkitty jollakin 26 luokasta {a, b, ..., z}. Isoja tai pieniä kirjaimia ei kuitenkaan liitetä mihinkään kuvaan. Valitsemme kustakin luokasta 15 hyvin muodostettua numeroa MNIST-tietojoukosta ja 15 hyvin muotoiltua aakkosta kukin EMNIST-tietojoukosta isoilla kirjaimilla ja EMNIST-pienillä kirjaimilla. Hyvin muotoiltu numero tai aakkoset on samanlainen kuin luokkansa normi. Esitämme siis ärsykkeitä 15(10 + 26 + 26)=930 ainutlaatuisen kuvan sarjasta, joista 15 kuuluu kuhunkin 62 luokkaan. Hyvin muotoillut 930-kuvat valitaan seuraavasti:

Vaihe 1: Normalisoi jokainen kuva käyttämällä min-max intensiteettiä 0 ja 1 välillä.

Vaihe 2: Merkitse hyvin muodostetut EMNIST-kuvat isoilla tai pienillä kirjaimilla. Jokaiselle aakkosluokalle valitaan manuaalisesti hyvin muotoiltu aakkoset sekä isoista että pienistä kirjaimista kirjoitetuista kuvista ja merkitään ne. Kaikkien tähän luokkaan kuuluvien kuvien kosinin samankaltaisuus kahden merkittyjen kuvien kanssa lasketaan. Kuville, jotka ovat kosinin samankaltaisuuskynnyksen yläpuolella (kokeellisesti valittuna 0.8), määritetään isot tai pienet kirjaimet.

Vaihe 3: Laske kuhunkin luokkaan kuuluvien kuvien keskiarvo. Luokkaan keskimääräinen kuva muodostaa sen normin. Kuva on kelvollinen ärsykkeeksi, jos sen kosinin samankaltaisuus luokkansa keskiarvon kanssa on suurempi kuin empiirisesti määritetty kynnys (0.7 MNIST:lle, 0.75 EMNIST:lle).

Vaihe 4: Sopivien kuvien joukosta valitaan 15 kuvaa kustakin luokasta manuaalisesti niiden muotojen perusteella. Jokainen kuva, alun perin 28 × 28 pikseliä, pienennetään 27 × 25:een poistamalla pikseliä läheltä rajoja, koska niissä ei ole intensiteettivaihtelua. Näiden 15 kuvan keskiarvo lasketaan jokaiselle 62 luokasta. Merkitsemme näitä keskiarvokuvia I1, I2, ..., In n luokalle kussakin tietojoukossa.

Osallistujat.

Kaikkiaan 382 erillistä aikuista henkilöä osallistui tutkimukseemme. Valintaperusteita ei käytetty. Osallistuja voi vastata useisiin kuviin. Jokaisesta 62 luokasta kirjattiin keskimäärin 169,1 vastausta.

man-5989553_960_720

Cistanche tubulosan edut-Alzheimerin taudin vastainen

Visuaalinen tehtävä.

Visuaalisen tehtävämme MTurk-käyttöliittymä on esitetty kuvassa 1. Kanvas, jonka koko on 270×250, näyttää koko ajan matalan intensiteetin taustakuvan. Tausta- ja ärsykekuvat näytteistetään kymmenen kertaa 270 × 250:een. Kankaan keskikohta on kohdistettu kuvien keskustaan. Tausta Aluksi tausta on kaikkien tietojoukon kuvien keskiarvo, josta ärsyke on otettu. Ensimmäisen jakson jälkeen tausta on kaikkien viimeisen jakson osallistujan valitsemien luokkajoukon kuvien keskiarvo. Todellisessa maailmassa numeron tai aakkosten sijainnin, koon ja suunnan konteksti saadaan sen lähistöllä olevasta kirjoituksesta, joka puuttuu täältä. Kun kokeemme suoritettiin tyhjällä taustalla, osallistujat ottivat usein näytteitä kuvan kohdista, joissa ei ollut mitään osaa kohteesta. Tämä käyttäytyminen hillittiin esittämällä valitun luokan (valittujen luokkien) keskimääräinen kuva matalan intensiteetin taustalla ja pienentämällä kaikkien MNIST- ja EMNIST-kuvien kokoa 28 × 28 pikselistä 27 × 25:een. Joka kerta kun osallistuja valitsee paikan kankaalta napsauttamalla sitä, näkyviin tulee 50×50 pikselin paikka, joka on keskitetty siihen kohtaan ärsykekuvasta. Paljastettu korjaustiedosto näkyy edelleen viimeiseen jaksoon asti. Osallistujan tehtävä koostuu kolmesta vaiheesta kussakin jaksossa t (t=1, ..., T):

Vaihe 1: Napsauta mitä tahansa kohtaa 270 × 250 -kankaalla paljastaaksesi korjaustiedoston, josta hän haluaa näytteen. Vain ensimmäinen napsautus hyväksytään.

Vaihe 2: Tunnista numerot/aakkoset kaikista tähän mennessä havaituista näytteistä. Osallistuja voi valita useita luokkia, ja hänen on valittava vähintään yksi luokka kankaan alla näkyvästä luokkaluettelosta.

Vaihe 3: Napsauta "Seuraava" näytön alareunassa jatkaaksesi. Voidakseen päätellä luokan tarkasti ja nopeasti osallistujan on valittava paikat harkiten havaintojensa perusteella nykyiseen jaksoon asti. Jaksolla ei ole aikarajaa. Rajoitamme kuitenkin kuvan T-jakson kokonaisajan kuuteen minuuttiin. Valitsemme T=12, koska paljon siteeratut teokset huomioihin perustuvassa käsinkirjoituksen tunnistuksessa tai luomisessa ovat käyttäneet vähemmän kuin 12 välähdystä (esim. RAM3 tunnistaa MNIST-numerot 7 välähdyksen sisällä, DRAW23 voi luoda MNIST-numeroita 11 välähdyksen sisällä) ja ihmiset voivat tunnistaa käsin kirjoitetut numerot ja aakkoset paljon harvemmalla kuin 12 välähdyksellä.

Suorituskyvyn pisteytys. Osallistujalle annetaan pistemäärä hänen tarkkuutensa ja tehokkuutensa perusteella havaittujen näytteiden lukumäärässä. Olkoon se luokkasarja, jonka hän valitsi missä tahansa jaksossa t. Kymmenen, hänen pisteensä t:llä on:

Figure 1. Our MTurk interface as seen by a participant. Te second sampling for an EMNIST uppercase alphabet is shown.

Kuva 1. MTurk-käyttöliittymämme osallistujan näkemänä. Toinen näyte EMNISTin isoista kirjaimista on esitetty.

image


missä |.| ilmaisee joukon kardinaalisuutta. T-jaksoissa myönnetty kokonaispistemäärä on h {{0}} T t=1 Pt. Siksi T-jaksoissa maksimipistemäärä on T, jos hän valitsee aina vain oikean luokan. Vähimmäispistemäärä T-jaksoissa on nolla, jos hän valitsee aina sarjan, joka ei sisällä oikeaa luokkaa. Joten 0 Pienempi tai yhtä suuri kuin h Pienempi tai yhtä suuri kuin T. Mitä aikaisemmin osallistuja valitsee oikean luokan, sitä korkeampi hänen pistemääränsä on. Näin ollen tämä pisteytysmekanismi ottaa huomioon tunnistustarkkuuden ja näytteenoton tehokkuuden. Pistemäärän maksimoiminen valitsemalla vain yksi luokka ensimmäisestä jaksosta on riskialtista, sillä jos se ei ole oikea luokka, hänelle annetaan nollapiste, kun taas nollaa suurempi pistemäärä myönnetään, jos osallistuja valitsee useita luokkia ( jopa kaikki luokat), jotka sisältävät oikean luokan. Tämä motivoi osallistujaa vastaamaan minkä tahansa jakson mielessään olevien todennäköisten luokkien perusteella. Jokaisesta jaksosta myönnetyt pisteet julkistetaan vasta T-jakson päätyttyä, jotta osallistujalle ei saa antaa vihjeitä. MTurkissa osallistujan kuvasta saama korvaus on verrannollinen hänen kokonaispistemääräänsä, h.

Tietojen suodatus.

Jos osallistujan pistemäärä ärsykekuvan viimeisessä (ts. T-jaksossa) on nolla, hänen kyseiselle kuvalle tallennetut tiedot hylätään. Tiedot hylätään myös, jos osallistuja jättää tehtävän kesken. Näillä valintakriteereillä saimme vastaukset 1736 ärsykkeelle MNIST:stä, 4431 ärsykkeelle EMNISTin isoista kirjaimista ja 4315 ärsykkeelle EMNISTin pienistä kirjaimista; eli keskimäärin 169,1 vastausta luokkaa kohti.

Mallit ja menetelmät tiedon hyödyntämiseen

Tässä osiossa havainnollistetaan kerättyjen tietojen hyödyllisyyttä tarjoamalla (4.1) perusmalli osallistujan käyttäytymisen ennustamiseen ja (4.2) osoittamalla, kuinka olemassa olevaa huomioon perustuvaa vahvistusmallia voidaan verrata ihmisen numeroiden/aakkosten tunnistusjärjestelmään. esitys. Käyttäytymisen ennustamisen lähtökohta. Käyttäytyminen missä tahansa jaksossa t koostuu sijainnin valinnasta ja luokan valinnasta. Koska näyte sisältää eri määriä tietoa eri tarkkailijoille tai jopa samalle tarkkailijalle eri aikoina9, kunkin osallistujan käyttäytymisen ennustaminen on vaikea ongelma. Olkoon n tietojoukon luokkien lukumäärä, ηt yksittäinen joukko, joka sisältää ärsykekuvan todellisen luokan pisteessä t, ct luokkien joukko ja lt osallistujan valitsema paikka kohdassa t, hänen havaintonsa t ja 1:t tarkoittaa sekvenssiä 1, 2, ..., t. Aina t asti osallistujan havainnot ovat o1:t ja hänen valitsemansa paikat ovat l1:t. Muotoilemme osallistujan käyttäytymisennusteen ongelman seuraavasti: Luokkaennuste Arvioi i∈ct:n (i=1, 2, ..., n) todennäköisyys hänen o1:t:n ja l1:t:n perusteella, eli P( i ∈ ct|o1:t, l1:t). Sijainnin ennustus Arvioi lt+1 todennäköisyys hänen o1:t, l1:t ja ct perusteella, eli P(lt+1|o1:t, l1:t,ct). Luokan ennuste. Ennakoidaksemme luokan, jonka osallistuja valitsee jaksossa t, laskemme todennäköisyyden, että kuva-ärsyke kohdassa t kuuluu luokkaan I ottaen huomioon osallistujan valitsemat paikat l1:t ja vastaavat havainnot o1:t seuraavasti:

image

missä Ii on luokkaan i kuuluvien ärsykekuvien (27×25) keskiarvo, I′ on 27×25-kuva, joka sisältää o1:t kohdassa l1:t, · tarkoittaa skalaarituloa ja . tarkoittaa eukleideen normia. Kaikki pikselivoimakkuudet eivät ole negatiivisia. Missä tahansa episodissa t k suurinta todennäköistä luokkaa uskomusjakaumasta P(i|o1:t, l1:t) muodostavat mallimme ennustaman luokkien joukon ˆct, jossa k=|ct|. Luokittelutarkkuus mitataan Jaccard-indeksillä (JI). JI mittaa kahden joukon X ja Y samankaltaisuutta seuraavasti: J(X, Y) {{10}} |X ∩ Y|/|X ∪ Y|. JI rajoittuu välillä 0 ja 1; jos X=Y, J(X, Y)=1. Missä tahansa jaksossa t osallistujan luokittelutarkkuus on J(ηt,ct), kun taas mallimme luokitustarkkuus on J(ηt, ˆct). Nimittäjänsä vuoksi JI rankaisee enemmän, kun ennustetun joukon (ct tai ˆct) elementtien määrä, jotka eivät ole ηt:ssä, kasvaa, mikä on meidän tapauksessamme toivottava ominaisuus. Osallistujan ja mallimme luokituksen samankaltaisuutta mitataan J(ct, ˆct). Mallimme arvioidaan myös luokan valinnan ja hylkäystarkkuuden suhteen kunkin osallistujan osalta. Olkoon st=ct − ct−1 uusien valittujen luokkien joukko ja rt=ct−1 − ct niiden luokkien joukko, jotka osallistuja on hylännyt kohdassa t. Vastaavasti ˆst=ˆct − ct−1 on valittujen uusien luokkien joukko ja ˆrt=ct−1 − ˆct on joukko luokkia, jotka mallimme hylkäsi kohdassa t. Sitten mallin luokan valintaa ja hylkäämistä voidaan verrata osallistujan luokkaan J(st, ˆst), kun |st| > 0 ja J(rt, ˆrt), kun |rt| > 0, vastaavasti. Sijainnin ennuste. Hypoteesi Ihannetapauksessa uskomusten jakautumisen kaikkien luokkien tulisi olla unimodaalinen (eli vain yksi huippu) ja muodoltaan ohut Gaussin (eli pieni standardipoikkeama), mikä osoittaa, että osallistuja on varma ärsykkeen (ympäristön) luokasta (tilasta). Kuitenkin, kuten tiedoistamme (viite kuva 2) käy ilmi, osallistuja on usein hämmentynyt useiden luokkien välillä, etenkin muutaman alkujakson aikana. Näissä tapauksissa hänen uskomusjakaumallaan on useita huippuja tai se on lihava Gaussilainen. Oletamme, että osallistujan tavoitteena on konvergoida unimodaaliseen ja ohueen Gaussiseen, jonka saavuttamiseksi hän ottaa valikoivasti näytteitä paikoista, jotka vähentävät kaikkien luokkien todennäköisyyttä yhtä lukuun ottamatta. Tämä hypoteesi johtaa luokkien (ympäristötilojen) epävarmuuden minimoimiseen, mikä on hyvin tunnettu toimintaa ohjaava periaate24, mukaan lukien silmien liikkeet25.

Figure 2. Duration and class distribution over all participants and stimuli belonging to categories '0', 'a', and 'A'.


Kuva 2. Kesto ja luokkajakauma kaikkien osallistujien ja luokkiin '0', 'a' ja 'A' kuuluvien ärsykkeiden kesken.

Te observations at certain locations in a stimulus image can discriminate between certain classes. Te observation at a location l might indicate that the numeral/alphabet belongs to class I and not to class j. Such locations are more salient than others in achieving a participant's goal. To sample such locations, a saliency map, Dij, is computed such that if l is salient, the observation at l is evidence to increase the probability of class I and decrease that of j. Mathematically, Dij = N (., σ ) ∗ g(.), where ∗ is the convolution operator, g(.) is a saliency scoring function, and N (., σ ) is a 5×5 Gaussian kernel with standard deviation σ = 6 to smooth the saliency scores. We denote the set of all saliency maps as D = {Dij: i, j ∈ {1, 2, ..., n}, i �= j}. A location l in a stimulus image is salient for class i with respect to class j if Dij(l)>θ, jossa kynnys θ=0.5 × max(D) on empiirisesti määritetty skalaarisuure.

Pidämme kahta epäsymmetristä metriikkaa, Kullback-Leibler (KL) -divergenttiä ja -eroa, ehdokkaina funktiolle g. KL-divergentti Kun annetaan kaksi normalisoitua keskikuvaa, Ii ja Ij, KL-divergentti KL(Ii, Ij) mittaa tiedon menetystä, kun Ij:tä käytetään Ii:n approksimoimiseen. Tämä lasketaan kullekin pikselille k as26: KL(Ii,k, Ij,k)=Ii,k log δ + Ii,k Ij,k+δ, missä Ij,k on k:nnen pikselin intensiteetti Ij:stä ja δ on regularisointivakio. Kun Ii,k=Ij,k, KL(Ii,k,Ij,k) → 0. Ero Kun annetaan kaksi normalisoitua keskiarvokuvaa, Ii ja Ij, kunkin pikselin k ero on Diff (Ii,k, Ij,k)=Ii,k − Ij,k. Kun Ii,k=Ij,k, Diff (Ii,k, Ij,k)=0. Osallistuja on epävarma nykyisessä jaksossa valitsemansa luokkajoukon ct suhteen. Siten sijainnin ennustamiseksi otamme huomioon vain ne D:n näkyvyyskartat, jotka sisältävät ct:n luokat. Paikka ennustetaan, jos se on näkyvä näiden näkyvyyskarttojen perusteella eikä osallistuja ole koskaan valinnut sitä. Tus, annettuna o1:t, l1:t ja ct, sijainti lt+1 ennustetaan seuraavasti:

image

jossa Ŵ on joukko 3-yksikot, jotka sisältävät ennustetun sijainnin ˆl, luokka, joka on keskeinen (i) ja minkä luokan (j) suhteen. Sijainti ennustetaan oikein, jos on olemassa �ˆl, i, j� ∈ Ŵ siten, että �ˆl − lt+1� < ǫ, I ∈ ct+1 ja j /∈ ct{{3} }, jossa ǫ on suurin euklidinen etäisyys keskipikselin ja minkä tahansa havaintoalueen pikselin välillä. Sijainnin ennustamisen pseudokoodi on esitetty Algoritmissa 1. Yksityiskohtainen selitys pseudokoodista on lisämateriaalin osiossa S1. (Te-todennäköisyysjakauma, P(lt+1|o1:t, l1:t,ct) voidaan laskea olettamalla Ŵ:n ulkopuolisten sijaintien näkyvyyspisteet nollaksi ja normalisoimalla sitten kaikkien näkyvyyspisteet paikat summaamaan yksikön. Tätä todennäköisyyttä ei kuitenkaan ole käytetty, koska yhtälö (3) on riittävä tämän artikkelin tarkoituksiin.)

image

Huomiopohjaisten mallien arviointi.

Huomiopohjaisten mallien edustajana pidämme paljon siteerattua toistuvaa huomiomallia (RAM)3, joka raportoi kokeelliset tulokset MNIST-tietojoukosta. Vahvistusmalli ottaa kuvan peräkkäin ja päättää, mistä näyte otetaan seuraavaksi kullakin näytteenottohetkellä, mikä tekee siitä sopivan arvioitavaksi kerättyjen tietojen avulla.

RAM

luokittelee kuvat käyttämällä välähdyksiä. Seuraava sijainti valitaan stokastisesti sijaintiverkon parametroimasta jakelusta. Malli on koulutettu päästä päähän maksimoimalla seuraavan tavoitteen3:

image


missä M on jaksojen lukumäärä, T on havaintojen lukumäärä, xi 1:t on vuorovaikutussekvenssit, jotka saadaan ajamalla nykyinen agentti I jaksoon asti, ui t on nykyinen toiminta, θ on koulutettavien parametrien joukko, Ri t on kumulatiivinen palkkio, bt on perusviiva ja π(ui t|xi 1:t; θ ) on käytäntö. RAM:n käyttäytymistä voidaan verrata osallistujien toimintaan vertaamalla RAM:n ennustamista sijaintien sekvenssistä saatuja kiinnityskarttoja ja osallistujien valitsemia. Fxation-kartta lasketaan antamalla kullekin sijainnille arvo, joka vastaa sen valintatiheyttä, ja sitten normalisoimalla nämä arvot jakauman luomiseksi kaikille sijainneille.

Mittarit kiinnityskarttojen vertailuun. Kahden kiinnityskartan, P ja Q, vertailussa seuraamme tarkasti 26:ta. Käytämme kolmea jakautumiseen perustuvaa metriikkaa: KL-divergentti (KL), Pearson-korrelaatiokerroin (CC) ja samankaltaisuus (SIM), vertaillaksemme näytteenottopaikkojen jakautumista. mallista ja osallistujien mallista kerättyyn dataan kirjatulla tavalla.

KL (määritelty aiemmin) on erittäin herkkä nolla-arvoille.

CC voi arvioida kahden kartan välisen lineaarisen suhteen muodossa26: CC(P, Q)=σ (P, Q) σ (P)σ (Q), missä σ on varianssi tai kovarianssi. Koska CC on symmetrinen, se ei pysty päättelemään, johtuvatko erot kiinnityskarttojen välillä vääristä positiivisista vai vääristä negatiivisista.

SIM mitataan 26: SIM(P, Q)=k min(Pk, Qk), missä k Pk=k Qk=1. Kuten CC, SIM on symmetrinen ja perii saman haittapuolen. Lisäksi SIM on erittäin herkkä puuttuville arvoille ja rankaisee ennusteita, jotka eivät ota huomioon perustotuustiheyttä.

Ihmis- ja eläintutkimus.

Memphisin yliopiston Institutional Review Board on todennut, että tämä tutkimus ei täytä Office of Human Subjects Research Protections -määritelmää ihmisainetutkimuksesta ja 45 CFR:n osa 46 ei sovellu. Tästä syystä tämä tutkimus ei vaadi IRB:n hyväksyntää tai tarkistusta.

Kokeen tulokset Tietojen analyysi.

Kerätyt tiedot voidaan visualisoida valittujen paikkojen (kuvio 3), valittujen luokkien (kuvio 2) ja peräkkäisten jaksojen välisen keston (kuvio 2) suhteen. Nämä jakaumat ovat hyvin samankaltaisia ​​näille kolmelle tietojoukolle. Minkä tahansa numeron tai aakkoston kohdalla valittujen paikkojen jakauma viimeisen jakson jälkeen muistuttaa luokkansa pikselivoimakkuuksien jakautumista tietojoukosta. Valittujen paikkojen sarja on kuitenkin luonteeltaan stokastinen. Luokkajakauma osoittaa sekaannusta rakenteeltaan samankaltaisten luokkien välillä muutaman alkujakson aikana, kun osallistujat valitsevat useita luokkia. Tämä hämmennys vähenee, kun otat enemmän näytteitä. Sekaannusasteen (# valittua luokkaa / yhteensä # luokkaa) ja näytteenoton keston välillä on merkittävä positiivinen korrelaatio (katso kuva 4). Jos valittujen luokkien määrä on suuri (matala), peräkkäisten jaksojen välinen kesto on korkea (matala). Osallistujan luokalle valitseman paikkasarjan CC ei ole merkittävä (taulukko 1). Tämä on odotettavissa, koska staattisten kuvien otosten välillä on vaihtelua. Keskimääräinen näytteiden määrä, jonka osallistuja tarvitsee ennustaakseen tarkasti luokan, on melko pieni. Keskimäärin kestää 4,2, 4,7 ja 4,9 näytettä, jotka vastaavat 36, 44,1 ja 48,1 sekuntia, jotta MNIST-, EMNIST-isot ja pienet kirjaimet luokitellaan tarkasti. Osallistujat katselivat keskimäärin vain 11,3%, 13,4% ja 13,7% kuva-alueesta, jotta ne voivat luokitella numero-, isot- ja pienet aakkoskuvan tarkasti (katso kuva S2 lisämateriaalissa). Nämä tulokset korostavat ihmisen visuaalisen päättelyjärjestelmän tehokkuutta, vaikkakin pienemmällä resoluutiolla kuin katseenseurantadata, mutta vähemmän kohinaa ja vaihtelua. Nämä empiiriset tulokset voivat olla hyödyllisiä suunniteltaessa huomiopohjaisia ​​malleja tosielämän sovelluksiin. Käyttäytymisen ennustaminen. Tässä osiossa perusmallimme suorituskykyä arvioidaan sen perusteella, kuinka tarkasti se pystyy ennustamaan kunkin osallistujan sijainnin ja luokkavalinnan. Koska kokeelliset tulokset käyttämällä kahta näkyvyyden pisteytysfunktiota, KL:n eroa ja eroa, ovat melko samanlaisia, tulokset raportoidaan käyttämällä vain eroa, ellei toisin mainita. Luokan ennuste. Luokkaennuste ja sen tarkkuuden arviointimenetelmät on kuvattu kohdassa "Luokkaennustus". Kuvassa 5 esitetty luokan ennustetarkkuus lasketaan kaikkien luokkien osalta kaikille näytteille. Keskimääräinen luokan ennustetarkkuus kaikissa näytteissä ja tietojoukoissa on 74,4 % (standardi dev. 26.5). Kuvat 5a ja b osoittavat, että osallistujien ja perusmallimme (yhtälö 2) valitsema luokkasarja on varsin epätarkka alkujaksoissa ja paranee näytteiden lisääntyessä. Kuva 5c osoittaa, että ensimmäisten jaksojen aikana nämä kaksi sarjaa, ct ja ˆct, ovat melko erilaisia; samankaltaisuus kasvaa näytteiden lisääntyessä. Sama koskee uusia luokkavalintoja (katso kuva 5f). Luokan hylkäämiset ovat kuitenkin samanlaisia ​​alkujaksoissa; samankaltaisuus kasvaa entisestään, kun näytteitä on enemmän (katso kuva 5e). Koska J(st, ˆst)=|(ct ∩ ˆct) − ct−1| |(ct ∪ ˆct) − ct−1| ja J(rt, ˆrt)=|ct−1 − (ct ∪ ˆct)| |ct−1 − (ct ∩ ˆct)|, kuviosta 5e, f voidaan päätellä, että alkujaksoissa ct−1:n ja ct ∪ ˆct:n leikkauspiste on pieni, mikä osoittaa, että aluksi osallistujat ja perusmallimme tehdä monia muutoksia luokkavalintaansa peräkkäisten jaksojen välillä. Siksi luokan valintaprosessi on aluksi erittäin stokastinen. Vaikka osallistujien ja mallimme luokkaennusteissa on joitain eroja ensimmäisten jaksojen aikana, käyttäytyminen muuttuu yhä samanlaisemmaksi, kun näytteitä on enemmän. Muutaman ensimmäisen (tyypillisesti 4–7) jakson aikana ärsykkeen erittäin merkittäviä osia paljastetaan. Tämä auttaa valitsemaan vain oikean luokan myöhemmissä näytteissä, mikä lisää ennusteen tarkkuutta. Koska on monia luokkia, joiden keskimääräiset mallit vastaavat ärsykkeen havaittuja osia muutaman alkujakson aikana, luokan valintaprosessi on huomattavasti stokastisempi, mikä johtaa osallistujien ja mallimme alhaiseen luokittelutarkkuuteen.

Figure 3. Distribution of sampling locations over all participants for each numeral/alphabet class and each sampling episode. Each row corresponds to a class, each column corresponds to a sampling episode which increases from left to right.


Kuva 3. Näytteenottopaikkojen jakautuminen kaikkien osallistujien kesken kunkin numero-/aakkosluokan ja kunkin näytteenottojakson osalta. Jokainen rivi vastaa luokkaa, jokainen sarake vastaa näytteenottojaksoa, joka kasvaa vasemmalta oikealle.

Sijainnin ennuste. Perusmallimme (yhtälö 3) sijainnin ennustetarkkuus laskettuna kaikista näytteistä ja tietojoukoista on 67,7 % (standardi 14.1) (viite kuva 5d). Tämän ennustetarkkuuden trendi on päinvastainen kuin luokan ennustetarkkuuden trendi. Selitys on kuitenkin sama. Sijainnin ennustetarkkuus on korkea ensimmäisten näytteiden aikana, koska näiden jaksojen aikana valitaan erittäin näkyvät paikat, jolloin vähemmän näkyvät paikat valitaan myöhemmissä jaksoissa. Koska on monia paikkoja, joilla on alhainen näkyvyys, niiden valintaprosessi on erittäin stokastinen ja siksi vaikea ennustaa, mikä johtaa ennustetarkkuuden heikkenemiseen näytteenoton lisääntyessä. Laskeva trendi on yksilöllinen jokaiselle tietojoukolle (viite kuva 5d), koska luokkien määrä ja erottelun kannalta merkittävien sijaintien lukumäärä vaihtelevat tietojoukkojen välillä. Mitä pienempi luokkien määrä ja erittäin näkyvät erottelevat paikat ovat, sitä nopeammin sijainnin ennusteen tarkkuus heikkenee näytteenoton lisääntyessä.

imageFigure 4. (Lef) Errorbar plot of time diference (seconds) between consecutive samples averaged over all classes. Tat is, value shown at sampling episode t is the time elapsed between a participant's clicks in image at t − 1 and t. (Right) Errorbar plot of confusion averaged over all classes at each episode. Errorbars indicate std. dev.

Kuva 4. (vasemmalla) Aikaeron virhepalkkikuvaaja (sekunteina) peräkkäisten näytteiden välillä keskiarvotettuna kaikista luokista. Tat on, otosjaksossa t näkyvä arvo on aika, joka on kulunut osallistujan kuvan napsautuksista pisteissä t − 1 ja t. (Oikealla) Virhepalkin hämmennysdiagrammi keskiarvotettuna kaikista luokista kussakin jaksossa. Virhepalkit osoittavat std. kehittäjä

Figure 5. Evaluation of our baseline model (ref.

Kuva 5. Perusmallimme arviointi (katso kohta "Käyttäytymisen ennustamisen lähtötaso"). (a) Osallistujien luokittelutarkkuus (acc.) ja (b) perusmallimme, joissa on todellisia merkintöjä perustotuuksina. (c) Luokituksen samankaltaisuus (J(ct, ˆct)), (d) sijainnin ennustamisen tarkkuus, (e) luokan hylkäystarkkuus ja (f) perusmallimme luokan valinnan tarkkuus osallistujien tietojen pohjalta. Katso lisätietoja kohdasta "Käyttäytymisen ennustaminen".

Table 1. Average Pearson correlation coefficient (corr.) for fxation sequences for the same class. For any fixation, distance is Euclidean and direction is measured as the polar angle with respect to the center of stimuli as the origin. Std. dev. are included in parenthesis.


Taulukko 1. Keskimääräinen Pearson-korrelaatiokerroin (korr.) saman luokan fxation-sekvensseille. Kaikille kiinnityksille etäisyys on euklidinen ja suunta mitataan napakulmana suhteessa ärsykkeiden keskipisteeseen origona. Std. kehittäjä ovat suluissa.

RAM-muistin arviointi.

Jokaiselle luokalle ja näytteenotolle verrataan RAM-muistin kiinnityskarttoja (käytimme RAM-toteutusta osoitteesta github.com/hehefan/Recurrent-Attention-Model) ja kerättyä dataa samoista ärsykkeistä, jotka on esitetty MTurkissa. Reilun vertailun vuoksi osallistujiin kiinnitimme RAM-muistissa sekvenssin pituuden arvoon T=12, ensimmäiseen näytteenottopaikkaan kuvan keskellä, syötehavainnon 5 × 5 -merkkiin, jonka keskipisteenä on valittu sijainti, ja muutti palkitsemisfunktiota yhtälöllä. (1). Te kumulatiivinen palkkio, Rt ekv. (4,) korvataan yhtälöstä saadulla kumulatiivisella pistemäärällä t τ=1 Pτ. (1). Koska osallistuja voi valita useita luokkia missä tahansa jaksossa, RAM-mallissa sen sijaan, että ennustaisimme yhtä luokkaa suurimman todennäköisyyden perusteella, pidämme kaikkien luokkien keskimääräistä todennäköisyyttä kynnyksenä ja ennustamme luokkien joukon ct, joiden todennäköisyys on suurempi kuin kynnys. Tätä ct:tä käytetään pistemäärän laskemiseen yhtälön avulla. (1). Näissä olosuhteissa RAM vaatii 3,7, 8,5 ja 7,6 näytettä tunnistaakseen MNIST-numerot, isot ja pienet EMNIST-aakkoset, jotka vastaavat 8,9 %, 21.0%, 18,7 % kuva-alasta. Siten verrattuna osallistujiimme (viite "Data-analyysi" -osio), RAM on vähemmän tehokas. Katso Taulukko 2. Tulokset RAM-muistin kiinnityskarttojen ja kerättyjen tietojen vertailusta on esitetty taulukossa 3. KL on suurempi johtuen herkkyydestään nolla-arvoille. Tämä tarkoittaa, että osallistujat ottavat näytteitä useista paikoista, mutta eivät RAM-muistista. Näitä kokeita voidaan käyttää perustana arvioitaessa paikkoja, joista on otettu näytteitä huomiomallilla.

cistanche-Improve memory2

cistanchen edut - Paranna muistia

Keskustelut

Tässä artikkelissa käytetyllä mcAT-paradigmalla on tiettyjä eroavaisuuksia niihin, jotka perustuvat ensisijaisesti silmien liikkeisiin ja katseisiin tutkiessaan esineiden tunnistusmekanismeja. Jälkimmäisessä näyttämössä näkyvät osat herättävät huomion ensin, ja sen jälkeen sakkadiset silmänliikkeet ohjaavat katseen tärkeimpiin paikkoihin27. Gazea ohjaavat alhaalta ylös ja ylhäältä alas -signaalit, jotka yhdessä näkyvyystietojen kanssa muodostavat prioriteettikarttoja, jotka ohjaavat silmien liikkeitä kohteen tunnistamista varten. Koska tämän tutkimuksen osallistujat katsoivat staattisia kuvia vapaan katselun olosuhteissa ja riittävästi aikaa (kuusi minuuttia T=12-näytteenottoa varten), he osallistuivat todennäköisesti sarjaan sakadisia silmäliikkeitä tai visuaalista päättelyä28 tutkiakseen. kuvaa ennen kuin napsautat AOI:ta. Nämä silmien liikkeet olisi voitu tallentaa emAT:ssa (käyttäen silmänseurantaa), mutta ei mcAT:ssä. Mielen vaeltaminen vaikuttaa kuitenkin näihin silmien liikkeisiin. Vaikka mielen vaeltaminen vaikuttaa myös mcAT:hen29, vaikutus saattaa heikentyä aina, kun osallistujat vastaavat visuaalisen päättelyn jälkeen. Koska käsillä oleva tehtävä vaikuttaa silmien liikkeisiin vasteena ärsykkeelle30, osallistujien silmien liikemalleihin vaikutti todennäköisesti jokaisessa näytteenotossa annettu kolmivaiheinen tehtävä (katso kohta "Visuaalinen tehtävä"). Jos katseenseurantalaitetta olisi käytetty, osallistujien silmän liikkeet näytettä tutkiessaan olisivat sekoittuneet silmien liikkeisiin heidän valitsemiensa luokkien napsauttamiseksi, mikä olisi vaikeuttanut näytteen visuaalisen tutkimisen tulkintaa. Luokkien napsauttaminen on välttämätön vaihe, koska se paljastaa, vaikkakin introspektiivisesti, ennustetut luokka(t) osallistujan mielessä. On todennäköistä, että katseet välittömästi ennen ja jälkeen AOI-valinnan – ehkä myös kiinnittävien silmien liikkeet{10}}vaikuttivat eniten numeroiden/aakkosten tunnistamiseen. Oletammekin, että osallistujat valitsivat kuvan diagnostiset alueet erottaakseen toisistaan ​​luokkien, ja nämä alueet sisältävät todennäköisesti sekoituksen alhaalta ylös (esim. visuaalinen kontrasti) ja ylhäältä alas (numero/aakkosmalli) diagnostisia tietoja. Tämä on yhdenmukainen havaintomme kanssa, että osallistujat erottivat nopeasti (keskimäärin 5 näytteen sisällä) ärsykeluokat näennäisesti valitsemalla diagnostisia laastareita.

Table 2. Comparison of efficiency between our participants and the RAM model in terms of the average number of samples required to recognize a numeral/alphabet. The percentage of the image area observed is included in parentheses.

Taulukko 2. Osallistujiemme ja RAM-mallin tehokkuuden vertailu numeroiden/aakkosten tunnistamiseen tarvittavien näytteiden keskimääräisenä lukumääränä. Havaitun kuva-alan prosenttiosuus on sisällytetty sulkeisiin.

Table 3. Evaluation of fixation maps from RAM for the stimuli presented in the MTurk experiments averaged over all classes and samplings. Std. dev. are included in parenthesis.


Taulukko 3. RAM-muistista saatujen kiinnityskarttojen arviointi MTurk-kokeissa esitetyille ärsykkeille kaikkien luokkien ja näytteiden keskiarvoina. Std. kehittäjä ovat suluissa.

Johtopäätökset

Otimme käyttöön mcAT-tietojoukon käsinkirjoitettujen numeroiden ja aakkosten tunnistamiseen peräkkäisen näytteenoton avulla. Tiedot kerätään 382 osallistujalta, joille esitettiin vertailutietoaineistoista (MNIST, EMNIST) valittuja kuvia. Keskimäärin kirjataan 169,1 vastausta numero-/aakkosluokkaa kohden. Tiedot analysoidaan tarkasti ihmisen visuaalisen tunnistamisen tehokkuuden paljastamiseksi. Osallistujat havaitsivat vain 12,8 % kuvasta tunnistettaviksi. Ehdotimme perusmallia ennustaaksemme sijaintia ja luokkia, jotka osallistuja valitsee seuraavassa näytteenotossa. Osoitimme, kuinka kokeellisia olosuhteitamme ja tietojamme voidaan käyttää huomioimiseen perustuvan vahvistusmallin arvioimiseen verrattuna ihmisen suorituskykyyn. Tämä mcAT-tietojoukko, jolla on useita etuja katseenseurantadataan verrattuna, täyttää tärkeän aukon huomiopohjaisessa mallitutkimuksessa tekoälyssä, ML:ssä ja muilla aloilla.

Viitteet

1. Ranzato, MA Oppimisesta mistä etsiä. arXiv:1405.5488, (2014).

2. Ba, J., Salakhutdinov, RR, Grosse, RB, & Frey, BJ. Opitaan heräämisen ja unen toistuvia huomiomalleja. Julkaisussa NIPS, 2593–2601 (2015).

3. Mnih, V. et ai. Visuaalisen huomion toistuvat mallit. Julkaisussa NIPS, 2204–2212 (2014).

4. Ba, J., Mnih, V., & Kavukcuoglu, K. Useiden esineiden tunnistus visuaalisella huomiolla. arXiv:1412.7755 (2014).

5. Dutta, JK & Banerjee, B. Luokituksen tarkkuuden vaihtelu vilkaisujen lukumäärällä. julkaisussa IJCNN, 447–453 (IEEE, 2017).

6. Larochelle, H. & Hinton, GE Oppia yhdistämään foveal välähdyksiä kolmannen asteen Boltzmann-koneeseen. Julkaisussa NIPS, 1243–1251 (2010).

7. Elsayed, G., Kornblith, S. & Le, QV Saccader: Kovan huomion mallien tarkkuuden parantaminen näköä varten. Julkaisussa NIPS, 702–714 (2019).

8. van Beers, RJ Te vaihtelevuuden lähteitä sakkadisissa silmien liikkeissä. J. Neurosci. 27(33), 8757–8770 (2007).

9. Itti, L. & Baldi, P. Bayesilainen yllätys herättää ihmisten huomion. Vis. Res. 49(10), 1295–1306 (2009).

10. Egner, S. et ai. Huomio- ja tiedonhankinta: Hiiren napsautuksen vertailu silmien liikkeiden huomion seurantaan. J. Eye Mov. Res. 11(6), (2018).

11. Peterson, MS, Kramer, AF & Irwin, DE Peitetut huomionsiirrot edeltävät tahattomia silmien liikkeitä. Percept. Psychophys. 66(3), 398–405 (2004).

12. Jiang, M. et ai. Pii: Näkyvyys kontekstissa. Julkaisussa CVPR, 1072–1080 (2015).

13. Kim, NW et ai. BubbleView: Käyttöliittymä kuvien tärkeyskarttojen joukkolähteeseen ja visuaalisen huomion seuraamiseen. ACM Trans. Comput. Hyräillä. Ole vuorovaikutuksessa. 24(5), 1–40 (2017).

14. Sermanet, P., Frome, A. & Real, E. Huomio hienorakeiseen luokitteluun. arXiv:1412.7054 (2014).

15. Egner, S., Itti, L. & Scheier, C. Huomiomallien vertailu erityyppisiin käyttäytymistietoihin. Tutki. Ophthalmol. Vis. Sci. 41(4), S39 (2000).

16. Navalpakkam, V. et ai. Silmän ja hiiren käyttäytymisen mittaaminen ja mallintaminen epälineaaristen sivuasettelujen kanssa. Julkaisussa Proc. Int. Conf. WWW, 953–964 (2013).

17. Matzen, LE, Stites, MC & Gastelum, ZN Visuaalisen haun tutkiminen ilman katseenseurantalaitetta: keinotekoisen foveation arviointi. Cogn. Res. Prins. Implisiittinen. 6(1), 1–22 (2021).

18. Tafi, AP et ai. OCR palveluna: Google Docsin OCR:n, Tesseractin, ABBYY FineReaderin ja Transymin kokeellinen arviointi. Julkaisussa Int. Symp. Vis. Comput., 735–746 (Springer, 2016).

19. Memon, J., Sami, M., Khan, RA & Uddin, M. Käsinkirjoitettu optinen merkintunnistus (OCR): Kattava systemaattinen kirjallisuuskatsaus (SLR). IEEE Access 8, 142642–142668 (2020).

20. Chaudhuri, A., Mandaviya, K., Badelia, P. & Ghosh, SK Optiset merkintunnistusjärjestelmät. Teoksessa Optical Character Recognition Systems for Different Language with Sof Computing, 9–41 (Springer, 2017).

21. LeCun, Y. et ai. Gradienttipohjainen oppiminen, jota sovelletaan asiakirjojen tunnistamiseen. Proc. IEEE 86(11), 2278–2324 (1998).

22. Cohen, G., Afshar, S., Tapson, J. & van Schaik, A. EMNIST: MNIST:n laajennus käsinkirjoitettuihin kirjeisiin. arXiv:1702.05373, (2017).

23. Gregor, K., Danihelka, I., Graves, A., Rezende, D. & Wierstra, D. DRAW: Toistuva hermoverkko kuvan luomiseen. Julkaisussa ICML, 1462–1471 (2015).

24. Friston, K. Te vapaan energian periaate: karkea opas aivoihin?. Trends Cogn. Sci. 13(7), 293–301 (2009).

25. Mirza, MB, Adams, RA, Friston, K. & Parr, T. Esittelemme bayesilaisen valikoivan huomion mallin, joka perustuu aktiiviseen päättelyyn. Sci. Rep. 9(1), 1–22 (2019).

26. Bylinskii, Z., Judd, T., Oliva, A., Torralba, A. & Durand, F. Mitä erilaiset arviointimittarit kertovat näkyvyyden malleista? IEEE Trans. Pattern Anal. Mach. Intell. 41(3), 740–757 (2018).

27. Itti, L. & Koch, C. Visuaalisen huomion laskennallinen mallinnus. Nat. Rev. Neurosci. 2(3), 194–203 (2001).

28. Lamme, VAF Tietoista näkemistä synnyttävät visuaaliset toiminnot. Edessä. Psychol., 11, (2020).

29. da Silva, MRD & Postma, M. Vaeltavat mielet, vaeltavat hiiret: Tietokonehiiren seuranta menetelmänä mielen vaeltamisen havaitsemiseksi. Comput. Hyräillä. Behav. 112, 106453 (2020).

30. Schütz, AC, Braun, DI & Gegenfurtner, KR Silmien liikkeet ja havainto: valikoiva katsaus. J. Vis. 11(5), 9–9 (2011).

31. Intoy, J. & Rucci, M. Hienosäädetyt silmien liikkeet parantavat näöntarkkuutta. Nat. Commun. 11(1), 1–11 (2020).

Saatat myös pitää