AttentionMNIST: Athyglisrakningargagnasett með músarsmelli fyrir handskrifaða tölu og stafrófsgreiningu

Feb 22, 2024

Mörg athyglisbundin líkön sem þekkja hluti með röð af innsýnum hafa greint frá niðurstöðum um handskrifaða tölugreiningu. Hins vegar eru engin gögn til að rekja athygli fyrir handskrifaðar tölur eða stafrófsgreiningu tiltækar. Aðgengi slíkra gagna myndi gera kleift að meta líkön sem byggjast á athygli í samanburði við frammistöðu manna. Við söfnum músa-smella athyglisrakningargögnum frá 382 þátttakendum sem reyna að þekkja handskrifaðar tölustafi og stafróf (hástafi og lágstöfum) úr myndum með raðsýni. Myndir úr viðmiðunargagnasettum eru settar fram sem áreiti. Safnað gagnasafn, sem kallast AttentionMNIST, samanstendur af röð sýnishorna (mússmella) staðsetningar, pr.skipulögð flokkamerki við hverja sýnatöku og lengd hverrar sýnatöku. Að meðaltali sjá þátttakendur okkar aðeins 12,8% af mynd til viðurkenningar. Við leggjum til grunnlíkan til að spá fyrir um staðsetningu og flokk(a) sem þátttakandi velur við næstu sýnatöku. Þegar það verður fyrir sama áreiti og tilraunaaðstæðum og þátttakendur okkar, er mjög vitnað í athyglisbundið styrkingarlíkan skortur á mannlegri skilvirkni.

Chinese herb cistanche

Kínverskur cistanchejurt- Koma í veg fyrir Alzheimerssjúkdóma vörur

Vélræn nám (ML) líkön sem þekkja hluti með röð af innsýnum hafa vakið áhuga undanfarin ár vegna sveigjanleika þeirra og skilvirkni. Mörg þessara líkana, eins og 1–7, hafa greint frá tilraunaniðurstöðum á viðmiðunargagnagrunni MNIST fyrir handskrifaða tölugreiningu. Því miður eru engin gögn til að rekja athygli fyrir MNIST tiltæk. Þetta kemur í veg fyrir mat á athyglisbyggðum líkönum í samanburði við mannlega frammistöðu. Við lentum í því bili með því að safna gagnasafni frá fullorðnum þátttakendum sem reyndu að þekkja handskrifaðar tölur og stafróf úr myndum með raðsýni. Ólíkt augnhreyfingarathygli (emAT), þá smellir þátttakandi á staðsetninguna á myndinni sem hann vill sjá (eins konar mús-smella athyglisrakningu (mcAT)). Strax eftir það velur hann flokk(a) sem hann spáir fyrir um að hluturinn gæti tilheyrt miðað við athuganir hans hingað til. Þannig, í hverjum sýnatökuþætti, samanstanda gögn okkar af myndstað sem valin er, flokksmerkingum sem spáð er fyrir um og tíma sem þátttakandinn tók frá síðasta þætti. Eftir hverja mynd fær þátttakandinn verðlaun eftir frammistöðu hans (nákvæmni og skilvirkni).

Anti Alzheimer's disease

Ávinningur af cistanche tubulosa-Anti Alzheimer sjúkdómi

Kostir mcAT umfram emAT fyrir handskrifaða tölu/stafrófsþekkingu.

(1) kjöt inniheldur verulegan breytileika innan og á milli einstaklinga í festingarstað, sérstaklega fyrir truflanir áreiti (myndir)8,9. Þannig að mikið magn af gögnum um augnfestingar þarf til að komast að tölfræðilega marktækum niðurstöðum. mcAT er ekki næmt fyrir sumum upptökum tæknilegra hávaða sem eru algengir í augnrakningargögnum10. (2) Augnhreyfingar geta stafað af bæði sjálfviljugum og ósjálfráðum aðferðum11. Til að auðvelda verkefnaháða ákvarðanatöku gefum við þátttakendum nægilegan tíma, samhengi og styrkingarmerki, sem einnig er hægt að kynna fyrir ML líkani. (3) Nákvæmni og nákvæmni emAT gagna er háð augnrekstrinum á meðan það sama og mcAT er óháð hvaða tæki sem er. (4) Það er áskorun að samstilla augnhreyfingar manns við bekkjarval hans. Til að vinna bug á þessu, í okkar tilviki, eru sýnatökustaðurinn og flokkarnir valdir í sama þættinum. (5) Að lokum gerir aðferð okkar kleift að safna gögnum með því að nota Amazon Mechanical Turk (MTurk), eins og í 12,13, sem er kostnaðar- og tímahagkvæmt og auðvelt að endurskapa.

Framlög.

Við söfnum mcAT gagnasafni, sem kallast AttentionMNIST, með því að nota MTurk frá 382 þátttakendum, verðlaunað fyrir að þekkja handskrifaðar tölustafi og stafróf (hástafi og lágstöfum) nákvæmlega og skilvirkt úr myndum með raðsýni. Myndir úr viðmiðunargagnasöfnum (MNIST, EMNIST) eru settar fram sem áreiti. Að meðaltali eru skráð 169,1 svör í hverjum flokki með tölu/stafróf. Með því að nota þetta gagnasafn sýnum við eftirfarandi: • Að meðaltali þurfa þátttakendur 4,2, 4,7 og 4,9 sýni til að þekkja tölustafi, hástafi og lágstafi, sem samsvara aðeins 11,3%, 13,4% og 13,7% af flatarmáli myndarinnar í sömu röð. . Flokkunarnákvæmni eykst með nokkrum sýnum. • Líkan, sett fram sem grunnlína, getur spáð fyrir um flokk(a) og staðsetningu sem þátttakandi velur í næsta sýnatökuþætti með 74,4% og 67,7% nákvæmni í sömu röð, bæði að meðaltali yfir öll sýnatökur og gagnasöfn. Nákvæmni flokksspár eykst og staðsetningarspánákvæmni minnkar með aukningu sýna. • Þegar það er útsett fyrir sama áreiti og skilyrðum og þátttakendur okkar, krefst 3,7, 8,5 og 7,6 sýnishorn til að bera kennsl á tölustafi, hástöfum og lágstöfum, sem svarar til 8,9% af endurteknum athyglislíkani (RAM)3 sem er byggt á styrkingu sem byggir á endurteknum athygli. , 21.0%, 18,7% af flatarmáli myndarinnar. Önnur athyglisbundin styrkingarlíkön (td 1,2,4,5,7,14) má á sama hátt meta í samanburði við frammistöðu manna.

Cistanche supplement near me-Improve memory2

Cistanche viðbót nálægt mér-Að bæta minni

Smelltu hér til að skoða vörur frá Cistanche sem bætir minni og kemur í veg fyrir Alzheimerssjúkdóm

【Biðja um meira】 Netfang:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Tengd vinna

Tímaröð mússmella í mcAT er hliðstæð augnhreyfingar scanpath10. mcAT getur í raun komið í stað emAT þar sem þau eru marktæk fylgni10,12,13,15–17. Mismunandi áreiti hafa verið notuð í mcAT rannsóknum, svo sem myndir af líflegum og líflausum hlutum10, myndir af náttúrulegum sviðum12,13, kyrrstæðar vefsíður13, leitarsíðuuppsetningu16 og tveir listar yfir tölustafi til sjónræns samanburðar17. Hins vegar hefur mcAT ekki verið notað fyrir handskrifuð tölu-/stafrófsflokkunarverkefni eða mat á athyglisbundnum flokkunarlíkönum. mcAT rannsóknir hafa notað eiginleika eins og tíma til að hafa samband, hlutfallslega festingartíðni á áhugasviðum (AOIs), hlutfallslegt hlutfall einstaklinga sem smelltu að minnsta kosti einu sinni í AOI10, fjölda festinga í hverri rannsókn, endurfestingar innan rannsókna, dvalartímar og skanningarleiðir17 , festingarkort12,13, AOI og upplýsingaflæðimynstur16. Röð tímastimplaðra smellastaðsetninga og spáðra flokkamerkinga mynda hrá gögnin sem nauðsynleg eru til að meta skilvirkni og nákvæmni athyglisbyggðra líkana eða manna í flokkunarverkefnum. Hægt er að fá mismunandi eiginleika úr þessum gögnum. mcAT gagnasafnið okkar, með margvíslegum ávinningi umfram augnrakningargögn, fyllir afgerandi skarð í athyglisbundnum líkanarannsóknum á gervigreind, ML og öðrum sviðum. Gagnapakkar okkar mun gera kleift að meta líkön sem byggjast á athygli í samanburði við frammistöðu manna. Þetta mun meðal annars auðvelda þróun skilvirkra og rauntíma ljóskennslukerfa sem hafa víðtæka notkun í reynd (sjá til dæmis 18–20). Hægt er að setja fram tilgátur og prófa meginreglur sem leiðbeina sjónrænum festingum með því að nota gagnasafnið okkar. Hægt er að flytja árangursríkar meginreglur til að þróa kerfi fyrir raunveruleg sjóngreiningarverkefni þar sem skilvirkni er lykilatriði, svo sem í sjálfvirkum akstri.

Gögn

Gögnin okkar samanstanda af röð af T þáttum fyrir hvern þátttakanda. Gögnin úr hverjum þætti samanstanda af (1) staðsetningu á myndinni sem þátttakandinn smellti á (einn smellur á mynd í hvern þátt), (2) bekknum/flokkunum sem þátttakandinn valdi og (3) tímanum sem þátttakandinn tók. þátttakanda til að skrá núverandi úrtak (þ.e. tíminn sem leið frá síðasta og núverandi smelli á myndinni). Þessi hluti mun útskýra gagnasöfnunarferlið okkar, þar á meðal val á áreiti, þátttakendur, sjónræn verkefni, árangursstig og gagnasíun.

Áreiti val. Áreiti eru valin úr myndum í tveimur viðmiðunargagnasettum: (1)

MNIST21 gagnasafn samanstendur af 70,000 merktum myndum (28×28 dílar) með 10 handskrifuðum tölustöfum {0, 1, ..., 9}. (2)

EMNIST22 gagnasafn samanstendur af 145.600 myndum (28×28 pixlum) af handskrifuðum enskum stafrófum með hástöfum og lágstöfum, sem mynda jafnvægisflokk. Allar myndir eru merktar með einum af 26 flokkum {a, b, ..., z}. Hins vegar er hástafi eða lágstafi ekki tengdur neinni mynd. Úr hverjum flokki veljum við 15 vel myndaða tölustafi úr MNIST og 15 vel mótuð stafróf, hvert úr EMNIST hástöfum og EMNIST lágstöfum gagnasettum. Vel mótuð tala eða stafróf er svipað og viðmið í flokki þess. Þannig kynnum við áreiti úr mengi 15(10 + 26 + 26)=930 einstakra mynda, með 15 myndum sem tilheyra hverjum af 62 flokkunum. Vel mótaðar 930 myndirnar eru valdar sem hér segir:

Skref 1: Stöðluðu hverja mynd með lágmark-hámarki til að stilla styrkleikann á milli 0 og 1.

Skref 2: Merktu vel mótaðar EMNIST myndir með hástöfum eða lágstöfum. Fyrir hvern stafrófsflokk er vel mótað stafróf úr bæði hástöfum og lágstöfum myndum handvirkt valið og merkt. Reiknaður er kósínuslíking allra mynda sem tilheyra þeim flokki og merktu myndanna tveggja. Myndirnar sem eru fyrir ofan kósínuslíkindisþröskuldinn (valdar í reynslu sem 0.8) fá hástafi eða lágstafi.

Skref 3: Reiknaðu meðaltal myndanna sem tilheyra hverjum flokki. Meðalmynd stéttar er viðmið hennar. Mynd er gjaldgeng til að vera áreiti ef kósínuslíking hennar við meðalmynd flokks hennar er meiri en reynslufræðilega ákvarðaður þröskuldur (0.7 fyrir MNIST, 0.75 fyrir EMNIST).

Skref 4: Meðal gjaldgengra mynda eru 15 myndir úr hverjum flokki valdar handvirkt eftir því hversu vel mótaðar þær eru. Hver mynd, upphaflega 28×28 pixlar, er minnkað í 27×25 með því að fjarlægja pixlana nálægt mörkunum þar sem þeir hafa engin styrkleikabreytileika. Meðaltal þessara 15 mynda er reiknað fyrir hvern 62 flokka. Við táknum þessar meðalmyndir sem I1, I2, ..., In fyrir n flokka í hverju gagnasafni.

Þátttakendur.

Alls tóku 382 fullorðnir einstaklingar þátt í rannsókninni okkar. Engin valviðmið voru notuð. Þátttakandi gæti svarað mörgum myndum. Fyrir hvern af 62 bekkjum voru að meðaltali 169,1 svörun skráð.

man-5989553_960_720

Kostir cistanche tubulosa-Andstæðingur Alzheimerssjúkdóms

Sjónrænt verkefni.

MTurk viðmótið fyrir sjónrænt verkefni okkar er sýnt á mynd 1. Striga af stærð 270×250 sýnir lágstyrka bakgrunnsmynd á öllum tímum. Bakgrunns- og örvunarmyndirnar eru tífaldar uppsampaðar í 270×250. Miðja striga er í takt við miðju myndanna. Bakgrunnur Upphaflega er bakgrunnurinn meðaltal allra mynda í gagnasafninu sem áreitið er dregið úr. Eftir fyrsta þáttinn er bakgrunnurinn meðaltal allra mynda úr hópnum sem þátttakandinn valdi í síðasta þættinum. Í hinum raunverulega heimi er samhengi fyrir staðsetningu, stærð og stefnu tölustafs eða stafrófs fengin úr skriftinni í hverfinu þess, sem vantar hér. Þegar tilraunir okkar voru gerðar með tómum bakgrunni tóku þátttakendur oft sýnishorn af staðsetningu myndarinnar sem innihélt engan hluta af hlutnum. Þessi hegðun var innifalin með því að birta meðalmynd af völdum flokki/flokkum í lágstyrkum bakgrunni og minnka stærð allra MNIST og EMNIST mynda úr 28×28 pixlum í 27×25. Í hvert sinn sem þátttakandinn velur staðsetningu á striganum með því að smella á hann kemur í ljós 50×50 pixla plástur sem er miðjumaður á þeim stað frá örvunarmyndinni. Plástur sem einu sinni hefur verið opinberaður heldur áfram að birtast þar til í síðasta þættinum. Verkefni þátttakanda samanstendur af þremur skrefum í hverjum þætti t (t=1, ..., T):

Skref 1: Smelltu hvar sem er á 270×250 striganum til að sýna plásturinn sem hann vill sýna. Aðeins fyrsti smellurinn er samþykktur.

Skref 2: Þekkja töluna/stafrófið úr öllum sýnum sem hafa sést hingað til. Þátttakandi getur valið marga flokka og verður að velja að minnsta kosti einn flokk af listanum yfir flokka sem sýndur er fyrir neðan striga.

Skref 3: Smelltu á "Næsta" neðst á skjánum til að halda áfram. Til að álykta um bekkinn nákvæmlega og fljótt verður þátttakandinn að velja staðina af skynsemi miðað við athuganir hans fram að núverandi þætti. Það eru engin tímatakmörk fyrir þátt. Hins vegar takmörkum við heildartíma T þátta í mynd við sex mínútur. Við veljum T=12 þar sem mjög tilvitnuð verk um rithönd sem byggir á athygli eða kynslóð hafa notað færri en 12 innsýn (td RAM3 gæti þekkt MNIST tölustafi innan 7 glimps, DRAW23 gæti búið til MNIST tölur innan 11 glimps), og menn geta þekkt handskrifaðar tölustafi og stafróf í mun færri en 12 innsýn.

Árangursstig. Einkunn er gefin til þátttakanda út frá nákvæmni hans og skilvirkni hvað varðar fjölda sýna sem sést. Látum það vera hópinn af flokkum sem hann valdi í hvaða þætti sem er t. Tíu, stig hans á t er:

Figure 1. Our MTurk interface as seen by a participant. Te second sampling for an EMNIST uppercase alphabet is shown.

Mynd 1. MTurk viðmótið okkar eins og það sést af þátttakanda. Önnur sýnataka fyrir EMNIST hástafróf er sýnd.

image


hvar |.| táknar aðalgildi mengis. Heildarstigið sem gefið er í T þáttum er h {{0}} T t=1 Pt. Þess vegna er hámark sem maður getur skorað í T þáttum T ef hann velur alltaf bara réttan flokk. Lágmarkið sem maður getur skorað í T þáttum er núll ef hann velur alltaf flokk af flokkum sem inniheldur ekki réttan flokk. Svo, 0 Minna en eða jafnt og h Minna en eða jafnt og T. Fyrr sem þátttakandi velur réttan flokk, því hærra mun hann vera. Þannig tekur þetta stigakerfi tillit til viðurkenningarnákvæmni og sýnatökuhagkvæmni. Að reyna að hámarka einkunnina með því að velja aðeins einn flokk úr fyrsta þættinum mun vera áhættusamt þar sem núllstigið verður gefið ef það er ekki réttur flokkur, en stig sem er hærra en núll fást ef þátttakandinn velur marga flokka ( jafnvel allir flokkar) sem innihalda réttan flokk. Þetta mun hvetja þátttakandann til að svara út frá líklegum flokkum í huga hans í hvaða þætti sem er. Einkunn sem veitt er í hverjum þætti er aðeins birt að loknum T þáttum til að forðast að gefa þátttakanda neina vísbendingu. Í MTurk er þóknun sem þátttakandi fær fyrir mynd í hlutfalli við heildareinkunn hans, h.

Gagnasíun.

Ef stig þátttakanda í lokaþættinum (þ.e. T-þætti) fyrir örvunarmynd er núll er gögnum hans sem skráð eru fyrir þá mynd hent. Gögnunum er einnig hent ef þátttakandi skilur verkefnið ólokið. Með þessum valviðmiðum fengum við svör við 1736 áreiti frá MNIST, 4431 áreiti frá EMNIST hástöfum og 4315 áreiti frá EMNIST lágstöfum; það er 169,1 svörun á bekk að meðaltali.

Líkön og aðferðir til að nýta gögn

Í þessum hluta sýnum við gagnsemi safnaðra gagna með því að (4.1) útvega grunnlíkan til að spá fyrir um hegðun þátttakanda og (4.2) sýna hvernig hægt er að bera saman núverandi styrkingarlíkan sem byggir á athygli við tölur/stafrófsgreiningu manna. frammistaða. Grunnlínan fyrir hegðunarspá. Hegðun í hvaða þætti sem er t samanstendur af staðsetningarvali og flokksvali. Þar sem sýni inniheldur mismunandi magn upplýsinga fyrir mismunandi áhorfendur, eða jafnvel fyrir sama áhorfandann á mismunandi tímum9, er hegðunarspá hvers þátttakanda erfitt vandamál. Látum n vera fjölda flokka í gagnasafni, ηt vera eintóna mengið sem inniheldur sanna flokkinn fyrir áreitimyndina við t, ct vera mengi flokka og það er staðsetningin sem þátttakandi velur við t, til að vera athugun hans kl. t, og 1:t táknar röðina 1, 2, ..., t. Fram að einhverju t eru athuganir þátttakanda o1:t og staðirnir sem hann valdi eru l1:t. Við mótum vandamálið um hegðunarspá þátttakanda sem hér segir: Klassaspá Áætlaðu líkurnar á i∈ct (i=1, 2, ..., n) miðað við hans o1:t og l1:t, þ.e. P( i ∈ ct|o1:t, l1:t). Staðsetningarspá Áætlaðu líkurnar á lt+1 miðað við o1:t, l1:t og ct hans, þ.e. P(lt+1|o1:t, l1:t,ct). Bekkjarspá. Til að spá fyrir um flokkinn sem þátttakandi velur í þætti t reiknum við út líkurnar á því að myndáreiti í t tilheyri flokki I miðað við valin staðsetningar l1:t þátttakanda og samsvarandi athuganir o1:t, sem hér segir:

image

þar sem Ii er meðaltal áreitismyndanna (27×25) sem tilheyra flokki i, I′ er 27×25 mynd sem inniheldur o1:t við l1:t, · táknar mælikvarða og .táknar evklíðska norm. Allur pixlastyrkur er ekki neikvæður. Í hvaða þætti t sem er, mynda k hæstu líklegu flokkarnir úr trúardreifingunni P(i|o1:t, l1:t) mengi flokka, ˆct, sem spáð er fyrir með líkaninu okkar, þar sem k=|ct|. Flokkunarnákvæmni er mæld með Jaccard index (JI). JI mælir líkindi tveggja menga, X og Y, sem: J(X, Y) {{10}} |X ∩ Y|/|X ∪ Y|. JI afmarkast á milli 0 og 1; ef X=Y, J(X, Y)=1. Í hvaða þætti sem er t er flokkunarnákvæmni þátttakanda J(ηt,ct) á meðan líkanið okkar er J(ηt, ˆct). Vegna nefnarans refsar JI meira þar sem fjöldi þátta í spámenginu (ct eða ˆct) sem eru ekki í ηt eykst, sem er æskilegur eiginleiki fyrir okkar tilvik. Líkindin milli flokkunar þátttakanda og líkans okkar er mæld með J(ct, ˆct). Líkanið okkar er einnig metið með tilliti til flokksvals og höfnunarnákvæmni með tilliti til hvers þátttakanda. Látum st=ct − ct−1 vera mengi nýrra flokka sem valdir eru og rt=ct−1 − ct vera mengi flokka sem þátttakandi hafnaði í t. Á sama hátt er ˆst=ˆct − ct−1 mengi nýrra flokka sem valdir eru og ˆrt=ct−1 − ˆct er mengi flokka sem var hafnað af líkaninu okkar við t. Þá má líkja flokkavali og höfnun líkansins við þátttakanda með J(st, ˆst) þegar |st| > 0 og J(rt, ˆrt) þegar |rt| > 0, í sömu röð. Staðsetningarspá. Tilgáta Helst ætti trúardreifingin yfir alla flokka að vera ómótuð (þ.e. aðeins einn toppur) og þunnt Gaussian (þ.e. lítið staðalfrávik) í lögun sem gefur til kynna að þátttakandi sé öruggur um flokk (ástand) áreitis (umhverfi). Hins vegar, eins og augljóst er af gögnum okkar (tilvísun. mynd 2), er þátttakandi oft ruglaður á milli margra flokka, sérstaklega í fyrstu þáttunum. Í þessum tilvikum hefur trúardreifing hans marga toppa eða er feitur Gauss. Við gerum tilgátur um að markmið þátttakanda sé að renna saman í einmóta og þunnan Gauss, til að ná því sem hann tekur valið úr stöðum sem draga úr líkum á öllum flokkum nema einum. Þessi tilgáta leiðir til þess að lágmarka óvissu um flokkana (umhverfisástand) sem er vel þekkt meginregla sem stýrir aðgerðum24, þar með talið augnhreyfingar25.

Figure 2. Duration and class distribution over all participants and stimuli belonging to categories '0', 'a', and 'A'.


Mynd 2. Tímalengd og flokkadreifing yfir alla þátttakendur og áreiti sem tilheyra flokkunum '0', 'a' og 'A'.

Te observations at certain locations in a stimulus image can discriminate between certain classes. Te observation at a location l might indicate that the numeral/alphabet belongs to class I and not to class j. Such locations are more salient than others in achieving a participant's goal. To sample such locations, a saliency map, Dij, is computed such that if l is salient, the observation at l is evidence to increase the probability of class I and decrease that of j. Mathematically, Dij = N (., σ ) ∗ g(.), where ∗ is the convolution operator, g(.) is a saliency scoring function, and N (., σ ) is a 5×5 Gaussian kernel with standard deviation σ = 6 to smooth the saliency scores. We denote the set of all saliency maps as D = {Dij: i, j ∈ {1, 2, ..., n}, i �= j}. A location l in a stimulus image is salient for class i with respect to class j if Dij(l)>θ, þar sem þröskuldurinn θ=0.5 × max(D) er reynsluákvörðuð mælikvarðastærð.

Við lítum á tvær ósamhverfar mælikvarða, Kullback-Leibler (KL) mismun og mismun, sem kandídata fyrir fallið g. KL frávik Að gefnar tvær eðlilegar meðalmyndir, Ii og Ij, mælir KL frávik KL(Ii, Ij) tap á upplýsingum þegar Ij er notað til að nálgast Ii. Þetta er reiknað út fyrir hvern pixla k as26: KL(Ii,k, Ij,k)=Ii,k log δ + Ii,k Ij,k+δ, þar sem Ij,k er styrkleiki kth pixlans af Ij, og δ er reglusetningarfasti. Þegar Ii,k=Ij,k, KL(Ii,k,Ij,k) → 0. Mismunur Miðað við tvær eðlilegar meðalmyndir, Ii og Ij, er munurinn fyrir hvern pixla k Diff (Ii,k, Ij,k)=Ii,k − Ij,k. Þegar Ii,k=Ij,k, Diff (Ii,k, Ij,k)=0. Þátttakandi er óviss um flokkasettið, ct, sem hann valdi í núverandi þætti. Þess vegna, fyrir staðsetningarspá, lítum við aðeins á þau áberandi kort í D sem fela í sér flokkana í ct. Spáð er fyrir staðsetningu ef hún er áberandi út frá þessum merkiskortum og var aldrei valin af þátttakandanum. Tus, gefið o1:t, l1:t og ct, er staðsetningin lt+1 spáð sem hér segir:

image

þar sem Ŵ er mengi 3-túlla sem innihalda fyrirhugaða staðsetningu ˆl, flokkinn sem hann er áberandi fyrir (i) og með tilliti til hvaða flokks (j). Staðsetningin er rétt spáð ef það er til �ˆl, i, j� ∈ Ŵ þannig að �ˆl − lt+1� < ǫ, I ∈ ct+1 og j /∈ ct{{3} }, þar sem ǫ er hámarks evklíðsfjarlægð milli miðpixla og hvaða pixla sem er í athugunarplástri. Gervikóði fyrir staðsetningarspá er sýndur í reiknirit 1. Nákvæm útskýring á gervikóðanum er að finna í kafla S1 í viðbótarefninu. (Te líkindadreifing, P(lt+1|o1:t, l1:t,ct), má reikna út með því að gera ráð fyrir að áberandi stig staðsetningar sem ekki eru í Ŵ sé núll og staðla síðan áberandi stig allra staðsetningar til að leggja saman í einingu. Hins vegar hafa þessar líkur ekki verið notaðar, þar sem jafningur (3) nægir í tilgangi þessarar greinar.)

image

Mat á líkönum sem byggja á athygli.

Sem fulltrúi athyglismiðaðra líkana, lítum við á hið mjög vitnaða endurtekna athyglislíkan (RAM)3 sem greinir frá tilraunaniðurstöðum á MNIST gagnapakkanum. Þetta styrkingarlíkan tekur sýnishorn af mynd í röð og ákveður hvar á að taka sýni næst á hverju sýnatöku augnabliki, sem gerir það viðeigandi fyrir mat með því að nota söfnuð gögn.

Vinnsluminni

flokkar myndir með því að nota röð af innsýnum. Næsta staðsetning er valin stochastískt úr dreifingu sem er stillt af staðsetningarneti. Líkanið er þjálfað frá lokum til enda með því að hámarka eftirfarandi markmið3:

image


þar sem M er fjöldi þátta, T er fjöldi athugana, xi 1:t er víxlverkunarröð sem fæst með því að keyra núverandi miðil fram að I þáttum, ui t er núverandi aðgerð, θ er mengi þjálfanlegra færibreyta, Ri t er uppsöfnuð umbun, bt er grunnlína og π(ui t|xi 1:t; θ ) er stefnan. Hegðun vinnsluminni má bera saman við hegðun þátttakenda með því að bera saman festingarkortin sem fengin eru úr röð staðsetninga sem vinnsluminni spáir fyrir um og þeirra sem þátttakendur hafa valið. Fastsetningarkort er reiknað út með því að úthluta hverjum stað gildi sem jafngildir tíðni valsins og staðla síðan þessi gildi til að búa til dreifingu yfir alla staði.

Mælingar til að bera saman festingarkort. Fyrir mælikvarða sem bera saman tvö festingarkort, P og Q, fylgjumst við náið með 26. Við notum þrjár dreifingartengdar mælikvarða: KL frávik (KL), Pearson fylgnistuðull (CC) og Similarity (SIM), til að bera saman dreifingu sýnatökustaða úr líkani með því frá þátttakendum eins og það er skráð í söfnuðu gögnunum.

KL (skilgreint fyrr) er mjög viðkvæmt fyrir núllgildum.

CC getur metið línulegt samband milli tveggja korta sem 26: CC(P, Q)=σ (P, Q) σ (P)σ (Q), þar sem σ er dreifni eða samdreifni. Þar sem CC er samhverft tekst það ekki að álykta hvort munur á festingarkortum sé vegna rangra jákvæðra eða rangra neikvæðra.

SIM er mælt sem 26: SIM(P, Q)=k mín(Pk, Qk), þar sem k Pk=k Qk=1. Eins og CC er SIM samhverft og erfir sama galli. SIM er líka mjög viðkvæmt fyrir gildum sem vantar og refsar spám sem gera ekki grein fyrir sannleikaþéttleika jarðarinnar.

Rannsóknir á mönnum og dýrum.

Rannsóknarnefnd stofnana við háskólann í Memphis hefur ákveðið að þessi rannsókn uppfyllir ekki skilgreiningu Office of Human Subjects Research Protections á rannsóknum á mönnum og 45 CFR hluti 46 á ekki við. Þess vegna þarf þessi rannsókn ekki samþykkis IRB eða endurskoðunar.

Niðurstöður tilrauna Gagnagreining.

Hægt er að sjá fyrir gögnunum sem safnað er með tilliti til dreifingarröðarinnar á völdum stöðum (mynd 3), völdum flokkum (mynd 2) og lengd á milli samfelldra þátta (mynd 2). Þessar dreifingar eru mjög svipaðar fyrir gagnasöfnin þrjú. Fyrir hvaða tölu eða stafróf sem er, líkist dreifing völdum stöðum eftir lokaþáttinn dreifingu pixlastyrks flokks hans úr gagnasafninu. Hins vegar er röð staðsetninga sem valin eru stokastísk í eðli sínu. Bekkjardreifingin gefur til kynna rugling milli flokka með svipaða uppbyggingu í fyrstu þáttunum þegar þátttakendur velja marga flokka. Þessi ruglingur minnkar með meiri sýnatöku. Marktæk jákvæð fylgni er á milli gráðu ruglings (# valdir flokkar/alls # flokkar) og tímalengdar sýnatöku (sjá mynd 4). Ef fjöldi valinna flokka er mikill (lágur) er lengdin á milli þátta í röð mikill (lágur). CC á röð staðsetningar sem þátttakandi valdi fyrir bekkinn er ekki marktækur (tafla 1). Búist er við þessu vegna breytileika milli viðfangsefna í sýnatöku kyrrstæðra mynda. Meðalfjöldi sýnataka sem þátttakandi þarf til að spá nákvæmlega fyrir um flokk er frekar lítill. Að meðaltali tekur það 4,2, 4,7 og 4,9 sýni sem samsvara 36, ​​44,1 og 48,1 sekúndum til að flokka MNIST, EMNIST hástafi og lágstafi nákvæmlega. Þátttakendur skoðuðu að meðaltali aðeins 11,3%, 13,4% og 13,7% af flatarmáli myndarinnar til að flokka mynd með tölustöfum, hástöfum og lágstöfum nákvæmlega (sjá mynd S2 í viðbótarefninu). Þessar niðurstöður undirstrika skilvirkni sjónræna rökhugsunarkerfisins, að vísu í lægri upplausn en gögn um augnrakningar en með minni hávaða og breytileika. Þessar reynsluniðurstöður geta verið gagnlegar til að hanna athyglisbundin líkön fyrir raunveruleg forrit. Hegðunarspá. Í þessum hluta er árangur grunnlíkans okkar metinn með tilliti til þess hversu nákvæmlega það getur spáð fyrir um staðsetningu hvers þátttakanda og flokksval. Þar sem tilraunaniðurstöður okkar með því að nota föllin tvö áberandi stig, KL frávik og mismunur, eru nokkuð svipaðar, er greint frá niðurstöðum með því að nota aðeins mismun nema annað sé tekið fram. Bekkjarspá. Klassaspánni og nákvæmnismatsaðferðum hennar er lýst í hlutanum „Bekkjarspá“. Nákvæmni flokkaspá, sýnd á mynd 5, er reiknuð yfir alla flokka fyrir öll sýnatökur. Meðalnákvæmni flokksspár fyrir allar sýnatökur og gagnapakka er 74,4% (std. dev. 26,5). Myndir 5a og b sýna að hópur flokka sem þátttakendurnir og grunnlínulíkanið okkar valdi (Jöfnuður 2) er frekar ónákvæmt í fyrstu þáttunum og batnar með aukningu á sýnum. Mynd 5c sýnir að í fyrstu þáttunum eru þessi tvö sett, ct og ˆct, nokkuð ólík; líkindi eykst með fjölgun sýna. Sama gildir um nýtt flokkaval (svo mynd 5f). Hins vegar eru flokkshöfnanir svipaðar í fyrstu þáttunum; líkindi eykst enn frekar með fleiri sýnum (tilvísun mynd 5e). Þar sem J(st, ˆst)=|(ct ∩ ˆct) − ct−1| |(ct ∪ ˆct) − ct−1| og J(rt, ˆrt)=|ct−1 − (ct ∪ ˆct)| |ct−1 − (ct ∩ ˆct)|, það má álykta af mynd 5e, f að í upphafsþáttunum séu skurðpunktarnir á milli ct−1 og ct ∪ ˆct lítil, sem gefur til kynna að upphaflega þátttakendur og grunnlínulíkan okkar gera margar breytingar á flokksvali sínu á milli þátta í röð. Þess vegna er flokkavalsferlið í upphafi mjög stokastískt. Þó að það sé nokkur mismunur á flokksspá þátttakenda og líkansins okkar í fyrstu þáttunum, verður hegðunin sífellt líkari með fleiri sýnum. Í fyrstu (venjulega 4 til 7) þáttunum koma í ljós mjög áberandi hlutar áreitis. Þetta hjálpar til við að velja aðeins réttan flokk í síðari sýnatökunum, sem eykur spánákvæmni. Þar sem það eru margir flokkar með meðalsniðmát sem passa við þá hluta áreitsins sem mælst hefur í fyrstu þáttunum, er flokkavalsferlið verulega stokastískt, sem leiðir til lítillar flokkunarnákvæmni hjá þátttakendum sem og líkaninu okkar.

Figure 3. Distribution of sampling locations over all participants for each numeral/alphabet class and each sampling episode. Each row corresponds to a class, each column corresponds to a sampling episode which increases from left to right.


Mynd 3. Dreifing sýnatökustaða á alla þátttakendur fyrir hvern tölu-/stafrófsflokk og hvern úrtaksþátt. Hver röð samsvarar flokki, hver dálkur samsvarar sýnatökuþætti sem stækkar frá vinstri til hægri.

Staðsetningarspá. Staðsetningarspánákvæmni í grunnlínulíkani okkar (Jöfnuður 3), að meðaltali yfir öll sýnatökur og gagnasöfn, er 67,7% (std. dev. 14.1) (sjá mynd 5d). Tilhneiging þessarar spánákvæmni er andstæð þeirri nákvæmni sem er í flokksspá. Hins vegar er skýringin sú sama. Nákvæmni staðsetningarspár er mikil við fyrstu sýnatökur vegna þess að í þessum þáttum eru mjög áberandi staðirnir valdir, þannig að minna áberandi staðirnir verða valdir í síðari þáttunum. Þar sem það eru margir staðir með lágt áberandi er valferli þeirra mjög stochastískt og því erfitt að spá fyrir um, sem leiðir til lækkunar á nákvæmni spá með aukningu sýnataka. Minnkandi tilhneigingin er einstök fyrir hvert gagnasafn (tilvísun. mynd 5d) þar sem fjöldi flokka og fjöldi mjög áberandi staða sem eru gagnlegar til að mismuna eru mismunandi milli gagnasafna. Því lægri sem flokkar eru og mjög áberandi mismununarstaðir, því hraðar verður minnkun á nákvæmni staðsetningarspár með aukningu á sýnatökum.

imageFigure 4. (Lef) Errorbar plot of time diference (seconds) between consecutive samples averaged over all classes. Tat is, value shown at sampling episode t is the time elapsed between a participant's clicks in image at t − 1 and t. (Right) Errorbar plot of confusion averaged over all classes at each episode. Errorbars indicate std. dev.

Mynd 4. (Til vinstri) Errorbar plot af tímamismun (sekúndur) milli samfelldra sýna að meðaltali yfir alla flokka. Tat er, gildi sýnt í sýnatökuþætti t er tíminn sem líður frá því að þátttakandi smellir á mynd á t − 1 og t. (Hægri) Ruglslóð á villustiku var meðaltal yfir alla flokka í hverjum þætti. Villustikur gefa til kynna std. dev.

Figure 5. Evaluation of our baseline model (ref.

Mynd 5. Mat á grunnlínulíkani okkar (tilvísun "Grunnlína fyrir hegðunarspá" kafla). (a) Flokkunarnákvæmni (samkvæmt) þátttakenda og (b) nákvæmni grunnlínulíkans okkar með raunverulegum merkingum sem grunnsannleika. (c) Flokkunarlíkindi (J(ct, ˆct)), (d) staðsetningarspánákvæmni, (e) flokkshöfnunarnákvæmni og (f) flokksvalsnákvæmni grunnlínulíkans okkar með gögn þátttakenda sem grunnsannleika. Sjá kaflann „Hegðunarspá“ fyrir frekari upplýsingar.

Table 1. Average Pearson correlation coefficient (corr.) for fxation sequences for the same class. For any fixation, distance is Euclidean and direction is measured as the polar angle with respect to the center of stimuli as the origin. Std. dev. are included in parenthesis.


Tafla 1. Meðal Pearson fylgnistuðull (leiðrétting) fyrir festingarraðir fyrir sama flokk. Fyrir hvaða festingu sem er er fjarlægðin evklíðsk og stefna er mæld sem skauthornið með tilliti til miðju áreitis sem uppruna. Std. dev. eru innan sviga.

Mat á vinnsluminni.

Fyrir hvern flokk og sýnatöku eru festingarkortin úr vinnsluminni (við notuðum vinnsluminni útfærslu frá github.com/hehefan/Recurrent-Attention-Model) og söfnuð gögn fyrir sömu áreiti sem sýnd eru í MTurk borin saman. Til að fá sanngjarnan samanburð við þátttakendur, í vinnsluminni festum við raðlengdina við T=12, fyrsta sýnatökustaðinn í myndmiðju, inntaksathugunina í 5×5 plástur með valda staðsetningu sem miðju og breytti verðlaunafallinu með Eq. (1). Uppsöfnuð verðlaun, Rt in Eq. (4,) er skipt út fyrir uppsafnað stig t τ=1 Pτ sem fæst úr jöfnuði. (1). Þar sem þátttakandi getur valið marga flokka í hvaða þætti sem er, fyrir RAM líkanið, í stað þess að spá fyrir um einn flokk út frá hæstu líkum, lítum við á meðallíkur yfir alla flokka sem þröskuld og spáum fyrir um mengið af flokkum ct með líkum sem eru hærri en þröskuldur. Þetta ct er notað til að reikna út stigið með því að nota Eq. (1). Við þessar aðstæður þarf vinnsluminni 3,7, 8,5 og 7,6 sýni til að þekkja MNIST tölustafi, hástafi og lágstafi EMNIST stafróf, sem samsvara 8,9%, 21,0%, 18,7% af flatarmáli myndarinnar. Þannig er vinnsluminni minna skilvirkt í samanburði við þátttakendur okkar (sjá kaflann „Gagnagreining“). Sjá töflu 2. Niðurstöður úr samanburði á festingarkortunum úr vinnsluminni og söfnuðum gögnum eru sýndar í töflu 3. KL er hærra vegna næmni þess fyrir núllgildum. Þetta þýðir að þátttakendur taka sýni úr nokkrum stöðum en ekki af vinnsluminni. Þessar tilraunir er hægt að nota sem grunnlínu til að meta staði sem tekin eru sýni með athyglislíkani.

cistanche-Improve memory2

cistanche kostir - Bættu minni

Umræður

McAT hugmyndafræðin, eins og hún er notuð í þessari grein, hefur ákveðna muna frá þeim sem treysta fyrst og fremst á augnhreyfingar og augnaráð til að rannsaka aðferðafræði hlutargreiningar. Í þeim síðarnefnda vekja áberandi hlutar sviðsins athygli fyrst og síðan koma sjúklegar augnhreyfingar sem beina augnaráðinu að áberandi stöðum27. Gaze er knúið áfram af botn-upp- og topp-niður-merkjum sem, ásamt áberandi upplýsingum, mynda forgangskort sem leiðbeina augnhreyfingum fyrir hlutgreiningu. Þar sem þátttakendur í þessari rannsókn horfðu á kyrrstæður myndir við frjálsar skoðanir og með nægan tíma fyrir hendi (sex mínútur fyrir T=12 sýnatökur), tóku þeir líklega þátt í röð saccadic augnhreyfinga eða sjónrænna rökhugsunar28 til að kanna myndina áður en smellt er á AOI. Þessar augnhreyfingar gætu hafa verið teknar upp í emAT (með því að nota augnspora) en ekki í mcAT. Hins vegar verða þessar augnhreyfingar fyrir áhrifum af hugarflakki. Þó að mcAT sé einnig fyrir áhrifum af hugarfari29, gætu áhrifin minnkað þegar þátttakendur svara eftir sjónræn rökhugsun. Þar sem augnhreyfingar til að bregðast við áreiti eru undir áhrifum af verkefninu30, var augnhreyfingarmynstur þátttakenda líklega undir áhrifum frá úthlutað þriggja þrepa verkefni við hverja sýnatöku (sjá kaflann „Sjónræn verkefni“). Ef augnmæli hefði verið notaður hefði augnhreyfingum þátttakenda til að kanna sýnishornið verið blandað saman við augnhreyfingar til að smella á þá flokka sem þeir velja, sem hefði torveldað túlkun á sjónrænni könnun sýnisins. Að smella á bekkinn/flokkana er nauðsynlegt skref þar sem það sýnir, þó í sjálfu sér, þann flokk/flokka sem spáð er fyrir um í huga þátttakanda. Líklegt er að augnaráðin rétt fyrir og eftir AOI valið - ef til vill einnig studd af festandi augnhreyfingum{10}} hafi stuðlað mest að tölum/stafrófsgreiningu. Reyndar gerum við ráð fyrir því að þátttakendur hafi valið greiningarsvæði myndarinnar til að greina á milli flokka og þau svæði innihalda líklega blöndu af greiningarupplýsingum neðan frá og upp (td sjónræn birtuskil) og ofan frá (talna/stafrófssniðmát). Þetta er í samræmi við niðurstöðu okkar að þátttakendur hafi fljótt (innan 5 sýna að meðaltali) greint á milli áreitisflokka að því er virðist með því að velja greiningarplástra.

Table 2. Comparison of efficiency between our participants and the RAM model in terms of the average number of samples required to recognize a numeral/alphabet. The percentage of the image area observed is included in parentheses.

Tafla 2. Samanburður á skilvirkni milli þátttakenda okkar og RAM líkansins hvað varðar meðalfjölda sýna sem þarf til að þekkja tölu/stafróf. Hlutfall myndflatar sem sést er innan sviga.

Table 3. Evaluation of fixation maps from RAM for the stimuli presented in the MTurk experiments averaged over all classes and samplings. Std. dev. are included in parenthesis.


Tafla 3. Mat á festingarkortum úr vinnsluminni fyrir áreiti sem kynnt voru í MTurk tilraununum að meðaltali yfir alla flokka og sýnatökur. Std. dev. eru innan sviga.

Ályktanir

Við kynntum mcAT gagnasafn til að bera kennsl á handskrifaðar tölur og stafróf með raðsýni. Gögnunum er safnað frá 382 þátttakendum sem sýndir voru myndir valdar úr viðmiðunargagnasöfnum (MNIST, EMNIST). Að meðaltali eru skráð 169,1 svör í hverjum flokki með tölu/stafróf. Gögnin eru vandlega greind til að sýna fram á skilvirkni sjóngreiningar mannsins. Þátttakendur sáu aðeins 12,8% af mynd til viðurkenningar. Við lögðum til grunnlíkan til að spá fyrir um staðsetningu og flokk(a) sem þátttakandi myndi velja við næstu sýnatöku. Við sýndum hvernig hægt er að nota tilraunaaðstæður okkar og gögn til að meta athyglisbundið styrkingarlíkan í samanburði við frammistöðu manna. Þetta mcAT gagnasafn, með margvíslegum ávinningi yfir augnrakningargögnum, fyllir afgerandi skarð í athyglisbundnum líkanarannsóknum á gervigreind, ML og öðrum sviðum.

Heimildir

1. Ranzato, MA Um að læra hvar á að leita. arXiv:1405.5488, (2014).

2. Ba, J., Salakhutdinov, RR, Grosse, RB, & Frey, BJ Að læra vakandi-svefn endurteknar athyglislíkön. Í NIPS, 2593–2601 (2015).

3. Mnih, V. o.fl. Endurtekin líkön af sjónrænni athygli. Í NIPS, 2204–2212 (2014).

4. Ba, J., Mnih, V., & Kavukcuoglu, K. Margfeldisgreining með sjónræna athygli. arXiv:1412.7755 (2014).

5. Dutta, JK & Banerjee, B. Breytileiki í flokkunarnákvæmni með fjölda innsýna. Í IJCNN, 447–453 (IEEE, 2017).

6. Larochelle, H. & Hinton, GE Að læra að sameina foveal blik með þriðju röð Boltzmann vél. Í NIPS, 1243–1251 (2010).

7. Elsayed, G., Kornblith, S. & Le, QV Saccader: Að bæta nákvæmni harðra athyglislíkana fyrir sjón. Í NIPS, 702–714 (2019).

8. van Beers, RJ Te uppsprettur breytileika í saccadic augnhreyfingum. J. Neurosci. 27(33), 8757–8770 (2007).

9. Itti, L. & Baldi, P. Bayesian óvart vekur athygli manna. Vis. Res. 49(10), 1295–1306 (2009).

10. Egner, S. o.fl. Athygli og upplýsingaöflun: Samanburður á músarsmelli og athyglismælingu augnhreyfinga. J. Eye Mov. Res. 11(6), (2018).

11. Peterson, MS, Kramer, AF & Irwin, DE Dular athyglisbreytingar eru á undan ósjálfráðum augnhreyfingum. Skynjun. Sálfræði. 66(3), 398–405 (2004).

12. Jiang, M. o.fl. Kísill: Áberandi í samhengi. Í CVPR, 1072–1080 (2015).

13. Kim, NW o.fl. BubbleView: Viðmót til að safna mikilvægi myndkorta og fylgjast með sjónrænni athygli. ACM Trans. Reikni. Humm. Samskipti. 24(5), 1–40 (2017).

14. Sermanet, P., Frome, A. & Real, E. Athygli fyrir fínkorna flokkun. arXiv:1412.7054 (2014).

15. Egner, S., Itti, L. & Scheier, C. Samanburður á athyglislíkönum við mismunandi tegundir hegðunargagna. Rannsaka. Oftalmól. Vis. Sci. 41(4), S39 (2000).

16. Navalpakkam, V. o.fl. Mæling og líkan á hegðun augnmúsar í viðurvist ólínulegra síðuuppsetninga. Í Proc. Alþj. Conf. WWW, 953–964 (2013).

17. Matzen, LE, Stites, MC & Gastelum, ZN Að læra sjónræna leit án augnspors: Mat á tilbúnum foveation. Cogn. Res. Prins. Óvíst. 6(1), 1–22 (2021).

18. Tafi, AP o.fl. OCR sem þjónusta: Tilraunamat á Google Docs OCR, Tesseract, ABBYY FineReader og Transym. Í Int. Symp. Vis. Comput., 735–746 (Springer, 2016).

19. Memon, J., Sami, M., Khan, RA & Uddin, M. Handskrifuð optical character recognition (OCR): A comprehensive systematic literature review (SLR). IEEE Access 8, 142642–142668 (2020).

20. Chaudhuri, A., Mandaviya, K., Badelia, P. & Ghosh, SK Optísk persónugreiningarkerfi. Í Optical Character Recognition Systems for Different Languages ​​with Sof Computing, 9–41 (Springer, 2017).

21. LeCun, Y. o.fl. Stigmiðað nám notað við skjalaviðurkenningu. Frv. IEEE 86(11), 2278–2324 (1998).

22. Cohen, G., Afshar, S., Tapson, J. & van Schaik, A. EMNIST: Framlenging á MNIST til handskrifaðra bréfa. arXiv:1702.05373, (2017).

23. Gregor, K., Danihelka, I., Graves, A., Rezende, D. & Wierstra, D. DRAW: Endurtekið tauganet til að mynda mynd. Í ICML, 1462–1471 (2015).

24. Friston, K. Te frjáls-orku meginreglan: A gróft leiðarvísir til heilans?. Trends Cogn. Sci. 13(7), 293–301 (2009).

25. Mirza, MB, Adams, RA, Friston, K. & Parr, T. Kynna Bayesian líkan af sértækri athygli byggt á virkri ályktun. Sci. 9(1), 1–22 (2019).

26. Bylinskii, Z., Judd, T., Oliva, A., Torralba, A. & Durand, F. Hvað segja mismunandi matsmælikvarðar okkur um áberandi líkön? IEEE Trans. Mynstur Anal. Mach. Intell. 41(3), 740–757 (2018).

27. Itti, L. & Koch, C. Reiknilíkön af sjónrænni athygli. Nat. Séra Neurosci. 2(3), 194–203 (2001).

28. Lamme, VAF Sjónræn aðgerðir sem skapa meðvitaða sjón. Framan. Psychol., 11, (2020).

29. da Silva, MRD & Postma, M. Wandering minds, wandering mýs: Tölvumúsarelting sem aðferð til að greina hugarflakk. Reikni. Humm. Hegðu þig. 112, 106453 (2020).

30. Schütz, AC, Braun, DI & Gegenfurtner, KR Augnhreyfingar og skynjun: sértæk umfjöllun. J. Vis. 11(5), 9–9 (2011).

31. Intoy, J. & Rucci, M. Fínstilltar augnhreyfingar auka sjónskerpu. Nat. Commun. 11(1), 1–11 (2020).

Þér gæti einnig líkað