Flokkunarspá um brjóstakrabbamein byggt á vélanámi

Sep 12, 2023

Brjóstakrabbamein er algengasta og banvænasta tegund krabbameins í heiminum. Byggt á vélrænum reikniritum eins og XGBoost, random forest, logistic regression og K-nearest nágranni, setur þessi grein mismunandi líkön til að flokka og spá fyrir um brjóstakrabbamein, til að veita viðmiðun fyrir snemmtæka greiningu brjóstakrabbameins. Innköllun gefur til kynna líkurnar á því að greina krabbameinsfrumur við læknisfræðilega greiningu, sem hefur mikla þýðingu fyrir flokkun brjóstakrabbameins, þannig að þessi grein tekur muna sem aðal matsvísitölu og íhugar nákvæmni, nákvæmni og F1-einkunn vísbendingar til að meta og bera saman spááhrif hvers líkans. Til að eyða áhrifum mismunandi víddarhugtaka á áhrif líkansins eru gögnin stöðluð.

K næsta nágrannaalgrímið er eitt af grunnalgrímunum á sviði vélanáms. Meginhugmynd þess er að finna K sýnin næst marksýninu og spá síðan fyrir um merki marksýnisins út frá merkingum þessara K sýna. Í daglegu lífi manna notum við oft svipaðar aðferðir til að taka ákvarðanir. Til dæmis, þegar við stöndum frammi fyrir ákveðnu vandamáli, rifjum við upp svipaðar aðstæður sem við höfum lent í áður, leitum síðan að aðstæðum sem eru líkastar og tökum ákvarðanir út frá niðurstöðum þeirra. Þróa lausnir. Þess vegna er K næsta nágranna reikniritið nátengt mannsminni.

Í fyrsta lagi þarf K næsta nágranna reikniritið mikinn fjölda þjálfunarsetta til að læra og koma á gagnaskipulagi fyrir næsta nágrannagraf. Eins þurfa menn stöðugt að upplifa ýmislegt og geyma þessa upplifun í minni. Aðeins með því að safna mikilli reynslu og þekkingu getum við tekið ákvarðanir og dóma nákvæmari.

Í öðru lagi leggur K næsta nágrannaalgrímið áherslu á áhrif líkt á spá. Á sama hátt, þegar menn taka ákvarðanir, íhuga menn oft fyrri reynslu og reyna að finna reynslu svipaða núverandi ástandi til viðmiðunar. Þetta ferli við að finna líkindi er einnig eitt af mikilvægum einkennum minnis.

Að lokum, í K næsta nágrannaalgríminu, hefur gildi K mikil áhrif á spániðurstöðurnar. Mismunandi K gildi munu leiða til mismunandi spániðurstaðna. Á sama hátt, þegar menn rifja upp fyrri reynslu, þurfa þeir að velja mismunandi viðmiðunarpunkta og aðferðir eftir núverandi aðstæðum. Þessi sveigjanleiki og aðlögunarhæfni er einnig mikilvægur eiginleiki minni. Það má sjá að við þurfum að bæta minni okkar. Cistanche deserticola getur bætt minnið verulega vegna þess að Cistanche deserticola er hefðbundið kínverskt lækningaefni með mörg einstök áhrif, ein þeirra er að bæta minni. Virkni hakkaðs kjöts kemur frá hinum ýmsu virku innihaldsefnum sem það inniheldur, þar á meðal sýru, fjölsykrur, flavonoids o.fl. Þessi innihaldsefni geta stuðlað að heilsu heilans á ýmsan hátt.

increase memory power

Smelltu á Vita til að bæta skammtímaminni

Til að finna ákjósanlega hlutmengi og bæta nákvæmni líkansins voru 15 eiginleikar skimaðir út sem inntak í líkanið í gegnum Pearson fylgniprófið. K-næstu nágrannalíkanið notar krossprófunaraðferðina til að velja ákjósanlegasta k gildið með því að nota innköllun sem matsvísitölu. Fyrir vandamálið með jákvætt og neikvætt úrtaksójafnvægi er stigveldisúrtaksaðferðin notuð til að draga út þjálfunarsettið og prófunarsettið hlutfallslega í samræmi við mismunandi flokka. Tilraunaniðurstöðurnar sýna að við mismunandi gagnapakkaskiptingu (8: 2 og 7 : 3) munu spááhrif sama líkans hafa mismunandi breytingar. Samanburðargreining sýnir að XGBoost líkanið sem sett er fram í þessari grein (sem deilir þjálfunarsettinu og prófunarsettinu með 8: 2) hefur betri áhrif og innkalla, nákvæmni, nákvæmni og F1-stig eru 1.{{ 11}}, 0.960, 0.974 og 0.980, í sömu röð.

1. Inngangur

Undanfarin tíu ár hefur tíðni brjóstakrabbameins í Kína aukist um 47% og tíðni eykst ár frá ári og tíðni brjóstakrabbameins er smám saman yngri [1]. Meingerð brjóstakrabbameins tengist persónulegum hormónum, fjölskyldusögu, hjónabandi og barneignasögu [2]. Brjóstakrabbamein er ekki auðvelt að greina á fyrstu stigum og hefur einkenni þess að það kemur fram snemma en kemur fram seint [3, 4]. Á þessari stundu byggist aðalgreining brjóstakrabbameins á þremur aðferðum: frumugreiningu á stungum [5], ómskoðun [6] og brjóstamyndatöku [7]. Ef sjúklingur greinist snemma í brjóstakrabbameini, því meiri líkur eru á lækningu og því betri horfur. Þess vegna er regluleg skoðun og snemmgreining mjög nauðsynleg til að koma í veg fyrir og greina tímanlega brjóstakrabbamein.

Á læknisfræðilegu sviði getur stofnun líkana með vélanámsaðferðum aðstoðað lækna við að bæta greiningartíðni krabbameins, til að ná tilgangi snemmtækrar uppgötvunar og snemma meðferðar. Vélanámsaðferðir hafa skilað góðum árangri við greiningu krabbameins [8, 9]. Wu o.fl. [10] fylgdist með formgerð frumna í smásjá og komst að því að augljós munur var á brjóstakrabbameinsfrumum og eðlilegum heilbrigðum frumum. Þessi niðurstaða gefur fræðilegan grunn fyrir margar rannsóknir. Þó að það séu margar vélanámsaðferðir sem nú eru notaðar við flokkun brjóstakrabbameinsfrumna, er ekki hægt að beita einu reikniriti á öll vandamál. Hver tegund af vélrænni reiknirit hefur sín sérfræðisvið, þannig að val á reiknirit er mismunandi í mismunandi atburðarásum.

Shen o.fl. [11] notaði XGBoost líkanið til að flokka og spá fyrir um brjóstakrabbamein og náði nákvæmnin 97.86% og innköllunin 95.83%. Deng o.fl. [12] notaði XGBoost reikniritið til að flokka og spá fyrir um brjóstakrabbamein með nákvæmninni 0.96 og innköllun upp á 0.97. Monirujjaman Khan o.fl. [13] notaði mörg vélanámslíkön til að bera kennsl á brjóstakrabbamein, og tilviljunarkenndur skógur, ákvörðunartré, K-næsta nágranni og skipulagsfræðileg aðhvarf voru reiknirit með hærra F1-stig, 96%, 95%, 90%, og 98%, í sömu röð. Bhardwaj o.fl. [14] notaði fjöllaga skynjara (MLP), K-nearest neighbour (KNN), erfðafræðilegt reiknirit (GP) og random forest (RF) til að flokka góðkynja og illkynja brjóstakrabbameinsfrumur og tilraunaniðurstöður sýndu að ákjósanlegur flokkari var RF með flokkunarnákvæmni upp á 96,24%. Dong og Ma [15] rannsökuðu möguleg merki um þrefalt neikvætt brjóstakrabbamein og reiknirit fyrir vélanám voru notuð til að spá fyrir um hvort fólk væri með þrefalt neikvætt brjóstakrabbamein. Niðurstöðurnar sýna að nákvæmni flokkunarspálíkans stuðningsvigruvéla (SVM) nær 97,8%.

Til að bæta nákvæmni aðferða til að bera kennsl á brjóstakrabbamein og bæta vélrænni reiknirit, Wang o.fl. [16] lagði til vegið AUC ensemble námslíkan byggt á SVM fyrir greiningu á brjóstakrabbameini, með því að nota C-SVM og V-SVM með 6 kjarnaaðgerðum til að auka fjölbreytileika grunnlíkanasettsins og bera saman mismunandi niðurstöður ákvarðana við svæðissamþættingu (WAUCE) ) líkan undir vegnu móttökueinkennaferli. Niðurstöðurnar sýna að á litla gagnasafninu dregur fyrirhuguð WAUCE uppbygging úr dreifni greiningarnákvæmni um allt að 69,23% og bætir nákvæmni um 0,94%. Zheng o.fl. [17] prófaði Wisconsin Breast Cancer (WDBC) gagnasafnið í samræmi við K-means and support vector machine blending algrím dregur út æxliseiginleika og greinir brjóstakrabbamein, og niðurstöðurnar sýna að blendingalgrímið bætir nákvæmni í 97,38%. Jia o.fl. [18] lagði til nýtt stofnhagræðingaralgrím, Whale Optimization Algorithm (WOA), sem aðlagar færibreytur SVM líkansins á skynsamlegan hátt, og tilraunaniðurstöður sýna að árangur WOA-SVM líkansins er verulega betri en hefðbundins brjóstakrabbameinsþekkingarlíkan, með 97,5% nákvæmni.

Til að leysa vandamálið við offita vélnámstækni í flokkun brjóstakrabbameins, Singh o.fl. [19] lagði til virkt tengt gervi taugakerfi (FLANN) og komst að tilraunum að líkanið hefur mikla nákvæmni fyrir snemmgreiningu á brjóstakrabbameini. Mahesh o.fl. [20] leggja til brjóstakrabbameinsspá XGBoost ensemble tækni sem byggir á þekktum eiginleikum mynstur, fyrst með tilbúnum minnihluta yfirsýnatækni (SMOTE) til að takast á við gagnaójafnvægi og hávaðavandamál og síðan með Bayes flokkaranum, ákvarðanatré flokkunar, og tilviljunarkenndur skógur, í sömu röð. , ásamt XGBoost og flokkun gagna. Samkvæmt tilraunagreiningu hefur XGBoost-Random Forest ensemble flokkarinn nákvæmni upp á 98,20% við snemma uppgötvun brjóstakrabbameins.

Byggt á XGBoost, tilviljunarkenndum skógi, flutningsaðhvarfi, K-næstasta nágranni og öðrum vélanámsaðferðum, setur þessi ritgerð mismunandi líkön til að flokka og spá fyrir um brjóstakrabbamein, sem veitir viðmiðun fyrir snemmtæka greiningu brjóstakrabbameins. Þegar flestar rannsóknir nota vélanámslíkön við greiningu á brjóstakrabbameinsfrumum, leggja þær áherslu á að nota nákvæmni, nákvæmni og F1-stig líkansins sem vísbendingar til að meta gæði líkansins, en hunsa læknisfræðilega greiningarþýðingu innköllun líkansins, sem gefur til kynna hlutfall illkynja brjóstakrabbameinsfrumna sem spáð er fyrir um, og því meiri innköllun, því meiri líkur eru á því að spáð sé fyrir um illkynja frumur í brjóstakrabbameinsfrumum. Þess vegna tekur þessi grein innköllun sem aðalvísitölu og tekur til skoðunar nákvæmni, nákvæmni og F1-stig til að meta líkanið sem notað er.

Í líkanaferlinu er forvinnsla gagna mjög mikilvægur þáttur og áhrif forspárlíkans eru mismunandi eftir vinnsluaðferðum. Til að eyða áhrifum mismunandi víddarhugtaka á áhrif líkansins eru gögnin stöðluð. Til að finna ákjósanlega hlutmengi og bæta nákvæmni líkansins var val á eiginleikum samkvæmt Pearson fylgnistuðli milli eiginleikabreytunnar og markbreytunnar. Fyrir vandamálið með jákvætt og neikvætt úrtaksójafnvægi er stigveldisúrtaksaðferðin notuð til að draga út þjálfunarsettið og prófunarsettið hlutfallslega í samræmi við mismunandi flokka. Með hliðsjón af því að spááhrif vélanámslíkana eru mismunandi eftir mismunandi gagnapakkadeildum, mun þessi grein nota mismunandi gagnapakkaskiptingu (8: 2 og 7: 3) sem tvö sett af tilraunum til að fylgjast með spááhrifum líkansins sem sett er fram í þessari grein.

2. Forvinnsla gagna

2.1. Gagnakynning. Gagnasafnið sem notað er í þessari grein eru brjóstakrabbameinsgögnin í UCI gagnasettinu, sem var veitt af fræga Dr. William frá Klínískri læknisfræðirannsóknarstofnun háskólans í Wisconsin [21]. Eiginleikar eru reiknaðir út frá stafrænni mynd af fínnálarsog (FNA) af brjóstmassa. Þeir lýsa eiginleikum frumukjarnanna sem eru á myndinni. Gagnasettið innihélt 569 tilraunasýni, þar á meðal 357 góðkynja sýni og 212 illkynja sýni af brjóstakrabbameini. Fyrir frumurnar sem teknar eru úr hverjum tilraunahlut er eftirfarandi tíu einkennum kjarna hans aðallega safnað: radíus (meðaltal fjarlægðar frá miðju að punktum á jaðri), jaðar, sléttleiki (staðbundin breytileiki í lengd radíus), flatarmál, þéttleiki ( jaðar ∗ ∗ 2/svæði-1.0), íhvolf (alvarleiki íhvolfa hluta útlínunnar), samhverfa, áferð (staðalfrávik grákvarðagilda), íhvolfur punktar (fjöldi íhvolfa hluta útlínunnar), og brota_vídd („strandlínuáætlun“-1). Meðaltal, staðalvilla og „versta“ eða stærsta (meðaltal af þremur stærstu gildunum) þessara eiginleika voru reiknuð út fyrir hverja mynd, sem leiddi til 30 eiginleika. Flokkunarmerkið táknar tegund brjóstakrabbameins. Þess vegna inniheldur sýnishornið samtals 30 eiginleika og einn sýnismerkjaeiginleika (illkynja og góðkynja).

2.2. Gagnastöðlun.

Með því að fylgjast með gildissviði hvers eiginleika kemur í ljós að gagnagildi mismunandi eiginleika eru mjög mismunandi. Í sumum gerðum hafa mismunandi stærðir mikil áhrif á spááhrifin. Til dæmis þarf k-næsta nágrannareikniritið sem byggir á fjarlægðarskiptingu að halda gagnavíddinni í samræmi, þannig að gögnin þurfa að vera staðlað fyrir líkangerð. Hins vegar hafa sum líkön minna áhrif á vídd, eins og tilviljunarkennda skógaralgrímið. Til að gera tilraunina samanburðarhæfa eru gögn mismunandi líkana meðhöndluð á sama hátt.

Fyrir vandamál með mismunandi sýnishornsgagnavíddir, innihalda algengu víddarlausu vinnsluaðferðirnar gagnastöðlun og gagnastöðlunaraðferðir innihalda Min-max stöðlun og Z-stiga stöðlun. Meðal þeirra, þegar gögnin sem notuð eru hafa útlínur utan gildissviðsins, eða hámarks- og lágmarksgildi sumra vísbendinga eru óþekkt, er hægt að nota Z-stiga stöðlunina.

increase memory

Í þessari grein, í samræmi við eiginleika WDBC brjóstakrabbameinsgagnagrunnsins, var Z-stiga stöðlun valin til að vinna úr gögnunum. Gögnin sem unnið er með Zscore stöðluninni [22] fylgja staðlaðri normaldreifingu, það er að segja meðaltalið er 0 og dreifingin er 1. Formúlan fyrir Z-stiga stöðlun er sem hér segir:

improve memory

2.3. Eiginleikaval. Sem mikilvægur hluti af forvinnsluferli gagna er val á eiginleikum að finna ákjósanlegasta undirmengið, Eiginleikaval getur dregið úr óþarfa og gagnslausum eiginleikum til að bæta nákvæmni líkansins. Eiginleikavalsaðferðinni er almennt skipt í ofhugsunaraðferð, hjúpunaraðferð og innfellingaraðferð. Síuaðferðin getur verið óháð reikniritinu sem notað er síðar í rannsókninni og hefur mikla reikniskilvirkni og sterka alhæfingargetu [23], þannig að eiginleikavalsaðferðin í þessari grein notar síuaðferðina og almenna aðferðasamantektin í síunaraðferðinni er sýnt í töflu 2.

Brjóstakrabbameinsgögnin eftir 0 meðalstöðlun uppfylla kröfur Pearson fylgnistuðullsprófsins í síunaraðferðinni; þannig að í þessari grein er fylgnistuðull Pearsons [24] notaður til að prófa fylgni á milli hvers eiginleika og markbreytunnar. Formúla Pearsons fylgnistuðuls er sem hér segir:

boost memory


3. Módelbygging
Í þessari grein er spáð fyrir um flokka brjóstakrabbameins byggt á XGBoost, tilviljunarkenndum skógi, logistic regression og K-nearest Neighbor líkani, í sömu röð. Litið er á illkynja brjóstakrabbamein sem jákvætt sýni en góðkynja brjóstakrabbamein er talið neikvætt sýni

Til að leysa vandamálið með ójafnvægi sýna notar þessi grein lagskipt sýnatökuaðferð [25] til að draga út þjálfunarsettið og prófunarsettið í hlutfalli við alls kyns úrtaksgögn. Lagskipt sýnataka er einnig kölluð tegundasýnataka. Úrtaksþýðinu er skipt í undirhópa sem eru óháðir hver öðrum. Slembiúrtak var gert í hlutfalli við hvern undirhóp. Lagskipt sýnataka dregur dæmigerðara úrtak og hentar betur fyrir ójafnvægi.

Mismunandi skipting gagnasetts getur leitt til mismunandi líkanaáhrifa. Þess vegna framkvæmir þetta ritgerð tvo hópa tilrauna í samræmi við mismunandi skiptingu úrtaksgagnasafnsins. Fyrsti hópurinn skipti gagnasettinu í þjálfunarsett og prófunarsett í hlutfallinu 8: 2 og seinni hópurinn skipti gagnasettinu í þjálfunarsett og prófunarsett í hlutfallinu 7 : 3. Fylgstu með frammistöðu líkansins af reikniritin fjögur undir mismunandi skiptingu gagnasafna.

3.1. Matsvísar. Í þessari rannsókn var nákvæmni, nákvæmni, innköllun og F1-stig [26, 27] notuð til að meta spááhrif líkansins. Með hliðsjón af sérstöðu læknisfræðilegrar greiningar er búist við að hægt sé að spá fyrir um allt illkynja brjóstakrabbamein. Þess vegna er innköllun hér tekin sem mikilvægur matsvísir. Því hærri sem innköllunin er, því hærra er hlutfall illkynja brjóstakrabbameins sem hægt er að spá fyrir um. Niðurstöður líkanflokkunar geta myndað ruglingsfylki [28], eins og sýnt er í töflu 4

Hér er TP sannur jákvætt, sem gefur til kynna fjölda jákvæðra sýna sem spáð er sem jákvæðum sýnum. TN er raunverulegt neikvætt, sem gefur til kynna fjölda neikvæðra sýna sem spáð er sem neikvæðum sýnum. FP er falskt jákvætt, sem gefur til kynna fjölda jákvæðra sýna sem spáð er fyrir frá neikvæðum sýnum, sem er kölluð tegund 1 villa. FN er rangt neikvætt, sem gefur til kynna fjölda jákvæðra sýna sem spáð er sem neikvæðum sýnum, sem er kölluð tegund 2 villa

Nákvæmni, skammstafað sem P. Fyrir áætlaðar niðurstöður táknar nákvæmni hversu mörg af jákvæðu spáðu sýnunum eru jákvæð sýni og formúlan er:

10 ways to improve memory

short term memory how to improve

3.2. Spálíkan um brjóstakrabbamein byggt á XGBoost. XGBoost, stutt fyrir Extreme Gradient Boosting, er Boosting algrím [29]. Bæði XGBoost og tilviljunarkenndur skógur eru samþættingaralgrím byggð á ákvörðunartrénu. Ólíkt Bagging reikniritinu, byggir uppörvun reikniritið upp veika nemendur einn í einu og safnar mörgum veikum nemendum með stöðugri endurtekningu [30]. Hið hlutlæga hlutverk er

ways to improve memory

. (9) Viðbót á reglulegum skilmálum getur dregið úr dreifni líkansins og gert líkanið sem þjálfunarsettið fæst einfaldara til að koma í veg fyrir að framhjáhlaup komi fyrir.. XGBoost reikniritið er notað til að þjálfa líkanið á þjálfunargagnasettinu. Í ferli líkanaþjálfunar eru færibreyturnar aðlagaðar til að fá betri færibreytur og að lokum fæst ákjósanlegasta spálíkanið. Líkanið var notað til að spá fyrir um brjóstakrabbameinsflokka í

stilling. Þegar gagnasettinu var skipt í þjálfunarsett og prófunarsett með 8:2, var nákvæmni, nákvæmni, innköllun og F1-stig XGBoost líkansins 0.974, {{5} }.960, 1.00 og 0.980, í sömu röð. Þegar XGBoost líkaninu var skipt í þjálfunarsett og prófunarsett með 7 : 3, var nákvæmni, nákvæmni, innköllun og F1-stig XGBoost líkansins 0.959, {{20} }.946, 0.991 og 0.968, í sömu röð. Niðurstöðurnar sýna að XGBoost líkanið hefur betri spáframmistöðu þegar gagnasettinu er deilt með 8: 2. Innköllunarhlutfallið 1 gefur til kynna að XGBoost líkanið hafi rétt spáð fyrir um öll illkynja brjóstakrabbamein í úrtakinu, sem er mjög mikilvægt fyrir læknisfræðilega greiningu

ósa. 3.3. Spálíkan um brjóstakrabbamein byggt á Random Forest. Random forest er eftirlitsnámsreiknirit sem samþættir mörg tré í gegnum Bagging hugmyndina [31–33]. Bootstrap aðferðin er notuð til að draga þjálfunarúrtakið úr upprunalegu úrtaksgögnunum og samsvarandi ákvörðunartré líkan er þjálfað fyrir hvert þjálfunarsett. Að lokum er kosið um alla grunnflokkara og sá sem fær flest atkvæði er lokaflokkurinn.

ways to improve brain function

geggjað. Þegar gagnasettinu var skipt í þjálfunarsett og prófunarsett með 8: 2, var nákvæmni, nákvæmni, innköllun og F1-einkunn fyrir handahófskennda skógarlíkanið 0.965, {{5 }}.947, 1.00 og 0.973, í sömu röð. Þegar gagnasettinu var skipt í þjálfunarsett og prófunarsett með 7 : 3 voru nákvæmni, nákvæmni, innköllun og F1- stig 0.953, 0.946, { {18}}.981 og 0.963, í sömu röð. Niðurstöðurnar sýna að tilviljanakennda skógarlíkanið hefur betri spáframmistöðu þegar gagnasettinu er deilt með 8: 2. Innköllunarhlutfall þessa líkans var einnig 1, sem gefur til kynna að tilviljanakennda skógarlíkanið spáði einnig rétt fyrir um öll illkynja brjóst.

memory enhancement

en l. Þrír grunnþættir k-næstu nágranna reikniritsins eru fjarlægðarmæling, k-gildisval, flokkunarákvörðun.Þrír grunnþættir k næstu nágrannaalgrímsins eru fjarlægðarmæling, k gildisval og flokkunarákvörðunarregla.

Fyrir vandamálið við val á K gildi í k næsta nágranna reikniritinu, notar þessi grein tífalda krossstaðfestingaraðferð (38, 39) og tekur innköllunarhlutfallið sem líkanmatsvísitölu til að velja viðeigandi k gildi. Látið gildissvið k vera 1–40 og fyrir hvern k er víxlgildingin tífalt. K gildið með hámarks innköllunarhraða er besta k gildið. Innköllun á mismunandi k gildum undir krossstaðfestingu á tífalt er sýnd á mynd 1.

Það má sjá á mynd 1 að eftir því sem k gildi hækkar minnkar innköllunin. Þegar k � 3 og k � 5 er innköllunin stærst. Vegna þess að k gildið er of lítið stillt er auðvelt að offita það, svo k gildið er stillt sem 5 hér.

Þegar gagnasettinu var skipt í þjálfunarsett og prófunarsett með 8: 2, var nákvæmni, nákvæmni, innköllun og F1-stig k-næstasta Neighbour líkansins 0.912, { {6}}.888, 0.986 og {{10}}.934, í sömu röð. Þegar gagnasettinu var skipt í þjálfunarsett og prófunarsett með 7 : 3 voru nákvæmni, nákvæmni, innköllun og F1-stig 0.930, {{21} }.906, 0.991 og 0.946, í sömu röð. Niðurstöðurnar sýna að k-næstasta nágrannalíkanið hefur betri spáframmistöðu þegar gagnasettinu er deilt með 7 : 3.

4. Samanburður og greining

Til að skilja betur frammistöðu líkansins sem sett er fram í þessari grein er þessi grein byggð á Python 3.9.7 þróunarumhverfinu og notar brjóstakrabbameinsgögn sem Dr. William frá University of Wisconsin Clinical Medical Research Institute gefur fyrir tilraunir.

Tilraunaumhverfið er Windows 11 stýrikerfið, örgjörvinn er Intel(R) Core(TM) i5-1155G7@ 2,50 GHz 2,50 GHz og minnið er 8,00 GB.

Tilraunafæribreytur hvers líkans eru sýndar í töflu 5 og eftirfarandi þrjár samanburðargreiningarniðurstöður verða gerðar: (1) árangurssamanburður hvers líkans í þessari grein þegar gagnasettinu er skipt í þjálfunarsett og prófunarsett í 8. : 2. (2) Samanburður á frammistöðu hvers líkans í þessari grein þegar gagnasettinu er skipt í þjálfunarsett og prófunarsett í 7 : 3. (3) Samanburður við sum líkön í bókmenntum [11–14].

(1) Þegar gagnasettinu er skipt í þjálfunarsett og prófunarsett með 8: 2, er frammistaða hvers líkans sýnd í töflu 6.

Eins og sjá má af töflu 4, þegar þjálfunarsetti og prófunarsetti er skipt í hlutfallinu 8: 2, er nákvæmni vélanámsaðferðanna fjögurra yfir 0.9, þar á meðal eru XGBoost og RF yfir { {5}}.95. Spánákvæmni XGBoost er 0.974, sem gefur til kynna mikla spánákvæmni. Fyrir nákvæmni er nákvæmni KNN líkansins ekki mikil, undir 0.9, aðeins 0.888. XGBoost hefur mestu nákvæmni, sem er 0.960. Hvað innköllunina varðar, þá er innköllun XGBoost, random forest og logistic regression algríms allt 1. K-næstu nágranna reikniritið hefur lægstu innköllunina, en það er líka yfir 0.95. Fyrir þessa rannsókn táknar munahlutfall hlutfall illkynja brjóstakrabbameinssýna sem voru rétt greind. Í læknisfræði þarf að greina sjúkdóm. Afleiðingin af því að fá ekki greiningu er seinkuð meðferð, sem getur leitt til þess að sjúklingar missi af besta tímanum fyrir meðferð. Þetta er miklu alvarlegra en að greinast með sjúkdóm án þess að vera með hann. Þess vegna er innköllunarhlutfallið mjög mikilvægur mælikvarði á sviði sjúkdómsgreiningar. Hér er innköllun á XGBoost, random forest og logistic regression algorithm allt 1, sem gefur til kynna að öll illkynja brjóstakrabbamein í sýnunum hafi verið greind. Fyrir F{{20}}stigið má sjá að F1-stigið fyrir XGBoost, random forest og logistic regression eru öll yfir 0.95. F1-stig XGBoost reikniritsins er hæst og nær 0.980. K-næsta nágrannalíkanið hefur lægstu F1-einkunnina 0,934. Að teknu tilliti til vísanna fjögurra má segja að þegar gagnasettinu er skipt í þjálfunarsett og prófunarsett með 8: 2, þá eru heildar líkanáhrif XGBoost reikniritsins betri en hinar þrjár gerðirnar. XGBoost náði ekki aðeins innköllun upp á 1 heldur náði einnig innköllun upp á 0,95 eða meira fyrir hinar þrjár mælikvarðar.

(2) Þegar gagnasettinu er skipt í þjálfunarsett og prófunarsett í 7 : 3 er frammistaða hvers líkans sýnd í töflu 7.

Eins og sjá má af töflu 7, þegar þjálfunarsettinu og prófunarsettinu er deilt með 7 : 3, eru líkanáhrif XGBoost og RF ekki eins góð og 8: 2. Í fyrsta lagi hvað varðar mikilvæga vísitöluna muna, þegar deilt var í gagnasettið með 8: 2, var innköllun XGBoost og RF bæði 1, en nú hefur þeim fækkað í 0.991 og {{10}}.981, í sömu röð . Líkönin tvö hafa einnig lækkað lítillega í hinum þremur vísitölunum. Hins vegar er breytingin á spááhrifum logistic regression og K-næstu nágrannalíkansins ólík þessum tveimur reikniritum. Fyrir logistic aðhvarfslíkanið breyttust vísarnir fjórir varla þegar þjálfunarsettinu og prófunarsettinu var deilt með 7 : 3 og 8: 2, í sömu röð. Þetta sýnir að aðhvarfslíkanið er nánast ekki fyrir áhrifum af mismunandi skiptingum gagnasetta. Þegar um var að ræða skiptingu á 7 : 3 á milli þjálfunarsettsins og prófunarsettsins, sýndi logistic regression lægri nákvæmni, nákvæmni og F1- stig en XGBoost og random forest. Hins vegar er innköllun á logistic regression líkaninu 1, sem gefur til kynna að búið sé að spá fyrir um allt illkynja brjóstakrabbamein, sem hefur mikla þýðingu fyrir greiningu sjúkdómsins. Því má segja að spááhrif logistic regression líkansins séu betri en hinir þrír algrímin. Fyrir KNN líkanið, þegar þjálfunarsettinu og prófunarsettinu var deilt með 7 : 3, hækkuðu allar fjórar vísitölurnar. Munurinn jókst í 0.991, sem var hærra en í tilviljanakennda skóginum. Nákvæmni, nákvæmni og F1-stig hækkuðu úr 0.912, {{30}}.887 og 0.934 í 0 0,930, 0,906 og 0,946, í sömu röð. Því skilar KNN líkanið betur þegar um er að ræða þjálfunarsett og prófunarsett deilt með 7 : 3 en líkanið deilt með 8: 2. Greiningin sýnir að skipting gagnasafna er ekki föst. Fyrir mismunandi líkön hafa mismunandi skiptingar mismunandi breytingar á líkanaspááhrifum.
(3) Samkvæmt samanburðargreiningu á töflum 6 og 7 hefur XGBoost líkanið sem sett er upp í þessari grein (sem deilir þjálfunarsettinu og prófunarsettinu með 8: 2) bestu áhrifin og eftirfarandi ber það saman við líkanið í bókmenntum [11–14] og sértækar niðurstöður eru sýndar í töflu 8.

Eins og sjá má af töflu 8 eru líkön sem skila betri árangri af líkönunum fimm Logistic regression líkan bókmenntanna [13] og XGBoost líkanið sem komið er á fót í þessari grein. Innköllun og nákvæmni líkansins í bókmenntum [13] er 0.99 og 0.98, í sömu röð, og innköllun og nákvæmni líkansins í þessari grein er 1.{{8} } og 0.974, í sömu röð, samanborið við heimildir [13], innköllun líkansins er mikil og innköllun í læknisfræðilegri greiningu gefur til kynna líkur á að greina krabbameinsfrumur, sem hefur mikla þýðingu fyrir flokkunina af brjóstakrabbameinsfrumum, þannig að XGBoost líkanið sem komið er á fót í þessari grein hefur betri spááhrif og er hægt að nota sem læknisfræðilegt tæki til að aðstoða lækna við að gera meðferðaráætlanir fyrir brjóstakrabbameinssjúklinga.

increase brain power

5. Niðurstaða

Þessi grein spáði aðallega fyrir um flokka brjóstakrabbameins, frá forvinnslu gagna til val á eiginleikum og síðan til stofnunar líkansins. Að lokum voru spániðurstöðurnar bornar saman og greindar frá mörgum hliðum.

Í þessari grein er innköllun tekin sem mikilvægur mælikvarði til að spá fyrir um sýni af illkynja brjóstakrabbameini eins nákvæmlega og hægt er. Upprunalega gagnasettið innihélt 30 eiginleika og 15 eiginleikar voru valdir sem inntak líkansins í gegnum Pearson fylgniprófið. Fyrir smíði líkans voru gögn staðlað til að útiloka áhrif mismunandi stærða á líkanáhrif. Fyrir vandamálið með ójafnvægi jákvæð og neikvæð sýni, er lagskipt sýnatökuaðferð notuð til að draga út þjálfunarsett og prófunarsett hlutfallslega í samræmi við mismunandi flokka gagna. Þegar ákjósanlegasta k-gildið er valið í k-næsta nágrannanum er innköllunin notuð sem líkanmatsvísitala, þannig að k-gildið með hæsta innköllunarhlutfallið er ákjósanlegasta gildið.

Líkönin eru borin saman og greind út frá þremur hliðum. Úrslitin eru sýnd sem hér segir:

pects. Niðurstöðurnar eru sýndar sem hér segir: (1) Ef þjálfunarsettinu og prófunarsettinu er deilt með 8: 2 er innköllun á XGBoost, random forest og logistic regression 1, sem getur spáð fyrir um allt illkynja brjóstakrabbamein K. -næsta nágranna muna er aðeins lægri en 0.986 samanborið við hinar þrjár gerðir. Fyrir spánákvæmni, nákvæmni og F1-stig líkansins eru niðurstöður XGBoost líkansins betri en niðurstöður handahófskenndra skóga og skipulagslegrar aðhvarfs, sem eru 0.974, {{1 0}}.96 og 0.98, í sömu röð, þannig að XGboost líkanið er valið sem lokaspálíkan með því skilyrði að þjálfunarsettið og prófunarsettið skiptist í 8:2.

(2) Þegar þjálfunarsettið og prófunarsettið var skipt í 7 : 3, lækkuðu gildi fjögurra matsvísanna fyrir XGBoost og tilviljunarkenndan skóga, en gildi fjögurra matsvísanna fyrir K-næstu nágrannalíkanið voru batnað, en fyrir innköllunina var aðeins innköllun á logistic aðhvarfslíkaninu 1, og hin líkönin voru yfir 0.98, þannig að líkansspááhrif logistic regressions var best, og spánákvæmni, nákvæmni , og F1-stig fyrir logistic regression voru 0.947, {{10}}.922, og 0.96, í sömu röð.

improve your memory

(3) Af tilraunum má sjá að undir mismunandi skiptingu hafa spááhrif líkansins mismunandi breytingar. Þegar bestu líkönin eru borin saman í tveimur settum mismunandi tilrauna má sjá að spánákvæmni, nákvæmni og F1-stig XGBoost líkansins (sem deilir þjálfunarsettinu og prófunarsettinu með 8: 2) eru hærri en í logistic aðhvarfslíkaninu (sem deilir þjálfunarsettinu og prófunarsettinu með 7 : 3) þegar innköllunin er 1, þannig að XGBoost líkanið (sem deilir þjálfunarsettinu og prófunarsettinu með 8: 2) virkar best í líkaninu sem sett er fram í þessari grein. Að auki, samanborið við líkönin í bókmenntum [11-14], hefur XGBoost líkanið sem komið er fram í þessari grein betri áhrif og getur nákvæmlega greint illkynja brjóstakrabbameinsfrumur. Hins vegar takmarkast þessar rannsóknir við töluleg gagnasöfn og í framtíðinni munum við reyna að nota djúpnámsreiknirit til að beita ýmsum eiginleikum útdráttaraðferðum á myndgögn (eins og röntgenmyndir) til að fá betri flokkunarniðurstöður.

Aðgengi gagna

Gögnin sem styðja niðurstöður þessarar rannsóknar eru opinskátt í UCI Machine Learning Repository á https://archive.ics.uci.edu/ml/datasets/Breast+Cancer+Wisconsin+ %28Diagnostic%29.

Hagsmunaárekstrar

Höfundar lýsa því yfir að þeir hafi enga hagsmunaárekstra.

Viðurkenningar

Þessi vinna var studd af National Natural Science Foundation of China (Grant no 61502156), Teaching and Research Project of Hubei Education Committee (Grant no 282), and Doctoral Foundation of Hubei University of Technology (Grant no. BSQD13051).


Heimildir

[1] V. Fotedar, S. Fotedar, P. Takur, S. Vats, A. Negi og L. Chanderkant, „Þekking á áhættuþáttum brjóstakrabbameins og aðferðir til að greina það snemma meðal heilsugæslustarfsmanna í Shimla, Himachal Pradesh," Journal of Education and Health Promotion, bindi. 8, bls. 265, 2019.

[2] MS Simon, TA Hastert, A. Barac, o.fl., "Cardiometabolic risk factors and survival after cancer in the women's health initiative," Cancer, vol. 127, nr. 4, bls. 598–608, 2021.

[3] HF Pasha, RH Mohamed, MM Toam og AM Yehia, "Erfðafræðilegar og epigenetic breytingar á adiponectin gen: p," The Journal of Gene Medicine, vol. 21, nr. 10, bls. e3120, 2019.

[4] D. Hong, AJ Fritz, SK Zaidi, o.fl., "Epithelial to mesenchymal umskipti og krabbameinsstofnfrumur stuðla að misleitni brjóstakrabbameins," Journal of Cellular Physiology, vol. 233, nr. 12, bls. 9136–9144, 2018.

[5] J. Zhong, D. Sun, W. Wei, o.fl., „Skiptaukinn ómskoðunarstýrður fínnálarsog fyrir vefjasýni úr vörpum í eitla á frumstigi brjóstakrabbameins,“ Ultrasound in Medicine and Biology, vol. . 44, nr. 7, bls. 1371–1378, 2018.

[6] K. Babic, C. Siguan-Bell, M. Hee, og SC Lin, "Ocular g: ómskoðun B-skanna mat á varðveitt skurðaðgerð svampur eftir Ahmed loku skurðaðgerð: tilfelli r," Journal of Glaucoma, vol. 26, nr. 10, bls. e239–e241, 2017.

[7] A. Yala, PG Mikhael, F. Strand, o.fl., „Í átt að öflugum brjóstamyndamyndagerðum fyrir hættu á brjóstakrabbameini,“ Science Translational Medicine, vol. 13, nr. 578, greinarkenni eaba4373, 2021.

[8] G. Zheng, X. Liu og G. Han, „Læknisfræðileg myndtölvuaðstoð uppgötvunar- og greiningarkerfisendurskoðun,“ Journal of Software, bindi. 29, nr. 5, bls. 1471–1514, 2018.

[9] EY Huang, S. Knight, CR Guetter, o.fl., „Telemedicine and telelementoring in the surgical specialties: a narrative review, The American Journal of Surgery, bindi 218, nr. 4, bls. 760–766, 2019.

[10] Q. Wu, BT Wang, HR Rao, Y. Jiang og C. Liu, "Brjóstakrabbamein og góðkynja sjúkdómsfrumur mynda mælifræðirannsóknir," Journal of Anhui Medical University, vol. 31, nr. 02, bls. 91–93, 1996.

[11] Q. Shen, F. Shao og R. Sun, "Spálíkan brjóstakrabbameins byggt á xgboost," Journal of Qingdao University (Natural Science Edition), bindi. 32, nr. 1, 2019.

[12] Z. Deng, B. Su og K. Zhan. g, "Brjóstakrabbameinsflokkun byggð á ensemble learning," China Medical Devices, vol. 35, nr. 12, 2020.

[13] M. Monirujjaman Khan, S. Islam, S. Sarkar, o.fl., "Machine learning based comparative analysis for breast cancer prediction," Journal of Healthcare Engineering, vol. 2022, greinarnúmer 4365855, 15 síður, 2022.

[14] A. Bhardwaj, H. Bhardwaj, A. Sakalle, Z. Uddin, M. Sakalle og W. Ibrahim, "Tré-undirstaða og vélanám reikniritgreining fyrir flokkun brjóstakrabbameins," Computational Intelligence and Neuroscience, vol. 2022, greinarnúmer 6715406, 6 síður, 2022.

[15] H. Dong og L. Ma, "Spálíkan um þrefalt neikvætt brjóstakrabbamein byggt á vélanámi," Journal of Yunnan University, vol. 39, nr. 1, bls. 111–115, 2017.


For more information:1950477648nn@gmail.com


Þér gæti einnig líkað