7 min lexim
Si mësojnë makinat
Të mësosh nga shembujt, jo nga rregullat
Deri tani ti i ke thënë kompjuterit saktësisht çfarë të bëjë, hap pas hapi. Çoje breshkën përpara, kontrollo një kusht, përsërit një cikël. Kjo funksionon kur rregullin mund ta shkruash. Por disa probleme janë thuajse të pamundura t'i përshkruash me rregulla.
Mendo se si t'i dallosh një foto maceje nga një foto qeni. Përgjigjen e di brenda një çasti, e megjithatë do ta kishe të vështirë të shkruaje rregullat e sakta që i ndajnë. Këtu hyjnë në lojë IA dhe mësimi i makinave. Në vend që rregullin ta shkruash vetë, i tregon makinës shumë shembuj dhe e lë atë ta gjejë modelin.
Mësimi i makinave është të programosh një kompjuter që të bëhet më i mirë në një detyrë duke përdorur shembuj të dhënash ose përvojë të mëparshme. Është i dobishëm pikërisht atëherë kur një rregull i thjeshtë është i vështirë të shkruhet: të njohësh të folurën, të lexosh shkrimin me dorë, të zbulosh mashtrime, ose të drejtosh një robot nëpër një terren ku askush nuk ka ecur.
Dhe nuk të duhet ta ndërtosh gjithçka nga e para. Siç e tha njëri prej të ftuarve tanë: nuk të duhet të shkruash një libër kur e ke tashmë në një bibliotekë. Në Python thjesht importon bibliotekën e duhur dhe e përdor. Një shije të vogël të kësaj do ta shohim në fund.
Tre llojet e mësimit
Pothuajse çdo metodë e mësimit të makinave bie në një nga tre familjet.
Mësimi i mbikëqyrur mëson nga shembuj me etiketë. I jep të dhëna ku përgjigjja është ngjitur tashmë, shumë foto secila e shënuar "mace" ose "qen", dhe ai mëson modelin që lidh hyrjen me etiketën. Më pas ai mund t'i vërë etiketë një fotoje të re që nuk e ka parë kurrë. Shumica e parashikimeve të përditshme, nga filtrat e mesazheve të padëshiruara te vlerësimet e çmimeve, punojnë kështu.
Mësimi i pambikëqyrur merr të dhëna pa asnjë etiketë. Puna e tij është të gjejë vetë strukturën, për shembull t'i grupojë klientët që sillen njësoj në tufa. Askush nuk i thotë grupet "e sakta"; ai i zbulon vetë nga të dhënat.
Mësimi me përforcim mëson duke provuar, e pastaj duke marrë një shpërblim ose një ndëshkim. Përfytyro se po mëson një makinë vetëdrejtuese përmes një sërë lëvizjesh si "majtas, drejt, djathtas, drejt". Një ecje e sigurt dhe e qetë fiton një pikë të mirë, të themi +18.5. Një ecje që kthehet befas dhe frenon fort fiton një të keqe, të themi -3. Përgjatë shumë provave makina mëson cilat veprime çojnë te shpërblimi më i lartë, njësoj siç mëson ti një lojë duke e luajtur.
Një shembull i punuar: parashikimi nga veçoritë
Copëzat e informacionit që i jep një modeli quhen veçori. Zgjedhja e veçorive të mira është shpesh ajo që vendos nëse një model funksionon apo jo.
Ja një shembull nga një prej punëtorive tona të shkencës së të dhënave. Le të themi se do të parashikosh nëse një person është burrë apo grua, dhe e vetmja veçori që ke është lartësia e tij.
Ti i lexon lartësitë nga një skedar, i vendos në një grafik dhe kërkon një kufi. Vendos, të themi, se kushdo më i gjatë se 170 cm parashikohet burrë, dhe më i shkurtër parashikohet grua. Ky rregull del i saktë shpesh. Por kur i numëron gabimet, sheh mjaft: burra të shkurtër dhe gra të gjata etiketohen gabim. Saktësia, pjesa e parashikimeve që modeli i qëllon drejt, është veç kaluese.
Prandaj shton një veçori të dytë: peshën. Tani secili person është një çift, lartësia dhe pesha bashkë, dhe të dyja veçoritë i japin modelit shumë më tepër për t'i ndarë njerëzit. I njëjti lloj modeli, i ushqyer me të dyja veçoritë, parashikon shumë më saktë se sa lartësia vetëm.
Ky është ritmi i përditshëm i mësimit të makinave: zgjidh veçoritë, mat saktësinë, dhe shto ose ndrysho veçori derisa parashikimet të jenë mjaft të mira për punën.
Mëso më shumë
Çfarë është një GAN. Disa nga gjërat më mahnitëse të IA-së që ke parë, fytyra njerëzish që nuk ekzistojnë, një foto e kthyer në pikturë, vijnë nga një ndërtim që quhet GAN (rrjet gjenerues kundërshtar). "Gjenerues" do të thotë se krijon të dhëna të reja. "Kundërshtar" do të thotë se dy rrjete vihen kundër njëri-tjetrit.
Mënyra më e qartë për ta përfytyruar është një skicë policie.
- Njëri rrjet është Gjeneruesi, si një skicues. Ai nuk e ka parë kurrë të dyshuarin. Ai vazhdon të prodhojë vizatime dhe përpiqet t'i bëjë të duken të vërteta.
- Rrjeti tjetër është Dalluesi, si një dëshmitar okular. Ai ka parë fytyra të vërteta, dhe puna e tij e vetme është të thotë "e vërtetë" ose "e rreme" për çdo vizatim.
Në fillim skicuesi është i zhgënjyer dhe dëshmitari e kap çdo të rreme. Por çdo refuzim është një përgjigje kthyese. Gjeneruesi rregullohet, provon sërish, dhe ngadalë të rremet e tij bëhen më bindëse, derisa edhe Dalluesi mezi i dallon. Ky shkim-ardhje është mënyra si një GAN mëson të prodhojë të dhëna që duken të vërteta.
Kur IA merr me mend fjalëkalimin tënd. Nëse një GAN mund të mësojë se si duken fytyrat e vërteta, mund të mësojë edhe se si duken fjalëkalimet e vërteta. Njerëzit nuk i zgjedhin fjalëkalimet rastësisht. Ata mbështeten te modelet: një emër dhe një vit, një skuadër e preferuar, një fjalë me një numër ngjitur në fund. Një mjet i quajtur PassGAN u stërvit mbi lista të mëdha fjalëkalimesh të rrjedhura dhe i mësoi ato modele, pastaj gjeneroi hamendje të reja në të njëjtin stil. Ai prodhoi vargje si love42743, s13trumpy dhe bananabake, fjalëkalime të besueshme që dikush vërtet mund t'i zgjidhte, të drejtuara pikërisht drejt thyerjes më të shpejtë të llogarive.
Mësimi nuk është t'i trembesh teknologjisë, por ta respektosh. Një fjalëkalim i ndërtuar mbi një model të dukshëm është pikërisht ajo që makina pret, dhe e njëjta ide që e bën mësimin e makinave të fuqishëm, të mësosh modele nga shumë shembuj, është ajo që i bën fjalëkalimet e parashikueshme të rrezikshme. Një frazë e gjatë e e pazakontë që nuk ndjek asnjë shabllon të njohur është shumë më e vështirë për një model të stërvitur ta marrë me mend, ndaj zgjidh një që një makinë gjuetare modelesh nuk do ta priste.
Në fund, një shije e vogël e idesë "thjesht importoje dhe përdore". Ky program i vockël përdor një bibliotekë të gatshme për të mësuar lidhjen mes viteve të përvojës dhe pagës, pastaj parashikon një vlerë të re. Nuk të duhet të kuptosh çdo rresht; vër re sa pak rreshta duhen.
from sklearn.linear_model import LinearRegression
# vitet e pervojes dhe pagat perkatese
X = [[1], [2], [3], [4], [5]]
y = [110000, 120000, 130000, 140000, 150000]
model = LinearRegression()
model.fit(X, y)
# parashiko pagen per 6 vite pervoje
print(model.predict([[6]]))
Praktikë
Zgjidh një aplikacion që e ke përdorur sot dhe thuaj cilin lloj mësimi ka më shumë gjasa të përdorë, dhe çfarë shembujsh të dhënash mund të ketë mësuar prej tyre.
Provo veten
- Një filtër mesazhesh të padëshiruara stërvitet mbi mijëra email-e të shënuar tashmë "i padëshiruar" ose "jo i padëshiruar". Cili nga tre llojet e mësimit është ky, dhe pse?
- Në shembullin e lartësisë, pse e bëri më të saktë parashikimet shtimi i peshës si veçori e dytë?
- Në përfytyrimin e GAN-it si skicë policie, cili rrjet është skicuesi dhe cili dëshmitari, dhe çfarë përpiqet të bëjë secili?
Nga vjen ky mësim
Ndërtuar mbi
- Workshop 1: Machine Learning (leksionist i ftuar): pse ML dhe llojet e mësimit
- Workshop 2: Data Science (leksionist i ftuar): veçoritë dhe saktësia (lartësia, pastaj lartësia me peshën)
- Workshop 3: Introduction to GANs (leksionist i ftuar): GAN-et dhe PassGAN
- Fjalori: ia
Kurset e alphaPlan ndërtohen mbi programe të zhvilluara në klasë, e nuk shpiken për web-in. Kur një pohim mbështetet mbi një standard të jashtëm ose mbi një rast të raportuar, ai emërtohet më sipër që ta kontrollosh vetë e të mos na besosh në fjalë.
Ky kurs u zhvillua nga alphaPlan Center mbi bazën e programeve të realizuara në partneritet me rrjetin American Corners.
Gjete diçka të paqartë, të vjetruar ose që mund të përmirësohet? Sugjero një përmirësim