6. oktoobril 2026 avaldas OpenAI 722 matemaatilist käsikirja – see on suurim üksiksündmus tehisintellekti matemaatilise loogika ajaloos. Ettevõte vihjas diskreetselt, et üks neist võib sisaldada lahendust probleemile, mis on alistanud kõik elusolevad matemaatikud. See tähistab pööret, kus masinad ei piirdu enam mustrite kopeerimisega, vaid on asunud ründama inimteadmiste kantsi – abstraktset loogikat –, kasutades selleks Lean 4 keelt ja 4000 arvuti verifitseeritud tõestust.
Siin on asja kummaline pool. Me elame maailmas, mida juhivad vedelikud ja gaasid. Alates sellest, kuidas veri teie arterites voolab, kuni selleni, kuidas tormid Atlandi ookeani kohal keerlevad – kõik see allub füüsikaseadustele. Kuid meil on üks suur ja ebamugav saladus. Matemaatiliselt ei ole meil õrna aimugi, kas need võrrandid, mida me nende nähtuste kirjeldamiseks kasutame, on „lollikindlad“.
See ei ole lihtsalt järjekordne keeruline koolitükk. Navier-Stokesi olemasolu ja sileduse probleem on üks seitsmest aastatuhande auhinnaprobleemist (Millennium Prize Problems). See on nimekiri, mille koostasid matemaatikud 2000. aastal ja nad küsisid sisuliselt: millised on need küsimused, millele meil on kõige rohkem vastust vaja, kuid millele vastamist me kõige vähem oskame? Kui lahendate neist ühe, saate miljon dollarit. Kuid mis veelgi olulisem – te kirjutate ümber peatüki inimkonna teadmistest.
Navier-Stokesi võrrandid kirjeldavad vedelike liikumist. Probleem on selles, et keegi pole suutnud rangelt tõestada, et need võrrandid annavad alati „siledad“ ja korrektsed lahendused, ilma et need kuskil matemaatiliselt „plahvataksid“ või mõttetuks muutuksid. See küsimus on oma olemuselt olnud vastuseta üle kahe sajandi.
Ja nüüd on meil äkki laual 722 käsikirja.
722 käsikirja ja masin, mis ei eksi kunagi
See arv – 722 – ei ole trükiviga. OpenAI pakett sisaldab 372 erinevat tulemuste komplekti ja 4000 neis leiduvat tõestust on kontrollitud programmiga Lean. Mõelge Leanist kui halastamatust matemaatika grammatikakontrollist. Kui inimene kirjutab tõestust, võib ta teha väikese loogikavea, mida keegi ei märka aastakümneid. Aga Lean on programmeerimiskeel: kui üks samm on vale, siis programm lihtsalt ei käivitu. See ei ole teadlane, kes kuulutab pressikonverentsil välja avastuse. See on masin, mis toodab verifitseeritud matemaatikat kiirusega, millel puudub ajaloos eeskuju.
Et seda mõõtkava hoomata, proovime teistmoodi. Keskmine matemaatik toodab oma karjääri jooksul ehk peotäie olulisi tõestusi. Isegi ajaloo kõige viljakamad geeniused, nagu Hardy, Ramanujan või Erdős, töötasid aastakümneid, et koguda kokku vaid murdosa sellisest mahust. OpenAI mudel näib olevat teinud midagi struktuurselt uut – küsimus pole ainult kiiruses, vaid meetodis.
See on tekitanud piisavalt ärevust, et Institute for Advanced Study – paik, mis oli koduks Einsteinile ja Gödelile – nõustab nüüd OpenAI-d, kuidas neid tulemusi vastutustundlikult avaldada. Juba see detail ütleb meile midagi olulist: isegi OpenAI mõistab, et nad on jõudnud kuhugi, kus on vaja välist akadeemilist hinnangut.
Pikk tee hõbedani: Kuidas AI õppis matemaatiliselt mõtlema
Nüüd hoidke seda mõtet. Kuidas me siia jõudsime? Rahvusvaheline matemaatikaolümpiaad (IMO) ei ole eksam, where pääseb läbi valemite tuupimisega. See on kuus ülesannet kahe päeva jooksul, millest igaüks on nagu pisike lukustatud ruum, millel puudub ilmne uks. Isegi elukutselised matemaatikud jäävad nendega sageli hätta. Just seepärast valis tehisintellekti kogukond IMO oma tõelise mõtlemisvõime testiks: siin ei aita pelk mustrite tuvastamine.
Aastaid kukkusid tehisintellektid nendel katsetel haledalt läbi. Siis, 2024. aasta suvel, lahendas Google DeepMindi AlphaProof kuuest ülesandest neli. See tulemus vastas hõbemedalile. Teadusmaailm oli varem skeptiliselt arvanud, et selleni jõudmiseks läheb aastaid. Ei läinud. See üks tulemus muutis arutelu küsimuselt „kas AI suudab matemaatiliselt arutleda“ küsimusele „kui kaugele ja kui kiiresti ta läheb“.
Aus vastus on: ebaühtlaselt. 2025. aasta veebruaris avaldatud AlphaGeometry 2 suudab lahendada 88% viimase 25 aasta olümpiaadi geomeetriaülesannetest. Muljetavaldav, kuni märkate, et geomeetria on vaid üks hästi struktureeritud nurgake palju suuremast mandrist. Üldistusvõime on endiselt see kangekaelne ja vastuseta küsimus.
OpenAI valis oma o1-seeriaga teistsuguse tee. Selle asemel, et spetsialiseeruda geomeetriale, ehitati mudel ümber sellele, mida meeskond kutsub „mõttetokeniteks“ (reasoning tokens). Need on pühendatud arvutusetapid, kus mudel töötab ülesande kallal sisemiselt, enne kui väljastab vastuse. Mõelge sellest vähem kui lahenduse mäletamisest ja rohkem kui mustandipaberil kritseldamisest. Tulemuseks oli 83% IMO kvalifikatsioonieksamil. See täpsustus on oluline – kvalifikatsiooniring, mitte olümpiaad ise. Igaüks, kes väidab vastupidist, üritab teile midagi maha müüa.
Kolm andmepunkti, kolm erinevat arhitektuuri, kolm osalist võitu. Progressi piirjooned hakkavad selgeks saama.
Tõe grammatikakontroll: Mida Lean 4 tegelikult teeb
Kujutage ette tekstiredaktori õigekirjakontrolli, aga selle asemel, et kontrollida kirjavigu, kontrollib see loogilist tõde. Lean 4 on midagi sellist, ainult et panused on kõrgemad ja mehhanism fundamentaalsem. See on programmeerimiskeel, mis lihtsalt keeldub kompileerimast tõestust, mis sisaldab loogikaviga, täpselt samamoodi nagu arvuti keeldub käivitamast koodi, milles on süntaksiviga.
See erinevus on hiiglaslik. Inimese kirjutatud tõestuses võib peituda peen lünk aastaid, enne kui keegi seda märkab. Lean-kontrollitud tõestuses see võimalik ei ole. See verifitseerimine ei ole teise matemaatiku arvamus, kellel võib olla sama pimeala; see on masin, mis kontrollib iga deduktiivset sammu matemaatika enda aksioomide vastu, ilma igasuguse viisaka nõustumisvajaduseta.
Siin teenibki neuro-sümboolne tehisintellekt välja oma sidekriipsuga nime. Närvivõrgud on hiilgavad mustrite tuvastajad ja kohutavad loogikud. Lean 4 on halastamatu loogik, kellel puudub igasugune intuitsioon. Neuro-sümboolsed süsteemid poogivad need kaks kokku: närvivõrk genereerib kandidaadid tõestuse sammudeks ja sümboolne mootor kas kiidab need heaks või hävitab need. Matemaatiline hallutsinatsioon – see, mis näeb välja enesekindel, kuid on vaikselt vale – jääb vahele enne, kui see jõuab esimesest sammust kaugemale.
Lean 4 on muutunud masinkontrollitud tõestuste tööstusstandardiks. Ei ole juhus, et OpenAI valis just selle verifitseerimiskihiks kõigi 4000 ülesande jaoks. Isegi analüütikafirma Gartner, mis pole tuntud varajase entusiasmi poolest, paigutas neuro-sümboolse AI oma 2025. aasta tehnoloogiate graafikule kui kriitilise tähtsusega lahenduse. Gartneri tähelepanu on märk, mida tasub tähele panna, ja hoiatus, mida tasub meeles pidada: see tähendab, et tehnoloogia on piisavalt reaalne, et seda jälgida, kuid mitte veel piisavalt küps, et seda pimesi usaldada.
Probleemi lahendamine ja selle mõistmine ei ole üks ja seesama operatsioon.
Triljoni parameetriga rivaal: Mistral Large 4 ja mastaabi arhitektuur
Samal nädalal, kui OpenAI käsikirjad maandusid, avaldas üks Prantsuse ettevõte vaikselt dokumentatsiooni mudeli kohta, millel on omapärane kaksikidentiteet. Mistral Large 4 kannab endas kokku 1,05 triljonit parameetrit. Kuid suvalisel ajahetkel töötab neist vaid 52 miljardit.
See lünk ongi trikk. Arhitektuuri nimetatakse ekspertide seguks (Mixture-of-Experts) ja selle loogika on üllatavalt lihtne: iga küsimus ei vaja igat eksperti ruumis. Suunaja – kerge liikluse reguleerimise süsteem – loeb iga sissetulevat probleemi ja suunab selle asjakohastele spetsialiseerunud alamvõrkudele, jättes ülejäänud puhkeolekusse. See triljoni parameetriga universum ootab; 52-miljardiline aktiivne viil teeb tegeliku mõtlemistöö. Tervik on dramaatiliselt odavam kui selle osade summa.
Mistral ehitas mudelisse veel midagi: 1,6 miljardi parameetriga visuaalse kodeerija. See number kõlab triljoni kõrval tagasahoidlikult, kuid selle tähendus on suur. Matemaatika ei ole ainult tekst. Diagrammid, geomeetrilised kujundid, tahvlilt pildistatud käsitsi joonistatud tõestused – just nii töötavad inimmatemaatikud tegelikult. Mudel, mis suudab lugeda pilti sama soravalt kui lauset, omab fundamentaalselt laiemat arusaama sellest, mis üldse on lahendatav probleem.
Mistrali avalikustamine kinnitab, et võidujooks loogiliselt võimeka tehisintellekti loomise nimel ei ole ühe ettevõtte projekt. OpenAI, Google DeepMind ja nüüd Mistral lähenevad kõik samale sihtkohale erinevaid teid pidi. See konkurents on oluline, sest see tähendab, et surve verifitseerida, parandada ja neid süsteeme ausalt testida ei kavatse raugeda.
Mõtlemise illusioon: Kus masin ikkagi hätta jääb
Võtke mudel, mis suudab lahendada neli kuuest matemaatikaolümpiaadi ülesandest. Nüüd liigutage ühte ketast. Apple'i teadlased tegid oma 2025. aasta artiklis „Mõtlemise illusioon“ just seda Hanoi torni mõistatusega: nad muutsid ühte parameetrit, ühte kitsendust ülesandes, mille mudel oli näiliselt „selgeks saanud“, ja sooritus kukkus kokku. Ja mitte graatsiliselt, vaid täielikult. See, mis nägi välja nagu arutlusvõime, osutus väga veenvas kostüümis mustrituvastuseks.
Võrdlus varasemate AI-vigadega on siinkohal õpetlik. Kümmekond aastat tagasi tundsid pildituvastajad koolibussi õigesti ära, kuid eksisid täielikult, kui bussi veidi pöörati. Me nimetasime seda ebaküpsuseks. Uus ebaõnnestumine on peenem ja seetõttu ohtlikum, sest mudeli enesekindlus ei kõigu ka siis, kui ta eksib.
Videogeneratsioon pakub siin ilmeka paralleeli. Füüsikaalane test „Maailmamudelite viimane eksam“ andis tehisintellektile seeriaid reaalsetest füüsikalistest sündmustest ja palus mudeldada, mis saab edasi. Parim mudel sai füüsikalise järjepidevuse eest hinde 57,76 sajast. See suutis luua kaadreid, mis tundusid inimese silmale usutavad, kuid rikkusid sealjuures termodünaamika seadusi. Visuaalselt veenev, füüsikaliselt vale. Lünk nende kahe vahel on täpselt see koht, kus süsteemides, mis peavad tegutsema reaalmaailmas, võivad kaalul olla elud.
Aus vahe, millest kinni hoida, on see: probleemi lahendamine ja selle mõistmine ei ole üks ja seesama operatsioon. Lean 4 tagab loogilise korrektsuse igal sammul, mis on võimas. Kuid korrektsus tuntud struktuuris ei ole sama mis kompetentsus siis, kui struktuur muutub. See lünk ei ole viga, mis järgmise versiooniga lihtsalt ära parandatakse. See ongi praegu teaduse tegelik eesliin.
Õpetamine, bittide pöördumine ja horisont
Probleemi lahendamine ja selle selgitamine on kaks erinevat kognitiivset tegevust. Sherpa õpperaamistik võtab seda eristust tõsiselt: treenides AI-tuutoreid kohanduma erinevate õpilastega, parandas see õpetamise tulemuslikkust keskmiselt 20,5 protsendipunkti võrra. See number on märkimisväärne, sest viitab sellele, et arutlusvõime ja pedagoogiline võime on eraldi „lihased“. Tehisintellekt võib sarnaselt geniaalsele matemaatikule, kel puudub kannatus küsimustele vastamiseks, ebaõnnestuda selgitamises isegi siis, kui ta valdab sisu.
Samal ajal, kui tõestused muutuvad loogiliselt veekindlaks, liigub rünnakupind allapoole – koodist mööda, loogikast mööda, kuni ränini välja. BARE-AI raamistik on loodud bittide pöördumise rünnakute (bit-flip attacks) tabamiseks, kus füüsilised riistvaralised häired rikuvad AI-mudeli kaalusid mälutasandil. See suudab selliseid rünnakuid tuvastada kuni 98-protsendilise täpsusega. See on meeldetuletus, et formaalselt verifitseeritud tõestus on vaid nii usaldusväärne kui masin, mis seda kontrollib.
Kolm küsimust jäävad siiani avatuks. Kas need 722 käsikirja elavad üle matemaatikute omavahelise retsenseerimise? Kas Navier-Stokesi lahendus peab vastu sõltumatule kontrollile? Ja kas 83% tulemus olümpiaadi kvalifikatsioonis peegeldab tõelist mõtlemist või lihtsalt väga kallist mustrituvastust treeningandmetel?
Kui tehisintellekti matemaatilise loogika pudelikael on nihkumas tõestuste leidmiselt sellele, et otsustada, millised probleemid on üldse väärt küsimist, siis me pole veel välja mõelnud, kes – või mis – selle valiku teeb. Me ei tea seda siiani. Ja see, ausalt öeldes, ongi asja parim osa.