DeepSeek V4.1-Flash tehisintellektimudel on oma ehituselt hiiglaslik, sisaldades 552 miljardit parameetrit, kuid selle tegelik toimimine peidab endas üht kummalist anomaaliat: igal suvalisel hetkel kasutab mudel neist vaid 8 kuni 16 miljardit. See tohutu lõhe teadmiste mahu ja mõtlemiseks vajaliku ressursi vahel tähistab pööret tehisintellekti arhitektuuris, kus intelligentsus ei tähenda enam kõige korraga käivitamist, vaid täpset ja säästlikku valikut, mis viib keeruliste ülesannete lahendamise hinna peaaegu olematuks.

Mudel, mis teab rohkem, kui ta korraga läbi mõelda suudab

Kujutage ette raamatukogu, kus on pool miljonit riiulit täis pakse köiteid. See on aukartustäratav vaatepilt, mis sarnaneb DeepSeek V4.1-Flashi 552 miljardile parameetrile. Kuid siin on see kummaline osa: kui te esitate sellele raamatukogule küsimuse, ei hakka tuhanded raamatukoguhoidjad korraga mööda saale jooksma. Selle asemel ulatab üksainus asjatundja teile täpselt need kolm-neli raamatut, mida teil sel hetkel vaja läheb.

Need kaks numbrit — 552 miljardit ja 8 miljardit — ei ole vasturääkivus. Need on selle mudeli olemus. 552 miljardit on see, mida mudel „teab“; 8 miljardit on see, millega ta „mõtleb“ ühe operatsiooni vältel, tõustes 16 miljardini hetkel, mil ta oma vastust kirja paneb. See kuristik arvude vahel ei ole raiskamine. See on selle arhitektuuri keskne kihlvedu: et intelligentsus suurel skaalal ei nõua kõige korraga aktiveerimist.

Neli päeva pärast mudeli avalikustamist tegi DeepSeek vaikse, kuid kõneka otsuse. 14. septembril suunasid nad kogu professionaalse API-liikluse, varem mõeldud vanemale V4-Pro mudelile, otse uue V4.1-Flashi peale. Ei mingit fanfaarihelide saatel peetud esitlust ega suuri migreerumisjuhendeid esilehel. Uus mudel oli lihtsalt piisavalt hea ja piisavalt tõhus, et vana muutus üleöö tarbetuks.

Pealkirjades trooniv 552 miljardit parameetrit on selline number, mis kõlab nagu uhkustamine. Kuid tegelikult loeb see aktiivne osa. Inimese ajus on umbes 86 miljardit neuronit, kuid me ei pane neid kõiki korraga tööle, et lugeda ühtainust lauset. Kunst peitub suunamises. DeepSeek ehitas süsteemi, mis teab tohutult palju ja valib täpselt, mida üles äratada. See valik ongi see, millest ülejäänud lugu räägib.

Valiva tähelepanu arhitektuur

Mõelge mudelist kui hiiglaslikust võrgustikust, kus iga teie saadetud päring ei pane kogu masinavärki huugama. Selle asemel loeb kiire suunamismehhanism ukse peal teie küsimust, valib välja asjakohased riiulid ja saadab tööle ainult väikese rühma eksperte.

Selleks, et mudel saaks teie sisendit töödelda — seda nimetatakse „eeltäitmiseks“ (prefill) —, piisab 8 miljardist parameetrist. Vastuse genereerimiseks ehk „dekodeerimiseks“ (decoding) laieneb see meeskond 16 miljardini. Ülejäänud 528 miljardit seisavad täiesti paigal. Nad ei tarbi energiat, nad ei tee arvutusi. Nad lihtsalt ootavad oma korda.

See suunamine on DeepSeeki arhitektuuri süda, mida tehniliselt nimetatakse „ekspertide seguks“ (Mixture of Experts ehk MoE). Kui tavaline tihe keelemudel rakendab iga parameetrit iga sõnaosa ehk tokeni peal, siis MoE õpib määrama ülesandeid spetsialiseerunud alavõrkudele ehk ekspertidele. See võimaldabki arhitektuuril olla teoorias hiiglaslik ja praktikas minimalistlik.

Kuid siin tekib üks keeruline insenertehniline küsimus: kuidas hoida sellist hõredat süsteemi stabiilsena? Kui aktiveerivaid igal hetkel vaid murdosa võrgustikust, võib süsteemi tasakaal paigast nihkuda — mõned eksperdid saavad liiga palju koormust ja „treenivad üle“, samal ajal kui teised jäävad külmaks ja unustusehõlma. DeepSeek lahendab selle mHC-tehnoloogiaga (Manifold-Constrained Hyper-Connections), mis on hulk õpitud piiranguid, mis säilitavad geomeetrilised seosed aktiivsete ja uinunud piirkondade vahel.

Analoogia on ebatäiuslik, kuid kasulik: see on nagu rippsild, mis on projekteeritud nii, et kahel real sõitvad autod ei vääna kaableid, mis teenindavad tühje ülejäänud nelja rida. Sild püsib tervikuna pinges ja valmis, isegi kui koormus on vaid ühes servas.

Lisaks on olemas „internaliseerija“. Kui mudel kohtab väga pikka dokumenti, loob spetsiaalne hüpervõrk selle teksti jaoks unikaalse, ajutise kohanduse (LoRA-adapter). Teadlased kirjeldavad seda kui mudelile antavat ühekordset prilliklaasi, mis on lihvitud just selle dokumendi lugemiseks ja mis pärast kasutamist minema visatakse. See on kohanemine ilma õppimiseta, kontekstitundlikkus ilma püsivate muudatusteta süsteemi mälus. See eristus on vaikne, kuid tehnoloogilises mõttes märgiline.

Kuidas mahutada miljon sõnaosa tillukesse mällu

Iga vestlus keelemudeliga tekitab varjatud kulu. Kui mudel loeb teksti, ehitab ta mällu jooksvat kirjet kõigest nähtust, mida insenerid kutsuvad KV-vahemäluks (KV cache). See on vajalik, et mudel ei peaks iga uue sõna juures kõike algusest peale uuesti läbi arvutama. Suurte mudelite ja pikkade dokumentide puhul kasvab see mäluarve aga astronoomiliseks. See muutub pudelikaelaks, mis piirab seda, kui palju me mudelilt küsida saame.

DeepSeeki uus meetod, Compressed Sparse Attention 2, vähendab seda arvet tervelt kaheksa korda. Ja seda mitte informatsiooni minemaviskamise, vaid nutikamate geomeeriliste otseteede abil. Mõelge sellele kui erinevusele kõigi kunagi tehtud fotode säilitamise ja hoolikalt indekseeritud fotoalbumi vahel, kuhu on valitud vaid olulisimad kaadrid. Te ei kaota peaaegu midagi sisulist, kuid saate tagasi suurema osa oma riiulipinnast.

See vabastatud mälu on aga rakendatud teadlikult uue ülesande teenistusse. Mudelil on eraldi süsteem nimega Engram Conditional Memory — 196 miljardit parameetrit, mille ainus töö on hallata infot miljoni tokeni suurusest aknast. Miljon tokenit on umbes 750 000 sõna, mis vastab seitsmele täispikale romaanile, mis on korraga mudeli töölaual.

Enamiku mudelite jaoks on nii pikk kontekst pigem teoreetiline lubadus. Siin on see insenertehniline valik, mida toetab spetsiaalselt selleks mõõdetud mäluarhitektuur. Päriselu töös ei ole see tühiasi. Juriidiline meeskond, kes vaatab läbi keerulist ühinemislepingut, saab laadida kogu dokumendiahela ühte seanssi. Tarkvarainsener saab anda mudelile ette terve suure koodibaasi. Mudel ei tee lihtsalt kokkuvõtet ega unusta algust selleks ajaks, kui ta lõpuni jõuab. See on praktiline test, mida ükski akadeemiline tabel täielikult ei taba.

DeepSeek, Huawei ja ränimaailma uus geograafia

Kujutage ette kiibitehast Shenzhenis, kus õhk on paks epoksüvaigu lõhnast, ja üht väga spetsiifilist insenertehnilist meeleheidet. Kui USA ekspordipiirangud lõikasid Hiina laborid maha NVIDIA kõige võimsamatest kiirenditest, ei olnud probleem ainult toores arvutusvõimsuses. Küsimus oli kultuuris. Kogu globaalne AI-treeningu ökosüsteem on üles ehitatud CUDA-le, NVIDIA patenteeritud tarkvarakeskkonnale, täpselt nii, nagu jõgi uuristab endale sängi. Kiipide vahetamine ei tähendanud vaid riistvara asendamist, vaid jõesängi uuesti ehitamist.

DeepSeek tegi just seda. V4-seeria on optimeeritud töötama Huawei Ascend 950PR kiipidel, kasutades Huawei enda CANN Next -raamistikku. See on tagasihoidlik lause hiiglasliku inseneritöö kohta. CANN Next peab siluma lõhe selle vahel, kuidas uurijad AI-koodi kirjutavad ja kuidas Huawei räni seda tegelikult töötleb. See on tõlkekiht, mille NVIDIA muutis viieteistkümne aastaga nähtamatuks ja mille DeepSeeki insenerid pidid samuti nähtamatuks muutma — ja seda kiiresti.

Tulemuseks on tipptasemel AI-mudel, mis töötab ilma ühegi NVIDIA graafikaprotsessorita. Mõelge sellele hetkeks. Kogu tehisintellekti tööstuse eeldus 2024. aastal oli, et masmõtlemise tipp asub ühel konkreetsel aadressil: Santa Clara, California. Nüüd on toimunud suunamuutus.

Investorid märkasid seda. 2026. aasta oktoobris kaasas DeepSeek 80 miljardit jüaani ehk umbes 12 miljardit dollarit. Investorite seas olid Tencent ja CATL. CATL toodab akusid, Tencent haldab poolt Hiina internetist. Kumbki neist ei investeeri uisapäisa. See, millesse nad panustasid, ei olnud lihtsalt võimekas mudel, vaid riistvarast sõltumatu arhitektuur — tõestus, et tehisintellekti ränigeograafia on lõpuks ometi läbiräägitav.

Kas Ascend 950PR suudab hoida ülal massiivset koormust ja töökindlust pikkade aastate jooksul? Me ei tea seda veel täpselt. See on ausalt öeldes üks huvitavamaid lahtisi küsimusi selles loos.

Mida ütlevad testid — ja mida nad ei ütle

Skoor 90,9 testis nimega GPQA Diamond kõlab nagu koolihinne. Tegelikult on see pigem lävi. See test koosneb küsimustest, mille on koostanud eri valdkondade eksperdid just selleks, et tabada neid, kes teemat vaid pealiskaudselt tunnevad — doktorikraadi tasemel keemia, bioloogia ja füüsika probleemid. Inimesed, kellel on vastav kraad, saavad tavaliselt tulemuseks umbes 65 protsenti. Üle 90 ulatuv tulemus mis tahes mudeli puhul on piisavalt ebatavaline, et panna teadlased kaks korda vaatama.

DeepSeek V4.1-Flash saavutas selle numbri. Selle eelkäija V4-Pro skooris 80,6 protsenti SWE-bench Verified testis, mis ei palu tehisintellektil kirjeldada koodi kirjutamist, vaid paneb ta tegelikult koodi kirjutama — leidma vigu, neid parandama ja katsetest läbi laskma. 80 protsenti selles testis tähendab, et mudel toimib nagu nooreminsener päris tarkvaraprojektide juures, mitte ei tee lihtsalt osavat imitatsiooni.

Ja siis on kiirus: praktikas 333 kuni 427 tokenit sekundis. Skaala ülemises otsas tähendab see tervet lehekülge teksti kahe sekundi jooksul. See on piisavalt kiire, et ootamine lakkab olemast ootamine.

Nüüd aga aus osa. Testid on nagu hästi valgustatud koridorid ja mudeleid treenitakse nendes hästi kõndima. Akadeemiline edetabel ütleb meile midagi tõest, kuid see ei ütle kõike. Võrdlused mudeliga Claude 4.6 viitavad, et DeepSeek V4.1-Flash on üldiste ülesannete puhul samas liigas, kuid kordades odavam. See on pigem kaudne leid kui kontrollitud katse.

Sõltumatud uuringud on aga kinnitanud midagi täpsemat: nn Pareto-piiri tulemust. See tähendab, et teatud testides asuvad V4.1-Flash ja GPT-6 Astra praegu piiril, kus ei hinda ega sooritust ei ole võimalik enam parandada, ilma et teine neist kannataks. See on konkreetne väide väga kitsas valdkonnas, ja just selliseid väiteid tasubki tõsiselt võtta.

Mõtlemise hind läheneb nullile

Kui lasta läbi DeepSeek V4.1-Flashi miljon sõna, on arve 22 senti. See on vähem kui tassitäis halba bensiinijaama kohvi. Kui need samad sõnad mälusse salvestada, et neid uuesti kasutada, langeb hind ühele sendile miljoni kohta — see on number, mis on nii väike, et seda on raske isegi hinnaks nimetada.

Et mõista, mida see konkurentidele teeb, peame vaatama AI-äri marginaale. Seni on suured tegijad nagu OpenAI ja Google ehitanud oma ärimudelid eeldusel, et tipptasemel masinmõtlemine on luksuskaup, mille eest saab küsida kõrget hinda. DeepSeeki hinnastamine eemaldab selle eelduse kirurgilise täpsusega. Kui tipptasemel sooritus on kättesaadav sellise hinnaga, muutub turg tundmatuseni.

Küsimused selle ärimudeli jätkusuutlikkuse kohta on muidugi õhus. Me ei tea, kui kaua saab hoida ühesendist hinda või kas 12 miljardi dollari suurune investeering sisaldab mingeid varjatud toetusi, mis võrdlust moonutavad. Kuid see, mida me teame, on lihtsam ja märksa olulisem: kui mõtlemine ei maksa peaaegu midagi, lakkab küsimus sellest, kes saab intelligentsust kasutada, olemast finantsiline küsimus.

DeepSeek V4.1-Flash on liigutanud selle piiri teooriast praktikasse. Ja sealt see päris lugu alles algabki.