Preskočiť na obsah
Nástroje & modely

DeepSeek V4-Flash: menší model, ktorý dobieha vlajkovú loď

Rovnaká veľkosť, o triedu vyšší výkon. Čo to znamená pre tézu, že špičková AI čoskoro pobeží na bežnom hardvéri.

Pavol KostolanskýPavol Kostolanský4 min čítania
DeepSeek V4-Flash: menší model, ktorý dobieha vlajkovú loď
DeepSeek V4-Flash: menší model, ktorý dobieha vlajkovú loď

DeepSeek 31. júla 2026 oficiálne vydal model DeepSeek V4-Flash-0731 ako verejnú beta verziu. Pozoruhodná nie je nová veľkosť, tá sa nezmenila, ale to, čo z rovnakého modelu dokázali dostať. Pri nezmenených 284 miliardách parametrov a 13 miliardách aktívnych na token posunul MarkTechPost zdokumentované agentné a kódovacie skóre o desiatky bodov nahor. Iba prepracovaným post-tréningom.

To je jadro príbehu, ktorý sa medzi vývojármi rozšíril rýchlejšie než samotné vydanie. Menší model dobieha väčší. A robí to bez pridania jediného parametra.

DeepSeek V4-Flash zlepšil skóre bez zväčšenia modelu

Podľa oficiálnej model card k buildu 0731 ide o rovnakú MoEMixture of Experts. Architektúra, kde model má veľa parametrov, ale pri každom tokene aktivuje len malú časť, čím šetrí výpočet. architektúru a rovnakú veľkosť ako pri preview verzii. Changelog to hovorí bez okolkov: model bol „only re-post-trained“. Žiadny nový bilión parametrov, žiadny väčší tréningový beh. Len iný záverečný tréning na tých istých váhach.

Čísla, ktoré DeepSeek zverejnil, sú konkrétne:

  • Terminal Bench 2.1: 82,7 oproti 61,8 pri Flash preview a 72,1 pri väčšom V4-Pro preview. Referenčný Opus-4.8 má podľa TechTimes hodnotu 85,0.
  • DeepSWE (oprava chýb v kóde): skok na 54,4 zo 7,3 v preview.
  • Toolathlon Verified: 70,3 oproti 49,7.
  • Cybergym: 76,7 oproti 38,7.

TechTimes uvádza, že V4-Flash-0731 prekonáva väčší V4-Pro preview v deviatich agentných benchmarkoch. Pripomeniem proporcie: Hugging Face report uvádza pre V4-Pro 1,6 bilióna parametrov so 49 miliardami aktívnych, kým Flash má 284 miliárd s 13 aktívnymi. Menší a lacnejší model naháňa vlajkovú loď.

Skok na DeepSWE zo 7,3 na 54,4 znie takmer neuveriteľne a zaslúži si triezvy pohľad. Také nízke východiskové skóre zvyčajne znamená, že preview verzia mala v danej úlohe systémový problém, nie že Flash odrazu pochopil programovanie. Kto plánuje nasadenie, musí benchmark čítať v kontexte: kto testoval, na akých dátach a či validita platí aj mimo laboratória. O tom, prečo skóre bez kontextu klame, sme písali v analýze benchmarku ARC-AGI 3.

Terminal Bench 2.1: skok V4-Flash bez zmeny veľkostiskóre, vyššie je lepšie
61.8 Flash preview 72.1 V4-Pro preview 82.7 Flash-0731 85 Opus-4.8

Ekonomika inferencie je skutočná zmena

Ceny V4-Flash po prechode do všeobecnej dostupnosti sú podľa NXCode takéto: 0,14 dolára za milión vstupných tokenov (cache-miss), 0,28 dolára za milión výstupných a 0,0028 dolára za milión tokenov pri zásahu do cache. Pri agentných úlohách, kde model číta rovnaký kontext dookola, je práve cache-hitSituácia, keď model znovu použije už spracovaný kontext z pamäte namiesto opätovného výpočtu. Účtuje sa výrazne lacnejšie než nový vstup. rozdiel medzi rozumnou a nezmyselnou faktúrou.

Podstatnejší je infra profil. Technický report uvádza, že V4-Flash pri kontexte jeden milión tokenov potrebuje približne 10 % FLOPsPočet operácií s pohyblivou desatinnou čiarkou. Miera výpočtovej náročnosti; menej FLOPs znamená lacnejšiu a rýchlejšiu inferenciu. a 7 % KV cachePamäť, do ktorej si model počas generovania ukladá spracovaný kontext, aby ho nemusel počítať znova. Menšia KV cache znamená nižšie nároky na pamäť. oproti staršiemu V3.2. To nie je marketingová zľava, ale iná trieda výpočtovej náročnosti pri zachovaní veľkého kontextu.

Analýza „agent economics“ od NXCode zhŕňa dôsledok jasne: po upgrade 0731 sa menší Flash v niektorých agentných scenároch ekonomicky vyrovná väčšiemu Pro alebo ho predbehne. Lepší výkon pri nižšej cene mení kalkuláciu, ktorú si každý CTO robí pri návrhu produkčného pipeline.

V našich nasadeniach agentov na akvizíciu zákazníkov bola dlho najväčšou položkou nie prvá odpoveď modelu, ale desiatky opakovaných volaní, keď agent iteruje nad tým istým kontextom. Model, ktorý zvládne milión tokenov za desatinu výpočtu a s lacným cache-hitom, tam mení jednotkovú ekonomiku od základu. Práve tu sa rozhoduje, či agentný projekt prežije stretnutie s CFO.

Presne túto otázku, teda koľko AI zámer stojí počas celého životného cyklu a či ho radšej postaviť, kúpiť alebo integrovať, rozoberáme prakticky vo workshope o investičnom rozhodnutí vyvinúť verzus kúpiť pre vedenie firmy. Má zmysel, ak práve zvažujete, či nižšie ceny inferencie ospravedlnia vlastnú architektúru, alebo vás uzamknú k jednému dodávateľovi.

Pobehne špičková AI o rok na laptope? Zdroje to nepotvrdzujú

Téza, ktorá celý rozruch rozbehla, znie: keďže open source modely sa zmenšujú a zlepšujú, o rok pobežia modely úrovne Opus na bežných spotrebiteľských laptopoch. Pochádza z diskusného príspevku na Reddite, ktorého autor sám priznáva, že nie je odborník na jazykové modely a grafy si vygeneroval pomocou modelov Opus a Sonnet 5.

Overiteľné fakty tú tézu čiastočne živia, no nedokazujú:

  • DeepSeek preukázateľne zlepšil schopnosti bez zväčšenia modelu, čo je smer, ktorý téza predpokladá.
  • Klesajúce FLOPs a KV cache reálne posúvajú latku hardvérových nárokov nadol.
  • Rovnaký smer vidno pri cenách naprieč trhom, o čom sme písali v texte o tom, ako cena AI modelov klesá.

Čo zdroje z 31. júla a 1. augusta 2026 nepotvrdzujú: žiadny z nich neuvádza konkrétne požiadavky na RAM, GPU ani TDP pre plné nasadenie V4-Flash na spotrebiteľskom laptope. Redditové tvrdenie, že sa model zmestí do zostavy pod 50 000 dolárov, nemá v technickej správe oporu. A 50 000 dolárov aj tak nie je laptop, ale malý server. Pripomeňme: 284 miliárd parametrov musí niekam uložiť aj model, ktorý aktivuje len 13 miliárd na token.

Rozdiel medzi „potrebuje menej výpočtu než predchodca“ a „pobehne na notebooku vášho obchodníka“ je priepasť, ktorú marketing rád preskočí. Fakty ju zatiaľ nepreskakujú.

Čo z toho plynie pre firmu v EÚ

Pre firmu, ktorá stavia produkčné agenty, je správna otázka nie „koľko to vie v deme“, ale „čo sa stane, keď to beží bez dozoru, vo veľkom, s reálnymi zákazníkmi a zodpovednosťou“. K tomu tri body:

  1. Náklady. Nižšia cena inferencie a úspornejší kontext sú reálny dôvod prepočítať jednotkovú ekonomiku agenta. Rozhoduje štruktúra volaní, nie cena za milión tokenov na papieri.
  2. Vendor risk. DeepSeek je čínsky poskytovateľ. Caixin Global zasadzuje vydanie do zostrujúcich sa čínskych AI pretekov. Pri spracúvaní osobných údajov to prináša otázky o mieste spracovania a o klasifikácii poskytovateľ verzus nasadzovateľ podľa AI Act.
  3. Migrácia. Staré aliasy deepseek-chat a deepseek-reasoner boli odstavené 24. júla 2026, takže nový traffic musí ísť cez deepseek-v4-pro alebo deepseek-v4-flash. Kto to nemá premigrované, má produkčný problém už dnes.

Kto rieši práve architektúru RAG, pamäte a agentov pre reálne nasadenie, nájde prakticky orientovaný obsah v dvojdňovom workshope o produkčnej AI a architektúre kontextu, vrátane zaradenia rolí podľa AI Act.

Trend je reálny a smer je jasný. Menšie modely zvládajú viac a lacnejšie. Ale demo nie je nasadenie. A benchmark z model card nie je záruka, že vám agent nezavolá tisíc zákazníkov s nezmyslom. Zoberte V4-Flash ako vážneho kandidáta do produkčného testu. Nie ako dôkaz, že dátové centrum už netreba.

Časté otázky

Čo znamená MoE architektúra a prečo je pri DeepSeek V4-Flash dôležitá?

MoE (Mixture of Experts) je architektúra, pri ktorej sa z celkových parametrov modelu na spracovanie každého tokenu aktivuje len časť. DeepSeek V4-Flash má 284 miliárd parametrov, no na token používa iba 13 miliárd aktívnych. Vďaka tomu je lacnejší na inference než väčší V4-Pro, ktorý má 1,6 bilióna parametrov so 49 miliardami aktívnych.

Prečo skočilo skóre na DeepSWE zo 7,3 na 54,4? Nie je to podozrivé?

Áno, zaslúži si to triezvy pohľad. Také nízke východiskové skóre zvyčajne znamená, že preview verzia mala v danej úlohe systémový problém, nie že model odrazu pochopil programovanie. Skôr než sa spoľahnete na jedno číslo, čítajte benchmark v kontexte a overte si, čo presne meria a ako sa zbieral.

Ako je možné zlepšiť skóre bez pridania parametrov?

DeepSeek podľa changelogu model iba znova post-trénoval: „only re-post-trained". Nešlo o väčší tréningový beh ani nové váhy, len o iný záverečný tréning na tých istých parametroch. Ide o rovnakú MoE architektúru a rovnakú veľkosť ako pri preview verzii; zmenil sa spôsob, akým bol model doladený na agentné a kódovacie úlohy.

Ako si V4-Flash stojí oproti konkurencii ako Opus 4.8?

Na benchmarku Terminal Bench 2.1 dosiahol V4-Flash-0731 hodnotu 82,7, kým referenčný Opus-4.8 má podľa TechTimes 85,0. Rozdiel je teda malý napriek tomu, že Flash je výrazne menší a lacnejší model. Podľa TechTimes zároveň prekonáva väčší V4-Pro preview v deviatich agentných benchmarkoch.

Oplatí sa nasadiť lacnejší Flash namiesto väčšieho V4-Pro?

Závisí od úlohy. Flash naháňa vlajkovú loď v agentných a kódovacích benchmarkoch pri zlomku aktívnych parametrov, čo znižuje inference náklady. Skôr ako sa rozhodnete, otestujte oba modely na vlastných dátach a úlohách; benchmarkové skóre neprenesie automaticky do produkcie a rozdiely medzi demom a reálnou prevádzkou bývajú výrazné.

Ide o finálnu verziu, alebo sa ešte niečo zmení?

DeepSeek vydal V4-Flash-0731 ako verejnú beta verziu 31. júla 2026, nie ako finálny build. To znamená, že sa môžu meniť skóre aj správanie modelu pred stabilným vydaním. Kto plánuje produkčné nasadenie, mal by počítať s tým, že beta verzia sa ešte môže vyvíjať, a sledovať ďalšie changelogy.

0 komentárov
Zdieľať

Diskusia

Komentáre sú pred zverejnením moderované.

Zatiaľ tu nie sú žiadne komentáre. Buďte prvý.