Preskočiť na obsah
Nástroje & modely

Kimi K3 a GLM 5.2: benchmarky verzus produkcia

Dva čínske open-weight modely dobiehajú americkú špičku v testoch. Otázkou zostáva, či to platí aj mimo tabuliek.

Pavol KostolanskýPavol Kostolanský5 min čítania
Kimi K3 a GLM 5.2: benchmarky verzus produkcia
Kimi K3 a GLM 5.2: benchmarky verzus produkcia

Krátka odpoveď: Kimi K3 a GLM 5.2 sú v kóderských a agentných benchmarkoch tesne pod výkonom najlepších amerických uzavretých modelov a v niektorých testoch ich dobiehajú. Obidva sú dostupné ako open-weightModel, ktorého váhy sú verejne dostupné na stiahnutie a spustenie na vlastnej infraštruktúre. Na rozdiel od uzavretých modelov ho možno self-hostovať a dolaďovať. modely pod licenciou blízkou MIT. Zatiaľ chýbajú nezávislé dôkazy, že to platí aj v produkcii, pri reálnej záťaži, zákazníkoch a zodpovednosti.

Dva dni po sprístupnení váh Kimi K3 sa na Reddite objavila otázka, ktorú si kladie každý, kto tieto modely sleduje: používa ich už niekto naozaj na ťažkú prácu, alebo sú len vyladené na tabuľky? Odpoveď je nepríjemne úprimná. Dáta, ktoré máme, sú takmer výlučne benchmarkové, licenčné a cenové. Prevádzková spoľahlivosť je zatiaľ prázdne miesto.

Čo je Kimi K3 a prečo o ňom hovorí Silicon Valley

Kimi K3 je tretia generácia vlajkového jazykového modelu čínskeho startupu Moonshot AI. Model bol uvedený 16. júla 2026 na konferencii WAIC v Šanghaji a jeho kompletné váhy boli sprístupnené 27. júla 2026. S 2,8 bilióna parametrov ho technické prehľady označujú za najväčší open-weight model v čase vydania.

Architektonicky ide o sparse MoEMixture of Experts. Architektúra, ktorá má veľa čiastkových sietí (expertov), no pri každom výpočte aktivuje len zopár z nich, čím šetrí výpočtový výkon. model s názvom Stable LatentMoE: má 896 expertov, no pri jednom prechode sa aktivuje len 16 z nich. To znižuje výpočtový výkon potrebný na inferenciu bez toho, aby model prišiel o kapacitu, ktorú mu dáva obrovský počet parametrov. Licencia sa popisuje ako MIT alebo mierne upravená MIT, teda komerčné použitie, úpravy aj self-hostingPrevádzka modelu na vlastných serveroch namiesto cez API dodávateľa. Dáva kontrolu nad údajmi, ale prináša náklady na hardvér a prevádzku. sú povolené.

Prečo to rozochvelo americké prostredie, sme popísali už skôr v texte o tom, ako Kimi K3 rozvíril debatu v Silicon Valley. Axios 27. júla napísal, že tlak na open-source AI môže skomplikovať život rizikovému kapitálu, a ako katalyzátor menoval práve prekvapivý prielom Moonshotu.

Čo hovoria benchmarky Kimi K3

Kimi K3 dosahuje na kóderských a agentných testoch čísla, ktoré ho radia tesne pod americkú špičku. Podľa zberného prehľadu benchmarkov dosiahol 76,8 % na SWE-bench Verified, 88,3 na Terminal-Bench 2.1, 91,2 % na agentnom teste BrowseComp a 93,5 % na GPQA Diamond.

Zaujímavejšie sú porovnania na praktickejších úlohách. Český web Vibecoding.cz otestoval K3 proti modelom Fable 5, Opus 4.8 a GPT-5.6 Sol na sade GDPval-AA v2, ktorá pokrýva 44 profesijných oblastí. Výsledky v Elo:

  • GDPval-AA v2: Kimi K3 dosiahol 1687, Fable 5 mal 1760, GPT-5.6 Sol 1748.
  • AA-Briefcase (dlhá agentná znalostná práca): Kimi K3 dosiahol 1527, čím prekonal GPT-5.6 Sol s 1495, no zaostal za Fable 5 s 1587.

Obraz je konzistentný. K3 je tesne za americkou špičkou na komplexných profesijných úlohách a v niektorých agentných testoch ju dobieha alebo prekonáva. Financial Times, citovaný cez český portál Newstream, dokonca naznačuje, že Kimi K3 môže v hlavných benchmarkoch prekonať Opus 4.8, pričom Moonshot ho otvorene cieli ako model, ktorý má prekonať Anthropic.

Kimi K3 verzus americká špička (GDPval-AA v2)Elo skóre, 44 profesijných oblastí
1760 Fable 5 1748 GPT-5.6 Sol 1687 Kimi K3

GLM 5.2: lacnejšia a praktickejšia voľba

GLM 5.2 od firmy Zhipu AI je menší, lacnejší a dnes okamžite nasaditeľný. Model má okolo 744 až 753 miliárd parametrov, pričom na každý tokenZákladná jednotka textu, ktorú model spracúva. Ceny za používanie modelov sa počítajú za milióny tokenov na vstupe a výstupe. je aktívnych zhruba 40 miliárd. Váhy sú od júna 2026 dostupné na Hugging Face pod MIT licenciou bez regionálnych obmedzení, takže self-hosting a fine-tuning sú otvorené už teraz.

Na jedinom teste, kde boli obidva modely hodnotené na rovnakom rámci (Terminal-Bench), sú výsledky blízko seba. Podľa porovnania na Emergent.sh dosiahol Kimi K3 80,9 a GLM 5.2 81,0. Iné zdroje uvádzajú mierne vedenie K3 (88,3 proti 82,7), čo ukazuje, ako veľmi výsledok závisí od konkrétneho testovacieho nastavenia. To je prvé varovanie pre každého, kto benchmarky číta doslova.

Kde sa modely líšia jednoznačne, je cena. Podľa porovnania na CIAD.cz stojí spracovanie milióna tokenov cez API u Kimi K3 zhruba 6 USD, u GLM 5.2 len 2,15 USD. Pri objemoch, ktoré v produkcii vznikajú za týždeň, ide o rozdiel, ktorý rozhoduje.

Prečo benchmark nie je nasadenie

Toto je jadro celej veci. Všetky verejné dáta po 27. júli 2026 sú benchmarky, licencie a ceny. Systematické, nezávislé správy o tom, či priemyselné tímy v USA alebo Európe už tieto modely používajú na ťažkú produkčnú prácu, sa neobjavujú. Autori porovnaní to hovoria otvorene: modely sú výkonné a otvorené, ale ich odolnosť v produkcii ešte nikto nezdokumentoval.

Z vlastných nasadení viem, čo sa deje medzi tabuľkou a produkciou. Model, ktorý na SWE-bench žiari, vám v reálnom workflow padá na okrajových prípadoch, ktoré benchmarkŠtandardizovaný test, ktorý meria výkon modelu na vopred danej sade úloh. Výsledok silno závisí od konkrétneho testovacieho nastavenia. nemá. Latencia pri špičke, stabilita výstupu pri tisícoch volaní za hodinu, správanie agenta, keď narazí na nečakaný stav. To testovacia sada nezachytí.

Demo nie je nasadenie.

Práve tu je najostrejšia hrana rozhodnutia vyvinúť verzus kúpiť. Open-weight model za MIT licenciu vyzerá ako úspora, kým nezrátate náklady na self-hosting, monitoring a ladenie za celý životný cyklus. Ak toto rozhodnutie stojí pred vaším vedením, oplatí sa mať v ruke rozhodovaciu maticu skôr než faktúru za GPU. Presne na to je zameraný workshop o investičnom rozhodnutí vyvinúť verzus kúpiť pre predstavenstvo, ktorý vedú inžinieri, čo takéto rozhodnutia robili na oboch stranách stola. Nie je pre firmy, ktoré chcú len otestovať chatbota; má zmysel tam, kde ide o AI zámer za stovky tisíc eur.

Čo to znamená pre firmu v EÚ

Pre európsku firmu je open-weight čínsky model dvojsečná vec. MIT licencia a self-hosting znamenajú, že údaje neopúšťajú vašu infraštruktúru a nie ste závislí od jedného amerického dodávateľa. To je z pohľadu ochrany údajov aj vendor rizika reálna výhoda. Regulačný kontext ju však komplikuje.

Dario Amodei z Anthropicu podľa Bloombergu odmieta plošný zákaz open-weight modelov, no žiada ich dôkladné testovanie. TechCrunch cituje, že sa nestavia proti open-weight modelom, ale obáva sa rýchleho rastu čínskej AI. Podobne varuje aj Jensen Huang z Nvidie pred unáhleným americkým zásahom.

Pre nasadzovateľa v EÚ z toho plynú dva praktické body. Po prvé, podľa AI Act sa mení vaše postavenie: keď model iba používate, ste v inej role než keď ho výrazne dolaďujete a dávate na trh. Po druhé, geopolitika môže cez sankcie alebo exportné pravidlá zasiahnuť dostupnosť modelu, na ktorom postavíte produkt. Túto vrstvu sme rozobrali v texte o tom, čo open-weight modely znamenajú pre EÚ.

Reálna alternatíva, ktorú treba overiť

Sú Kimi K3 a GLM 5.2 plnohodnotnou náhradou za americké frontier modely? V benchmarkoch sú blízko. V produkcii to zatiaľ nikto nezávisle nepotvrdil. Toto nie je slabina modelov, je to stav dôkazov. Pre praktické rozhodnutie dnes to znamená konkrétny postup:

  • Ak potrebujete lacný, dnes nasaditeľný model: GLM 5.2 s cenou 2,15 USD za milión tokenov a MIT váhami je pragmatická voľba.
  • Ak potrebujete maximálny výkon v agentných úlohách: Kimi K3 vedie, ale za vyššiu cenu a s väčšími nárokmi na hardvér.
  • V oboch prípadoch: otestujte model na vlastných dátach a vlastnom workflow, nie na cudzej tabuľke.

Otázka z Redditu, či ide o benchmark-maximalizáciu alebo o skutočnú vec, tak zostáva otvorená. A bude otvorená dovtedy, kým prvé firmy nezverejnia, čo sa stalo, keď tieto modely nechali bežať bez dozoru, vo veľkom, s reálnymi zákazníkmi. Prvý taký report bude cennejší než všetkých osem benchmarkov dokopy.

Časté otázky

Oplatí sa nasadiť Kimi K3 alebo GLM 5.2 do produkcie už teraz?

Zatiaľ opatrne. Obidva modely sú v kóderských a agentných benchmarkoch tesne pod špičkovými americkými uzavretými modelmi, no chýbajú nezávislé dôkazy o prevádzkovej spoľahlivosti pri reálnej záťaži, zákazníkoch a zodpovednosti. Pred ostrým nasadením odporúčame vlastné testy na konkrétnych úlohách a záložný scenár, ak model v produkcii sklame.

Čo znamená licencia blízka MIT pre komerčné využitie?

Licencia MIT alebo jej mierne upravená verzia povoľuje komerčné použitie, úpravy modelu aj self-hosting. Firma teda môže Kimi K3 spustiť na vlastnej infraštruktúre a doladiť ho pre svoje potreby bez licenčných poplatkov za prístup. Vždy si však overte presné znenie licencie, keďže „mierne upravená

Prečo má Kimi K3 2,8 bilióna parametrov, no potrebuje menší výpočtový výkon?

Ide o sparse MoE architektúru nazvanú Stable LatentMoE. Model má 896 expertov, ale pri jednom prechode sa aktivuje len 16 z nich. Vďaka tomu si zachováva kapacitu obrovského počtu parametrov, no na inferenciu spotrebuje výrazne menej výpočtového výkonu, než by zodpovedalo jeho celkovej veľkosti.

Aký je rozdiel medzi dobrým výsledkom v benchmarku a spoľahlivosťou v produkcii?

Benchmark meria výkon na vopred definovaných testoch, ktoré sa dajú aj cielene vyladiť. Produkcia znamená nepredvídateľné vstupy od reálnych používateľov, dlhodobú stabilitu, latenciu a zodpovednosť za výstupy. Pri Kimi K3 a GLM 5.2 máme zatiaľ takmer výlučne benchmarkové, licenčné a cenové dáta; prevádzková spoľahlivosť je otvorená otázka.

Ako sa tieto open-weight modely porovnávajú s americkými uzavretými modelmi?

V kóderských a agentných benchmarkoch sú Kimi K3 aj GLM 5.2 tesne pod výkonom najlepších amerických uzavretých modelov a v niektorých testoch ich dobiehajú. Kľúčový rozdiel je v dostupnosti: čínske modely sú open-weight so self-hostingom, zatiaľ čo špičkové americké modely bežia ako uzavreté služby s platbou za prístup.

Máme radšej vyvinúť vlastné riešenie na open modeloch, alebo kúpiť hotovú službu?

Závisí od záťaže, citlivosti údajov a internej odbornosti. Open-weight modely ako Kimi K3 umožňujú self-hosting a nižšie prevádzkové náklady, no prenášajú na vás zodpovednosť za spoľahlivosť a údržbu. Hotová uzavretá služba je jednoduchšia na štart. Rozhodnutie sa oplatí podložiť porovnaním nákladov a rizík na konkrétnych prípadoch použitia.

0 komentárov
Zdieľať

Diskusia

Komentáre sú pred zverejnením moderované.

Zatiaľ tu nie sú žiadne komentáre. Buďte prvý.