Preskočiť na obsah
Nástroje & modely

GPT-5.6: ktorý frontier model nasadiť vo firme

Triezvy prehľad cien za tokeny a odporúčaní pre GPT-5.6, Gemini 3.5 Pro, Grok 4.5 a Kimi K3.

Juraj BudaiJuraj Budai4 min čítania
GPT-5.6: ktorý frontier model nasadiť vo firme
GPT-5.6: ktorý frontier model nasadiť vo firme

Ak sa dnes rozhodujete, ktorý frontier model postaviť pod firemnú aplikáciu, krátka odpoveď znie: na bežnú znalostnú prácu vám stačí najlacnejší variant, drahé reasoningSchopnosť modelu riešiť úlohu vo viacerých krokoch uvažovania; drahšia a pomalšia, no presnejšia pri zložitých zadaniach. modely nasadzujte len tam, kde chyba stojí peniaze. GPT-5.6 vyšiel 9. júla v troch cenových hladinách, Gemini 3.5 Pro ponúka najväčšie kontextové oknoMnožstvo textu, ktoré model naraz udrží v pamäti pri jednom dopyte, merané v tokenoch. a Kimi K3 je prvý čínsky open-weightModel, ktorého váhy sú verejne dostupné, takže sa dá prevádzkovať na vlastnom hardvéri bez volania externého API. model, ktorý na niektorých benchmarkoch predbehol Anthropic Opus 4.8. Rozdiel v cene medzi nimi je až tridsaťnásobný, takže výber modelu je najprv rozpočtová a až potom technická otázka.

Aké modely vyšli za posledných deväť dní?

Za deväť dní vyšli štyri modely od štyroch dodávateľov. OpenAI sprístupnilo GPT-5.6 širokej verejnosti 9. júla, xAI Grok 4.5 o deň skôr, Google posunulo Gemini 3.5 Pro do všeobecnej dostupnosti 17. júla a Moonshot uvoľnilo Kimi K3 rovnaký víkend. Každý mieri na iný segment.

  • GPT-5.6 (OpenAI, 9. júla): tri varianty Sol (5/30 USD), Terra (2,50/15 USD) a Luna (1/6 USD) za milión vstupných a výstupných tokenov, kontext 1,05 milióna tokenov, podľa Axios a OpenAI.
  • Grok 4.5 (xAI, 8. júla): 2/6 USD za milión tokenov, pozíciovaný ako ťažný kôň pre rutinnú znalostnú prácu, podľa TechCrunch a Axios.
  • Gemini 3.5 Pro (Google, 17. júla): kontext 2 milióny tokenov, vrstva Deep Think na uvažovanie, cena okolo 1,25 USD za milión vstupných tokenov po kompletnej prestavbe architektúry.
  • Kimi K3 (Moonshot, 17. júla): 2,8 bilióna parametrov, open-weight, API cena 3 USD vstup, 0,30 USD za cachované vstupné tokeny a 15 USD výstup za milión tokenov, podľa Gizmochina.

Koľko naozaj stojí GPT-5.6 a jeho konkurencia?

Cena za tokeny je pri objemovom nasadení dôležitejšia než benchmark. Rozdiel medzi variantom Luna GPT-5.6 (1/6 USD) a variantom Sol (5/30 USD) je päťnásobný na vstupe aj na výstupe. Pri milióne dopytov mesačne sa z toho stanú desiatky tisíc eur ročne, takže o rozpočte rozhoduje voľba variantu viac než voľba dodávateľa.

V praxi si vediem jednoduchý výpočet: priemerná dĺžka promptu a odpovede krát mesačný objem dopytov krát cena za tokeny. Keď to porovnám naprieč modelmi, drahý reasoning variant sa oplatí len na malom zlomku dopytov, kde je chyba drahá. Zvyšok odbaví najlacnejšia hladina. Ak túto kalkuláciu robíte pre celý životný cyklus projektu a stojíte pred otázkou, či model vôbec staviať vlastnými silami alebo kúpiť, oplatí sa prejsť rozhodovacou maticou vyvinúť verzus kúpiť s reálnymi nákladmi AI zámeru, ktorá pomáha oddeliť cenu tokenov od skrytých nákladov na prevádzku a ľudí. Nie je to pre tímy, ktoré len testujú prototyp; má zmysel, keď už viete, že projekt pôjde do produkcie a rozhoduje predstavenstvo.

Ktorý model je najlacnejší na výstupný token?

Podľa uvedených cien je najlacnejší variant Luna GPT-5.6 so 6 USD za milión výstupných tokenov, tesne za ním Grok 4.5 so 6 USD a Gemini 3.5 Pro s najnižším vstupom okolo 1,25 USD. Kimi K3 a Terra GPT-5.6 sedia na 15 USD za výstup, čo je násobne drahšie. Pri objemových úlohách je teda výstupná cena rozhodujúce kritérium.

Cena za milión výstupných tokenovUSD za 1M výstupných tokenov, API
6 GPT-5.6 Luna 6 Grok 4.5 10 Gemini 3.5 Pro 15 GPT-5.6 Terra 15 Kimi K3 30 GPT-5.6 Sol

Zmenil Kimi K3 rovnicu pre open-weight modely?

Áno, a to konkrétnym spôsobom: Artificial Analysis a Arena.ai nezávisle umiestnili Kimi K3 pred Anthropic Opus 4.8 na niektorých frontier benchmarkoch. Podľa jedného prehľadu sa dostal na 3. miesto v Artificial Analysis Intelligence Index so skóre 57, tento údaj sa však opiera len o sekundárne články, nie o priamo citovaný pôvodný report, takže ho beriem s rezervou.

Model má 2,8 bilióna parametrov a kontext milión tokenov. Moonshot ho vo vlastnom blogu opisuje ako prvý otvorený model triedy 3T určený na dlhé kódovanie, knowledge work a uvažovanie. Plné open weights mali byť podľa Gigazine uvoľnené 27. júla. Diskusia o tom, či čínske modely stoja len na destilácii z amerických lídrov, začína strácať pôdu: GPT-5.6 a Fable 5 vyšli len pár dní pred K3, takže na jeho tréning ich prakticky nemohol nikto použiť. Čo to znamená pre firmy v EÚ, som rozobral v samostatnom článku o Kimi K3 a firemnom nasadení.

Ktorý model nasadiť pre aké firemné použitie?

Odpoveď závisí od toho, čo úloha znesie za chybu a koľko dopytov spracujete. Pre drvivú väčšinu firemných scenárov (klasifikácia, sumarizácia, jednoduchá extrakcia) postačí najlacnejší variant. Reasoning vrstvy si nechajte na úzko vymedzené prípady.

  • Vysoký objem, nízke riziko chyby (triedenie e-mailov, sumarizácie): Luna GPT-5.6 alebo Grok 4.5. Cena rozhoduje, kvalita najlacnejšej hladiny je dostatočná.
  • Dlhé dokumenty a analýza celých spisov: Gemini 3.5 Pro pre dvojmiliónový kontext, ktorý zvládne materiály, na ktoré ostatné modely nedosiahnu bez delenia.
  • Náročné uvažovanie, kde chyba stojí peniaze: Sol GPT-5.6 alebo Gemini 3.5 Pro s Deep Think, ale len na tú časť dopytov, ktorá to naozaj vyžaduje.
  • Citlivosť na dáta a potreba self-hostingu: Kimi K3 ako open-weight možnosť, ak máte na jeho prevádzku hardvér a tím. Pre bežnú firmu to väčšinou nevyjde lacnejšie než API.

Pri každom modeli platí jedno pravidlo, ktoré si overujeme v prevádzke skôr než na benchmarkoch: nasadenie musí prejsť testom na vašich reálnych dátach. Benchmarky merajú niečo iné než vaše dopyty. Ukázalo sa to napríklad na tom, ako úspešnosť modelov na reálnych pracovných úlohách klesá pod 25 percent, aj keď na testoch žiaria. Preto webové vyhľadávanie a halucinácie testujte samostatne, ako sme to museli robiť pri GLM 5.2.

Čo z tohto prehľadu odporúčam v praxi?

Začnite najlacnejším variantom a k drahšiemu modelu prejdite až vtedy, keď vám dáta ukážu konkrétnu úlohu, pri ktorej to za vyššiu cenu stojí. GPT-5.6 Luna alebo Grok 4.5 pokryjú väčšinu bežnej práce. Po Gemini 3.5 Pro siahnite pri dlhých kontextoch. Kimi K3 zvažujte, len ak máte reálny dôvod na self-hosting a tím, ktorý ho uživí.

Nevyberajte model podľa benchmarku, ale podľa toho, koľko vás bude stáť pri vašom objeme a čo sa stane, keď sa raz za čas pomýli. Tento jeden princíp mi ušetril viac problémov než ladenie promptov.

Časté otázky

Kedy sa oplatí siahnuť po drahšom reasoning modeli?

Drahý reasoning model nasadzujte len tam, kde chyba priamo stojí peniaze: finančné výpočty, právne rozbory, kritické rozhodnutia. Na bežnú znalostnú prácu, sumarizácie či prvý draft textu stačí najlacnejší variant. Keďže rozdiel v cene medzi modelmi je až tridsaťnásobný, oplatí sa reasoning zapínať cielene, nie plošne pre celú aplikáciu.

Oplatí sa čínsky Kimi K3 pre firmu v EÚ?

Kimi K3 je open-weight a na niektorých benchmarkoch predbehol Anthropic Opus 4.8, takže cenovo aj výkonom je zaujímavý. Pre firmy v EÚ však treba zvážiť, kde model beží a ako sa nakladá s údajmi; open-weight variant si viete hostovať sami. API stojí 3 USD za vstup a 15 USD za výstup na milión tokenov.

Ktorý model má najväčšie kontextové okno?

Najväčšie kontextové okno ponúka Gemini 3.5 Pro s 2 miliónmi tokenov, po kompletnej prestavbe architektúry a s vrstvou Deep Think na uvažovanie. GPT-5.6 zvláda 1,05 milióna tokenov. Veľké okno má zmysel pri práci s dlhými dokumentmi či rozsiahlym kódom naraz, no pri bežných dopytoch ho väčšinou nevyužijete.

Ako si spočítať reálne mesačné náklady?

Vynásobte počet dopytov priemerným počtom vstupných a výstupných tokenov na dopyt a prenásobte cenou modelu. Pri milióne dopytov mesačne sa päťnásobný rozdiel medzi variantom Luna (1/6 USD) a Sol (5/30 USD) GPT-5.6 premení na výrazné sumy. Preto je výber modelu najprv rozpočtová a až potom technická otázka.

Je Grok 4.5 dobrá voľba na rutinnú prácu?

Grok 4.5 od xAI vyšiel 8. júla a je pozíciovaný priamo ako ťažný kôň pre rutinnú znalostnú prácu, s cenou 2/6 USD za milión tokenov. To ho radí medzi lacnejšie varianty. Ak nepotrebujete najväčšie kontextové okno ani špičkový reasoning, na bežné firemné úlohy je rozumnou možnosťou.

Ako obmedziť halucinácie pri nasadení modelu?

Pri objemovom nasadení sa halucináciám nevyhnete úplne, preto pri kritických výstupoch pridajte overovaciu vrstvu alebo web search a výsledky nechajte skontrolovať. Lacnejší model kombinovaný s kontrolou býva výhodnejší než slepá dôvera v drahý reasoning. Testujte model na vlastných dátach ešte pred spustením do produkcie.

0 komentárov
Zdieľať

Diskusia

Komentáre sú pred zverejnením moderované.

Zatiaľ tu nie sú žiadne komentáre. Buďte prvý.