Preskočiť na obsah
Nástroje & modely

Claude Opus 5: špičkový výkon za cenu Opus 4.8

Nový model Anthropic sľubuje takmer fable-úroveň v agentovom kódovaní bez navýšenia ceny za token. Rozoberáme, čo z toho firmy reálne získajú a kde číhajú háčiky.

Juraj BudaiJuraj Budai4 min čítania
Claude Opus 5: špičkový výkon za cenu Opus 4.8
Claude Opus 5: špičkový výkon za cenu Opus 4.8

Claude Opus 5 je nový špičkový model Anthropic, ktorý za rovnakú cenu ako predchádzajúci Opus 4.8 dodáva viac než dvojnásobný výkon v agentovom kódovaní. Cena zostala na 5 USD za milión vstupných a 25 USD za milión výstupných tokenov, no na kľúčových benchmarkoch sa model približuje vlajkovému Fable 5. Pre firmy to znamená jednoduchú matematiku: viac dokončených úloh za rovnaký rozpočet.

Anthropic predstavil model 24. júla 2026 v oficiálnom oznámení a označil ho za model na každodenné nasadenie, ktorý sa výkonom blíži k Fable 5 zhruba za polovicu jeho ceny na úlohu. Je to iný typ správy než väčšina uvedení: cena sa nezvýšila, zvýšil sa výstup.

Čo Claude Opus 5 mení oproti Opus 4.8

Najväčšia zmena nie je v cenníku, ale v tom, koľko práce za tú istú sumu dostanete. Na Frontier-Bench, teste terminálového a agentového kódovania, dosahuje Opus 5 43,3 percenta oproti 21,1 percenta pri Opus 4.8. Skóre sa teda viac než zdvojnásobilo pri nižších nákladoch na úlohu.

Konkrétne čísla z oficiálnych benchmarkov Anthropic a nezávislých rozborov:

  • SWE-bench Verified: 72,4 percenta autonómne vyriešených reálnych bugov v repozitároch, o takmer 15 percentuálnych bodov viac než predchádzajúci líder trhu, ako uvádza analýza Jarvis AI.
  • CursorBench 3.2: pri maximálnom efforte je výkon len 0,5 percenta pod Fable 5, no za polovičnú cenu na úlohu.
  • OSWorld 2.0: model prekonáva najlepší výsledok Fable 5 pri asi tretine jeho nákladov.
  • ARC-AGI 3: skóre trojnásobné oproti ďalšiemu najlepšiemu modelu.

K tomu GPQA na 68,9 percenta bez externých nástrojov a MATH-500 na 94,2 percenta. Kto sleduje trajektóriu modelov Anthropic, vidí posun, ktorý nie je kozmetický.

Frontier-Bench: Opus 5 vs Opus 4.8% úspešnosť, terminálové a agentové kódovanie
Opus 5
43.3
Opus 4.8
21.1

Ceny a ekonomika: rovnaký cenník, viac výstupu

Opus 5 stojí presne toľko čo Opus 4.8, teda 5 USD za milión vstupných tokenov a 25 USD za milión výstupných; potvrdzuje to DevStock Academy. Oproti Fable 5 zostáva model pod cenou, no dodáva takmer porovnateľný výsledok. Anthropic hovorí o frontier inteligencii pri polovičnej cene, čo potvrdzuje aj MacRumors.

Pre firmu, ktorá už dnes stavia agentov na kódovanie alebo DevOps, je záver jasný. Ak ste beh na Opus 4.8 platili z fixného rozpočtu, prepnutie na Opus 5 vám ho nenavýši, ale zvýši podiel úloh, ktoré agent dotiahne do konca. Na Zapier AutomationBench, teste business procesov od začiatku do konca, uvádza Anthropic približne 1,5-násobne vyšší pass rate než najbližší konkurent pri rovnakej cene na úlohu.

Práve tu sa oplatí spomaliť. Benchmark nie je produkcia. Rozhodnutie prepnúť model nie je len zmena reťazca v konfigurácii, je to rozhodnutie o tom, kto ráno rieši situáciu, keď agent v noci spravil desať krokov namiesto troch. Ak vediete tím, ktorý má AI dostať zo štádia prototypu do spoľahlivého behu, oplatí sa mať premyslené QA a architektúru kontextu skôr, než sa model dostane k reálnym dátam; presne na to je zameraný dvojdňový workshop pre CTO a vedúcich vývoja o vedení AI inžinierskych tímov, ktorý stavia na RAG v produkcii, QA AI systémov a rozpočtoch. Nie je pre tých, čo hľadajú teóriu bez nasadenia.

Kontextové okno a práca s veľkými codebase

Podľa technických rozborov je jedným z hlavných lákadiel rozšírené kontextové oknoMnožstvo textu, ktoré model dokáže naraz udržať v pamäti. Väčšie okno umožňuje spracovať celú codebase alebo rozsiahly dokument bez delenia.. Základný režim zvláda až 2 milióny tokenov, čo je zhruba 1,5 milióna slov, podnikový režim až 4 milióny. V teste typu Needle in a Haystack dosiahol model 100-percentnú úspešnosť aj pri plnej kapacite, teda spoľahlivo našiel informáciu v obrovskom texte, uvádza Jarvis AI.

Prakticky to znamená, že modelu podsuniete celú codebase, internú wiki či regulačný manuál naraz, bez rozsekávania na stovky menších promptov. A keďže cena za tokenZákladná jednotka textu, ktorú model spracúva. Cena za používanie sa počíta za milióny vstupných a výstupných tokenov. zostala na úrovni Opus 4.8, tento luxus vás nestojí viac. Pri architektúre agentov, ktorí ťahajú kontext z viacerých zdrojov, sa oplatí poznať, ako spoľahlivo napojiť AI na kód a dáta cez MCP server.

Háčiky pri prepínaní: halucinácie a nerovnomerný výkon

Vyšší výkon má cenu, ktorá sa neplatí v dolároch. Kritická recenzia VibeCoding opisuje Opus 5 ako najchytrejší model, ktorý si zároveň najviac vymýšľa, a upozorňuje na nárast sofistikovaných halucinácií pri dlhých komplexných úlohách. Model dokáže vygenerovať presvedčivo znejúce, no nesprávne riešenie.

Druhý háčik je nerovnomernosť. Analýza TECHSY uvádza, že hoci Opus 5 vedie vo väčšine zverejnených benchmarkov, v niektorých testoch kódovania, práva a vedy zaostáva. Vysoké priemerné skóre neznamená rovnaký výkon v každej doméne.

Čo z toho vyplýva pre nasadenie:

  1. Znova otestujte existujúcich agentov. Opus 5 mení profil správania, robí viac krokov s väčšou autonómiou. Agent naladený na Opus 4.8 sa môže správať inak.
  2. Dolaďte prompty a guardrailsOchranné pravidlá a obmedzenia, ktoré usmerňujú, čo model smie a nesmie urobiť, aby výstup zostal bezpečný a spoľahlivý.. Model má inú osobnosť, staré inštrukcie nemusia sedieť.
  3. Doplňte verifikáciu. Automatické testy, statická analýza a ľudský review sú poistkou proti sofistikovaným halucináciám.
  4. Upravte limity effortu. Vyššie nastavenia zmysluplne zvyšujú úspešnosť, no bez stropu prepálite rozpočet.

Kto stavia produkčného agenta a chce vedieť, ako architektúra kontextu a pamäťové komponenty držia pod záťažou, nájde odpovede v dvojdňovom workshope o produkčnej AI, RAG a agentových architektúrach, ktorý rieši aj zaradenie poskytovateľ verzus nasadzovateľ podľa AI Act.

Kedy sa oplatí prepnúť a kedy počkať

Ak beháte kódovacích alebo automatizačných agentov na Opus 4.8, prepnutie na Opus 5 je z pohľadu ekonomiky takmer bez debaty: rovnaká cena, viac hotovej práce. Ak dnes platíte za Fable 5 pre high-end kódovanie a PC automatizáciu, Opus 5 dosahuje veľmi podobné výsledky za približne polovicu ceny na úlohu, čo z neho robí kandidáta na náhradu v časti úloh.

Kde by som netlačil na plyn: pri kreatívnych a exploratívnych workflow, kde je vyššia miera halucinácií najviditeľnejšia, a v doménach, kde model podľa TECHSY zaostáva. Tam sa oplatí najprv malý pilot s tvrdou verifikáciou. Detailné porovnanie nákladov nájdete v našej analýze Opus 5 vs Fable 5: čo modely stoja a kedy sa oplatia.

Lepší benchmark neznamená lepší nočný spánok. Model, ktorý spraví viac krokov sám, spraví aj viac chýb sám. Prepnite ho, ale nechajte pri ňom niekoho na review.

Časté otázky

Aké je kontextové okno Claude Opus 5?

Presné parametre kontextového okna Anthropic v oznámení z 24. júla 2026 podľa dostupných údajov nešpecifikoval nad rámec pozíciovania modelu ako nástroja na každodenné nasadenie. Ak plánujete spracúvať rozsiahle repozitáre alebo dlhé dokumenty, overte si aktuálne limity priamo v oficiálnej dokumentácii Anthropic pred nasadením do produkcie.

Oplatí sa prejsť z Opus 4.8 na Opus 5?

Áno, pri agentovom kódovaní jednoznačne. Cena zostala rovnaká, teda 5 USD za milión vstupných a 25 USD za milión výstupných tokenov, no na Frontier-Bench dosahuje Opus 5 43,3 percenta oproti 21,1 percenta pri Opus 4.8. Za identický rozpočet teda dostanete viac než dvojnásobný výkon a viac dokončených úloh.

Kedy má zmysel siahnuť po Fable 5 namiesto Opus 5?

Na CursorBench 3.2 zaostáva Opus 5 za Fable 5 len o 0,5 percenta, pritom za polovičnú cenu na úlohu; na OSWorld 2.0 dokonca Fable 5 prekonáva pri asi tretine nákladov. Fable 5 zvážte len pri úlohách, kde tá minimálna prevaha rozhoduje a rozpočet nie je limitom.

Ako spoľahlivo napojiť Opus 5 na náš kód a dáta?

Na produkčné nasadenie potrebujete model prepojiť s repozitármi, databázami a internými nástrojmi. Používa sa na to protokol MCP, ktorý štandardizuje prístup agentov k externým zdrojom. Pri agentovom kódovaní je práve kvalita tohto napojenia rozhodujúca pre to, koľko bugov model vyrieší autonómne.

Čo znamená 72,4 percenta na SWE-bench Verified v praxi?

SWE-bench Verified meria, koľko reálnych bugov v repozitároch model vyrieši úplne autonómne. Opus 5 vyriešil 72,4 percenta, čo je podľa analýzy Jarvis AI o takmer 15 percentuálnych bodov viac než predchádzajúci líder trhu. Znamená to menej ručných zásahov, no zvyšných zhruba 28 percentách stále potrebujete človeka.

Ako zaviesť Opus 5 do inžinierskeho tímu bez chaosu?

Vyšší výkon za rovnakú cenu sám osebe efektivitu nezaručí. Kľúčové je nastaviť, kde model rieši úlohy autonómne a kde tím kontroluje výstup, najmä pri tých zhruba 28 percentách bugov, ktoré SWE-bench nechal nevyriešené. Osvedčené postupy vedenia tímov s podporou AI pomáhajú vyhnúť sa slepému spoliehaniu na skóre z benchmarkov.

0 komentárov
Zdieľať

Diskusia

Komentáre sú pred zverejnením moderované.

Zatiaľ tu nie sú žiadne komentáre. Buďte prvý.