ARC-AGI 3 benchmark: prečo skóre bez kontextu klame
Skok z pod jedného percenta na 30 percent nespochybnil model ani ľudí, ale spôsob, akým sa čítajú čísla o AGI.

Keď na jednom benchmarku vyskočí skóre z hodnoty pod jedno percento na tridsať percent, prvá otázka neznie „aký múdry je model“, ale „čo presne sa medzitým na meraní zmenilo“. Práve o toto ide v spore okolo ARC-AGI 3 benchmarku: rozdiel medzi pôvodnými výsledkami z marca 2026 a neskoršími z júla nevznikol tým, že by modely cez noc zmúdreli, ale tým, ako bol agent nakonfigurovaný, koľko kontextu smel držať a koľko stál jeden beh.
Je to poučenie použiteľné pre každú firmu, ktorá si v tlačovej správe prečíta číslo z benchmarku a podľa neho sa rozhoduje o nákupe.
Čo je ARC-AGI 3 benchmark a prečo naň modely padali pod 1 %
ARC-AGI 3 je interaktívny benchmark?Štandardizovaný test, ktorým sa porovnáva výkon AI modelov na definovaných úlohách. Výsledok závisí od toho, ako a za akých podmienok sa meria. od ARC Prize Foundation. Meria, či agent v úplne novom prostredí bez inštrukcií dokáže sám nájsť cieľ, skúmať prostredie, učiť sa zo spätnej väzby a konať efektívne v rámci jednej session. Netestuje znalosti, ale schopnosť poradiť si s neznámym.
Pri uvedení v marci 2026 to dopadlo tvrdo. Podľa prehľadu AI Automation Global skončili všetky testované frontier modely pod jedným percentom, kým dospelí bez tréningu na benchmark tvorili baseline?Referenčná úroveň, voči ktorej sa výsledok porovnáva. Pri ARC-AGI 3 je ňou 100 % efektivita netrénovaných ľudí. 100 %:
- Gemini 3.1 Pro Preview: 0,37 %
- GPT-5.4 (High): 0,26 %
- Claude Opus 4.6: 0,25 %
- Grok-4.20 (Beta reasoning): 0,00 %
Priepasť medzi človekom a strojom tu nebola percentuálna, ale rádová. Baseline 100 % pritom neznamená „dosiahnutá všeobecná inteligencia“, len ľudskú efektivitu v daných prostrediach, ako spresňuje EmergentMind.
Ako sa skóre v júli 2026 dostalo na 30 percent
O pár mesiacov vyzerali čísla inak. GPT-5.6 Sol od OpenAI viedol podľa BenchLM s výsledkom okolo 7,8 % v konfigurácii Max effort. Následne Capital & Compute aj ExplainX uviedli verifikované skóre 30,2 % pre Claude Opus 5 (High effort) k 24. júlu 2026, pričom Opus 5 vyriešil päť verejných prostredí, ktoré predtým žiaden model neprekonal.
Tri veci sa oplatí čítať spolu s tým číslom:
- Effort level?Nastavenie, koľko výpočtu a plánovania model na úlohu dostane (napríklad High, Max). Vyšší effort zvyšuje skóre aj náklad na beh.. Výsledky sa líšia podľa toho, či beží High, Max alebo xHigh, teda koľko výpočtu a plánovania model dostane.
- Náklad. Kompletný beh GPT-5.6 Sol v Max konfigurácii stál podľa ExplainX okolo 25 100 dolárov. To nie je číslo pre bežnú prevádzku.
- Public demo verzus plný dataset. 30,2 % platí pre verejný demo set 25 prostredí. Na plnom privátnom datasete zostáva podľa Capital & Compute množstvo prístupov stále pod jedným percentom.
Capital & Compute to zhrnul presne: pokrok je „rapid in relative terms and negligible in absolute terms“, teda rýchly v relatívnom pohľade a zanedbateľný v absolútnom. Skok z pod 1 % na 30 % je na papieri obrovský. Voči ľudskej stovke stále malý.
Handicapoval benchmark agentov, alebo len ukázal ich limity
Jadro sporu: jeden populárny príspevok tvrdí, že ARC-AGI 3 zámerne nedovolil reasoning agentovi udržať kontext?Informácie, ktoré si model dokáže naraz udržať a použiť. Ak ich stráca medzi krokmi, opakovane zabúda, čo už zistil. naprieč akciami, takže model opakovane zabúdal, čo už zistil, a hodnotil sa ako ochromená verzia seba samého. Keď dostal možnosť ponechať si reasoning a komprimovať staršie kroky, tak ako fungujú reálni frontier agenti, skóre vraj vyskočilo.
Zdrojom tohto naratívu je aj vlastný text OpenAI o tom, ako dve nastavenia strojnásobili jej skóre na benchmarku. Ide o legitímny technický poznatok. Nie je to však dôkaz úmyslu.
V zdrojoch dostupných po 28. júli 2026 sa nenachádza explicitné technické priznanie ARC Prize ani OpenAI, že benchmark cielene núti agentov zabúdať, aby im znížil skóre. Opísané sú skôr obmedzenia štandardného agentického API a rozdiel medzi jednoduchšou preview konfiguráciou a neskorším high-effort behom so sofistikovaným plánovaním a kompresiou stavu. Tvrdenie o „ochromenom modeli“ je preto zatiaľ komunitná interpretácia rozdielu medzi nastaveniami, nie overený fakt.
Čo si z toho má odniesť firma v EÚ
Benchmark nie je cena, je to meracie zariadenie s vlastnými predpokladmi. Číslo bez konfigurácie je marketing. Rovnaký model dá na ARC-AGI 3 pod 1 % aj 7,8 % podľa toho, koľko pamäte, plánovania a peňazí dostane. Ak dodávateľ ukáže skóre a zamlčí effort level, náklad na beh a či ide o public demo, alebo plný dataset, chýba vám polovica vety.
Pre nákupné rozhodnutie preto platí:
- Pýtajte sa na konfiguráciu, nie len na číslo: effort level, limity kontextu, cena jedného behu.
- Rozlišujte demo od produkcie. Beh za 25 000 dolárov ukazuje strop schopností, nie prevádzkovú realitu.
- Merajte na vlastných dátach a vlastnom procese, nie na cudzom leaderboarde.
Túto lekciu sme na AI Radare rozoberali aj na konkrétnom modeli v texte o tom, ako Claude Opus 5 vyzerá v praxi verzus v deme, a všeobecnejšie v porovnaní, prečo sa benchmarky a produkčné nasadenie rozchádzajú. Vzorec je vždy rovnaký.
ARC-AGI 3 pritom robí presne to, čo má: ukazuje, kde dnešné modely v novom prostredí zlyhávajú. Spor okolo neho ukázal niečo iné. Že vieme pohnúť číslom skôr, než pohneme schopnosťou. Číslo z benchmarku nie je verdikt. Je to otázka, na ktorú si musíte dopísať podmienky.
Časté otázky
Znamená skóre 30,2 % pre Claude Opus 5, že model je zásadne múdrejší ako v marci?
Nie nutne. Rozdiel medzi hodnotami z marca a júla 2026 podľa všetkého nevznikol tým, že by modely cez noc zmúdreli, ale zmenou konfigurácie agenta: koľko kontextu smel držať a koľko stál jeden beh. Číslo bez týchto podmienok samo osebe nič nevypovedá o skutočnej schopnosti modelu.
Prečo dospelý človek dosiahol 100 %, keď modely padali pod 1 %?
Baseline 100 % neznamená dosiahnutú všeobecnú inteligenciu, len ľudskú efektivitu v daných prostrediach, ako spresňuje EmergentMind. ARC-AGI 3 testuje schopnosť poradiť si v úplne novom prostredí bez inštrukcií: skúmať, učiť sa zo spätnej väzby a konať efektívne. Práve v tejto adaptácii na neznáme mali frontier modely v marci 2026 rádový, nie percentuálny odstup.
Na čo si mám dať pozor, keď v tlačovej správe čítam číslo z benchmarku?
Zisti konfiguráciu, za ktorej výsledok vznikol: koľko kontextu agent držal, koľko behov mal a koľko stál jeden beh. Skóre „Max effort" alebo „High effort" môže byť podstatne drahšie ako bežná prevádzka. Bez týchto podmienok sa dve čísla nedajú porovnať a rozhodnutie o nákupe podľa nich klame.
Ako sa výsledok na benchmarku líši od reálnej prevádzky vo firme?
Benchmarkové skóre často vzniká v maximálnej konfigurácii, ktorá je pre bežné nasadenie drahá a pomalá. GPT-5.6 Sol viedol podľa BenchLM s výsledkom okolo 7,8 % práve v režime Max effort. V produkcii sa počíta cena aj rýchlosť, takže reálny výkon môže byť nižší, než sľubuje verejne uvádzané číslo.
Kto overuje výsledky na ARC-AGI 3 a dá sa im veriť?
ARC-AGI 3 vyvíja ARC Prize Foundation. Skóre 30,2 % pre Claude Opus 5 v režime High effort k 24. júlu 2026 uviedli Capital & Compute aj ExplainX ako verifikované; Opus 5 vyriešil päť verejných prostredí. Aj pri overenom čísle však platí, že bez uvedenej konfigurácie a nákladov nie je porovnateľné.
Znamená 30 % na ARC-AGI 3, že sa blížime k AGI?
Nie. ARC-AGI 3 meria schopnosť adaptovať sa na neznáme prostredie, nie znalosti, a 100 % je iba ľudská efektivita, nie dosiahnutá všeobecná inteligencia. Skok z hodnôt pod 1 % na 30 % je z veľkej časti otázka konfigurácie agenta, nie náhleho intelektuálneho prelomu. K AGI to samo osebe nič nedokazuje.
Diskusia
Zatiaľ tu nie sú žiadne komentáre. Buďte prvý.
Čítajte ďalej
Viac zo sekcie Nástroje & modely →
Kimi K3 a GLM 5.2: benchmarky verzus produkcia
Nové čínske open-weight modely Kimi K3 a GLM 5.2 sa v kóderských a agentných benchmarkoch tesne približujú k americkým frontier modelom. Nezávislé dôkazy o ich spoľahlivosti v reálnej produkcii však zatiaľ chýbajú.

Claude Opus 5 v praxi: demo verzus produkcia
Anthropic uviedol 24. júla 2026 Claude Opus 5, model zameraný na agentické kódovanie za cenu predchádzajúcej generácie. Virálne ukážky z komunít zatiaľ nikto nezávisle nepotvrdil, overiteľné sú cena, kontext a technické parametre.

Distilácia AI modelov: lacnejší výkon, ktorý desí giganty
Distilácia AI modelov je technika, pri ktorej sa menší model trénuje na výstupoch väčšieho a získava takmer rovnaké schopnosti za zlomok nákladov. Za pár mesiacov sa z nej stala téma číslo jeden od Silicon Valley po Washington.
Kimi K3: čínsky open model, ktorý rozochvel Silicon Valley
Moonshot AI 27. júla 2026 sprístupnil na stiahnutie váhy modelu Kimi K3 s 2,8 bilióna parametrov. Ide o prvý otvorený model triedy 3T, ktorý sa parametrami blíži uzavretým systémom typu GPT a Claude.

Claude Opus 5: špičkový výkon za cenu Opus 4.8
Anthropic uviedol Claude Opus 5 za rovnakú cenu ako Opus 4.8, no s viac než dvojnásobným výkonom v agentovom kódovaní. Pre firmy to znamená viac hotovej práce za rovnaký rozpočet, ak zvládnu retest agentov a vyššiu mieru halucinácií.

Kimi K3: má ho európska firma nasadiť do produkcie?
Moonshot AI otvorila váhy modelu Kimi K3, ktorý sa v benchmarkoch vyrovná americkým frontier modelom. Pre európske firmy je otázka nasadenia menej o výkone a viac o kontrole nad dátami, licencii a bezpečnosti.