Preskočiť na obsah
Nástroje & modely

ARC-AGI 3 benchmark: prečo skóre bez kontextu klame

Skok z pod jedného percenta na 30 percent nespochybnil model ani ľudí, ale spôsob, akým sa čítajú čísla o AGI.

Pavol KostolanskýPavol Kostolanský3 min čítania
ARC-AGI 3 benchmark: prečo skóre bez kontextu klame
ARC-AGI 3 benchmark: prečo skóre bez kontextu klame

Keď na jednom benchmarku vyskočí skóre z hodnoty pod jedno percento na tridsať percent, prvá otázka neznie „aký múdry je model“, ale „čo presne sa medzitým na meraní zmenilo“. Práve o toto ide v spore okolo ARC-AGI 3 benchmarku: rozdiel medzi pôvodnými výsledkami z marca 2026 a neskoršími z júla nevznikol tým, že by modely cez noc zmúdreli, ale tým, ako bol agent nakonfigurovaný, koľko kontextu smel držať a koľko stál jeden beh.

Je to poučenie použiteľné pre každú firmu, ktorá si v tlačovej správe prečíta číslo z benchmarku a podľa neho sa rozhoduje o nákupe.

Čo je ARC-AGI 3 benchmark a prečo naň modely padali pod 1 %

ARC-AGI 3 je interaktívny benchmarkŠtandardizovaný test, ktorým sa porovnáva výkon AI modelov na definovaných úlohách. Výsledok závisí od toho, ako a za akých podmienok sa meria. od ARC Prize Foundation. Meria, či agent v úplne novom prostredí bez inštrukcií dokáže sám nájsť cieľ, skúmať prostredie, učiť sa zo spätnej väzby a konať efektívne v rámci jednej session. Netestuje znalosti, ale schopnosť poradiť si s neznámym.

Pri uvedení v marci 2026 to dopadlo tvrdo. Podľa prehľadu AI Automation Global skončili všetky testované frontier modely pod jedným percentom, kým dospelí bez tréningu na benchmark tvorili baselineReferenčná úroveň, voči ktorej sa výsledok porovnáva. Pri ARC-AGI 3 je ňou 100 % efektivita netrénovaných ľudí. 100 %:

  • Gemini 3.1 Pro Preview: 0,37 %
  • GPT-5.4 (High): 0,26 %
  • Claude Opus 4.6: 0,25 %
  • Grok-4.20 (Beta reasoning): 0,00 %

Priepasť medzi človekom a strojom tu nebola percentuálna, ale rádová. Baseline 100 % pritom neznamená „dosiahnutá všeobecná inteligencia“, len ľudskú efektivitu v daných prostrediach, ako spresňuje EmergentMind.

Ako sa skóre v júli 2026 dostalo na 30 percent

O pár mesiacov vyzerali čísla inak. GPT-5.6 Sol od OpenAI viedol podľa BenchLM s výsledkom okolo 7,8 % v konfigurácii Max effort. Následne Capital & Compute aj ExplainX uviedli verifikované skóre 30,2 % pre Claude Opus 5 (High effort) k 24. júlu 2026, pričom Opus 5 vyriešil päť verejných prostredí, ktoré predtým žiaden model neprekonal.

Tri veci sa oplatí čítať spolu s tým číslom:

  1. Effort levelNastavenie, koľko výpočtu a plánovania model na úlohu dostane (napríklad High, Max). Vyšší effort zvyšuje skóre aj náklad na beh.. Výsledky sa líšia podľa toho, či beží High, Max alebo xHigh, teda koľko výpočtu a plánovania model dostane.
  2. Náklad. Kompletný beh GPT-5.6 Sol v Max konfigurácii stál podľa ExplainX okolo 25 100 dolárov. To nie je číslo pre bežnú prevádzku.
  3. Public demo verzus plný dataset. 30,2 % platí pre verejný demo set 25 prostredí. Na plnom privátnom datasete zostáva podľa Capital & Compute množstvo prístupov stále pod jedným percentom.

Capital & Compute to zhrnul presne: pokrok je „rapid in relative terms and negligible in absolute terms“, teda rýchly v relatívnom pohľade a zanedbateľný v absolútnom. Skok z pod 1 % na 30 % je na papieri obrovský. Voči ľudskej stovke stále malý.

Handicapoval benchmark agentov, alebo len ukázal ich limity

Jadro sporu: jeden populárny príspevok tvrdí, že ARC-AGI 3 zámerne nedovolil reasoning agentovi udržať kontextInformácie, ktoré si model dokáže naraz udržať a použiť. Ak ich stráca medzi krokmi, opakovane zabúda, čo už zistil. naprieč akciami, takže model opakovane zabúdal, čo už zistil, a hodnotil sa ako ochromená verzia seba samého. Keď dostal možnosť ponechať si reasoning a komprimovať staršie kroky, tak ako fungujú reálni frontier agenti, skóre vraj vyskočilo.

Zdrojom tohto naratívu je aj vlastný text OpenAI o tom, ako dve nastavenia strojnásobili jej skóre na benchmarku. Ide o legitímny technický poznatok. Nie je to však dôkaz úmyslu.

V zdrojoch dostupných po 28. júli 2026 sa nenachádza explicitné technické priznanie ARC Prize ani OpenAI, že benchmark cielene núti agentov zabúdať, aby im znížil skóre. Opísané sú skôr obmedzenia štandardného agentického API a rozdiel medzi jednoduchšou preview konfiguráciou a neskorším high-effort behom so sofistikovaným plánovaním a kompresiou stavu. Tvrdenie o „ochromenom modeli“ je preto zatiaľ komunitná interpretácia rozdielu medzi nastaveniami, nie overený fakt.

Čo si z toho má odniesť firma v EÚ

Benchmark nie je cena, je to meracie zariadenie s vlastnými predpokladmi. Číslo bez konfigurácie je marketing. Rovnaký model dá na ARC-AGI 3 pod 1 % aj 7,8 % podľa toho, koľko pamäte, plánovania a peňazí dostane. Ak dodávateľ ukáže skóre a zamlčí effort level, náklad na beh a či ide o public demo, alebo plný dataset, chýba vám polovica vety.

Pre nákupné rozhodnutie preto platí:

  • Pýtajte sa na konfiguráciu, nie len na číslo: effort level, limity kontextu, cena jedného behu.
  • Rozlišujte demo od produkcie. Beh za 25 000 dolárov ukazuje strop schopností, nie prevádzkovú realitu.
  • Merajte na vlastných dátach a vlastnom procese, nie na cudzom leaderboarde.

Túto lekciu sme na AI Radare rozoberali aj na konkrétnom modeli v texte o tom, ako Claude Opus 5 vyzerá v praxi verzus v deme, a všeobecnejšie v porovnaní, prečo sa benchmarky a produkčné nasadenie rozchádzajú. Vzorec je vždy rovnaký.

ARC-AGI 3 pritom robí presne to, čo má: ukazuje, kde dnešné modely v novom prostredí zlyhávajú. Spor okolo neho ukázal niečo iné. Že vieme pohnúť číslom skôr, než pohneme schopnosťou. Číslo z benchmarku nie je verdikt. Je to otázka, na ktorú si musíte dopísať podmienky.

ARC-AGI 3: skóre frontier modelov verzus ľudia% efektivity, verejný demo set, marec až júl 2026
Ľudia (baseline) 100 Opus 5 High 30.2 GPT-5.6 Sol Max 7.8 Gemini 3.1 Pro 0.4 GPT-5.4 High 0.3 Grok-4.20 0

Časté otázky

Znamená skóre 30,2 % pre Claude Opus 5, že model je zásadne múdrejší ako v marci?

Nie nutne. Rozdiel medzi hodnotami z marca a júla 2026 podľa všetkého nevznikol tým, že by modely cez noc zmúdreli, ale zmenou konfigurácie agenta: koľko kontextu smel držať a koľko stál jeden beh. Číslo bez týchto podmienok samo osebe nič nevypovedá o skutočnej schopnosti modelu.

Prečo dospelý človek dosiahol 100 %, keď modely padali pod 1 %?

Baseline 100 % neznamená dosiahnutú všeobecnú inteligenciu, len ľudskú efektivitu v daných prostrediach, ako spresňuje EmergentMind. ARC-AGI 3 testuje schopnosť poradiť si v úplne novom prostredí bez inštrukcií: skúmať, učiť sa zo spätnej väzby a konať efektívne. Práve v tejto adaptácii na neznáme mali frontier modely v marci 2026 rádový, nie percentuálny odstup.

Na čo si mám dať pozor, keď v tlačovej správe čítam číslo z benchmarku?

Zisti konfiguráciu, za ktorej výsledok vznikol: koľko kontextu agent držal, koľko behov mal a koľko stál jeden beh. Skóre „Max effort" alebo „High effort" môže byť podstatne drahšie ako bežná prevádzka. Bez týchto podmienok sa dve čísla nedajú porovnať a rozhodnutie o nákupe podľa nich klame.

Ako sa výsledok na benchmarku líši od reálnej prevádzky vo firme?

Benchmarkové skóre často vzniká v maximálnej konfigurácii, ktorá je pre bežné nasadenie drahá a pomalá. GPT-5.6 Sol viedol podľa BenchLM s výsledkom okolo 7,8 % práve v režime Max effort. V produkcii sa počíta cena aj rýchlosť, takže reálny výkon môže byť nižší, než sľubuje verejne uvádzané číslo.

Kto overuje výsledky na ARC-AGI 3 a dá sa im veriť?

ARC-AGI 3 vyvíja ARC Prize Foundation. Skóre 30,2 % pre Claude Opus 5 v režime High effort k 24. júlu 2026 uviedli Capital & Compute aj ExplainX ako verifikované; Opus 5 vyriešil päť verejných prostredí. Aj pri overenom čísle však platí, že bez uvedenej konfigurácie a nákladov nie je porovnateľné.

Znamená 30 % na ARC-AGI 3, že sa blížime k AGI?

Nie. ARC-AGI 3 meria schopnosť adaptovať sa na neznáme prostredie, nie znalosti, a 100 % je iba ľudská efektivita, nie dosiahnutá všeobecná inteligencia. Skok z hodnôt pod 1 % na 30 % je z veľkej časti otázka konfigurácie agenta, nie náhleho intelektuálneho prelomu. K AGI to samo osebe nič nedokazuje.

0 komentárov
Zdieľať

Diskusia

Komentáre sú pred zverejnením moderované.

Zatiaľ tu nie sú žiadne komentáre. Buďte prvý.