Preskočiť na obsah
Biznis & stratégia

AI výkon na pracovných úlohách: pod 25 %, tvrdí Berkeley

Benchmark Agents' Last Exam z UC Berkeley ukazuje, že špičkové modely zvládnu len zlomok reálnych pracovných workflowov.

Juraj BudaiJuraj Budai4 min čítania
AI výkon na pracovných úlohách: pod 25 %, tvrdí Berkeley
AI výkon na pracovných úlohách: pod 25 %, tvrdí Berkeley

AI výkon na pracovných úlohách zostáva podľa novej štúdie z UC Berkeley výrazne pod ľudskou úrovňou: najlepší testovaný model zvládol len 24 % reálnych pracovných úloh a na najťažších zadaniach neuspel ani jeden agentAI systém, ktorý dokáže samostatne plánovať postup, používať nástroje a vykonávať viacero krokov za sebou na splnenie úlohy.. Benchmark Agents' Last Exam nesimuluje krátke testové otázky, ale komplexné workflowy skutočnej platenej práce. A tie sú pre dnešné modely tvrdý oriešok.

Pre mňa je to najužitočnejší kus dát za posledné mesiace, pretože konečne meria to, čo firmy naozaj chcú vedieť: či agent dokáže dokončiť celú úlohu tak, ako by ju odovzdal človek, alebo len jej pohodlný začiatok.

Čo presne meria benchmark Agents' Last Exam?

Benchmark vznikol na UC Berkeley v Center for Responsible, Decentralized Intelligence v spolupráci s vyše 300 odborníkmi z praxe. Testuje AI agentov na takmer 1 500 workflowoch naprieč 55 nefyzickými povolaniami v 13 sektoroch, ktoré sú naviazané na oficiálnu pracovnú klasifikáciu federálnej vlády USA. Ide o end-to-endÚloha meraná od začiatku po úplné dokončenie, nie len jej dielčie kroky. Počíta sa len plne a korektne hotový výsledok. úlohy, nie o kvízové otázky.

Zásadný rozdiel oproti bežným benchmarkom: úloha sa počíta ako splnená len vtedy, keď je dokončená celá a korektne. Nie je to podiel správnych krokov, ale podiel úplne hotových zadaní. Práve táto métrika zaujíma každého, kto zvažuje nasadenie AI do produkcie.

Ako dopadli špičkové modely?

Slabo, ak meriame plnú náhradu človeka. Najvyššiu celkovú úspešnosť dosiahol OpenAI GPT-5.5 s 24 % dokončených úloh. Anthropic Claude Fable 5 nasledoval s 22 %. Modely od Google, DeepSeek a Grok sa podľa zhrnutia benchmarku pohybovali pod 16 %.

  • GPT-5.5: 24 % úplne dokončených úloh, najvyššie skóre.
  • Claude Fable 5: 22 %.
  • Google, DeepSeek, Grok: pod 16 %.
  • Najťažšia úroveň úloh: 0 % úspešnosti u každého testovaného agenta vrátane Fable 5.

K najťažším úlohám autori štúdie píšu, že tam, kde treba sustained reasoning, deep domain expertise a reliable execution over long horizons, majú agenti k ľudskej úrovni stále ďaleko. Číslo 0 % nie je zaokrúhlenie. Na tejto úrovni sa doslova nepodarilo kompletne dokončiť ani jednu úlohu.

Úspešnosť modelov na reálnych pracovných úlohách (ALE)% úplne dokončených úloh, benchmark Agents' Last Exam
24 GPT-5.5 22 Claude Fable 5 16 Google/DeepSeek/Grok 0 Najťažší tier

Prečo AI výkon na pracovných úlohách padá práve pri celých workflowoch?

Pretože reálna práca zriedka pozostáva z jedného kroku. Vyžaduje koordináciu viacerých nástrojov, rozhodnutia v čase a udržanie kontextu naprieč dlhým postupom. Práve tu sa chyby reťazia: keď model urobí drobnú chybu v treťom kroku z desiatich, celá úloha padne, aj keď zvyšok zvládol.

Poznám to z vlastnej prevádzky. Rutinné, presne definované úlohy dnešné modely zvládajú výborne. Problém začína, keď od agenta chcem, aby si sám naplánoval postup, vybral správne dáta a doviedol to do konca bez dozoru. Práve na tom sme si postavili pravidlo, o ktorom píšem v článku o tom, kde je hranica rizika pri automatizácii práce pomocou AI.

Sekundárne analýzy štúdie idú ešte ďalej. Podľa komentárov k dátam dokáže špičkový agent Manus plne automatizovať len okolo 2,5 % reálnych pracovných úloh, teda doručiť výsledok na úrovni, ktorá plne nahrádza človeka, len pri zlomku jobov. Autori benchmarku ALE uvádzajú priemernú full-pass úspešnosť na najťažšej úrovni len 2,6 %.

Čo z toho vyplýva pre firmy plánujúce nasadenie?

Že plná náhrada celých rolí je zatiaľ výnimka, nie pravidlo. Najväčší efekt dnes prináša AI v čiastkových úlohách: preberá dielčie informačné a písacie tasky, zatiaľ čo rozhodovanie, kontext a zodpovednosť ostávajú na ľuďoch. Kto plánuje AI ako náhradu tímu, opiera sa o dáta, ktoré štúdia nepotvrdzuje.

Praktické odporúčanie z komentárov k štúdii je konzistentné a triezve. Procesy navrhujte okolo modelu human-in-the-loopModel práce, kde AI robí definované kroky, ale človek nastavuje zadanie, kontroluje kvalitu a rozhoduje v nejednoznačných situáciách.:

  1. Nechajte AI robiť dobre definované, kontrolovateľné kroky.
  2. Zadanie a jeho rámce nastavuje človek.
  3. Kvalitu výstupu kontroluje človek.
  4. V nejednoznačných situáciách rozhoduje človek.

Ak schvaľujete AI projekty na úrovni predstavenstva alebo dozornej rady, oplatí sa vopred vedieť, prečo väčšina prvých zámerov neprinesie merateľný výsledok a aké otázky klásť manažmentu. Presne na to je zameraný polodňový workshop o governance a riziku AI projektov pre orgány dohľadu, ktorý vedú inžinieri z produkcie. Nie je to školenie promptovania; ide o to, kde AI zarába a kde len spaľuje peniaze.

Ako čítať tieto čísla bez zbytočného pesimizmu?

Opatrne na oboch stranách. Popularizačné texty opisujú ALE ako reality check pre priemysel a uvádzajú, že moderné modely dosahujú menej než 25 % ľudskej výkonnosti na reálnych úlohách. To neznamená, že AI je neužitočná. Znamená to, že marketingový sľub plnej automatizácie práce naráža na tvrdé empirické dáta.

Riziko takzvaného overclaimingu je konkrétne: firmy, ktoré na sľuby vsadia bez vlastného testovania, riskujú zlyhanie workflowov alebo bezpečnostné incidenty. Preto pred každým väčším zámerom odporúčam odmerať vlastnú úspešnosť na vašich reálnych úlohách, nie na demo scenári dodávateľa.

Ak stojíte pred rozhodnutím, či AI zámer vlastnou vývojom, kúpiť alebo integrovať, a chcete rátať náklady na celý životný cyklus, k tomu smeruje workshop o investičnom rozhodnutí AI pre predstavenstvo s výstupom v podobe rozhodovacej matice pre váš prípad. Užitočný je najmä vtedy, keď už máte konkrétny zámer a čísla, o ktoré sa dá oprieť; ak len skúmate, či AI vôbec dáva zmysel, počkajte s ním.

Kedy má agentová AI vo firme zmysel a kedy nie?

Má zmysel tam, kde úlohu viete presne definovať, kontrolovať jej výstup a znášať náklady občasnej chyby. Nemá zmysel tam, kde chcete autonómne rozhodnutia s vysokou zodpovednosťou a bez ľudskej kontroly. Dáta z benchmarku ALE túto hranicu kreslia jasne.

Moje triezve odporúčanie: začnite úzko, na jednej dobre ohraničenej úlohe, zmerajte reálnu úspešnosť na vlastných dátach a až potom rozširujte. Číslo 24 % pri najlepšom modeli nie je dôvod AI ignorovať. Je to dôvod plánovať s dohľadom človeka a bez ilúzií o tom, čo agent dnes zvládne sám.

Časté otázky

Znamená 24 % úspešnosť, že AI agenti sú na reálnu prácu nepoužiteľní?

Nie. Benchmark meria plnú náhradu človeka, teda podiel úloh dokončených celkom a korektne. Aj keď agent nedokončí celé zadanie, môže spoľahlivo zvládnuť jeho časti a ušetriť čas. Kľúčové je nasadiť ho tam, kde človek dohliada na výsledok, nie ho slepo nechať odovzdať hotovú prácu.

Prečo dosahujú modely v tomto teste oveľa nižšie skóre než v bežných benchmarkoch?

Bežné benchmarky často merajú podiel správnych krokov alebo krátke kvízové otázky. Agents' Last Exam počíta úlohu ako splnenú len vtedy, keď je celý workflow hotový správne. Pri end-to-end zadaniach naprieč 55 povolaniami sa chyby hromadia, preto aj najlepší GPT-5.5 dosiahol len 24 %.

Oplatí sa firme nasadiť AI agenta, keď najlepší model zvládne štvrtinu úloh?

Závisí od konkrétneho procesu. Ak úloha vyžaduje presné a úplné odovzdanie, dnešní agenti potrebujú human-in-the-loop kontrolu. Návratnosť príde tam, kde AI urýchli rutinné časti a človek dohliada na finálny výstup. Pred investíciou sa oplatí zmerať, ktoré interné workflowy sú vhodné a aké riziko z chýb hrozí.

Ako si vybrať medzi vývojom vlastného riešenia a nákupom hotového modelu?

Rozhodnutie by malo vychádzať z toho, aké úlohy chcete pokryť a aká chybovosť je únosná. Keďže žiadny model nezvláda najťažšie zadania spoľahlivo, drahý vlastný vývoj sa oplatí len pri jasnej výhode. Pre väčšinu firiem je rozumnejšie začať s dostupnými modelmi a dohľadom človeka.

Prečo pri najťažších úlohách zlyhali všetky modely na 0 %?

Autori štúdie uvádzajú, že najnáročnejšia úroveň vyžaduje sustained reasoning a hlbšiu prácu, ktorú dnešné modely neudržia počas celého komplexného workflowu. Chyba v ktoromkoľvek kroku znamená nesplnenú úlohu. Preto ani GPT-5.5, ani Claude Fable 5 nedokončil žiadne z týchto zadaní úplne a korektne.

Ako čo najlepšie využiť AI agentov už dnes, keď plná automatizácia nefunguje?

Nasaďte agentov na ohraničené, opakovateľné časti procesu a nechajte človeka skontrolovať a dokončiť výstup. Vopred si zmerajte, ktoré úlohy sú pre model reálne zvládnuteľné, a stanovte hranicu, za ktorou musí zasiahnuť pracovník. Takto získate zrýchlenie bez rizika, že sa odovzdá neúplná alebo nesprávna práca.

0 komentárov
Zdieľať

Diskusia

Komentáre sú pred zverejnením moderované.

Zatiaľ tu nie sú žiadne komentáre. Buďte prvý.