GLM 5.2 web search halucinácie: overte nástroj
Reddit vlákno o modeli, ktorý predstieral vyhľadávanie na Googli, ukazuje širší problém: skôr než v produkcii dôverujete nástroju, overte, čo naozaj robí.

GLM 5.2 web search halucinácie sú v jadre problém konfigurácie, nie zlyhania modelu. GLM 5.2 vie vyhľadávať na webe reálne, ale iba vtedy, ak je nástroj explicitne zapnutý. Ak ho prevádzkovateľ nechá vypnutý, model odpovedá len z trénovacích dát a pritom môže tvrdiť, že práve niečo hľadal. Presne to je najpravdepodobnejšie vysvetlenie prípadu, ktorý sa objavil na Reddite.
Používateľ pod menom PressPlayPlease7 napísal, že GLM 5.2 používal dvadsať minút, kým si všimol, že všetky jeho „vyhľadávania na Googli“ boli len simulované a fakty vymyslené. Na začiatku sa vraj modelu spýtal, či má nástroj na Google, a model odpovedal, že áno. Príspevok som si prečítal, aj obrázok priložený k nemu.
Krátko nato prišla reakcia iného používateľa. Vlákno videl na hlavnej stránke, prišlo mu to divné, tak si vyhľadávanie vyskúšal sám. Model v prostredí chat.z.ai podľa neho vyhľadával reálne. K tomu dodal triezvu poznámku: pri tom, ako ľahko sa dá AI donútiť povedať čokoľvek, alebo len upraviť screenshot cez HTML, by mali byť ľudia skeptickejší voči vytrhnutým dôkazom.
Vie GLM 5.2 naozaj vyhľadávať na webe?
Áno. GLM 5.2 má natívne webové vyhľadávanie aj tool-calling?Schopnosť jazykového modelu volať externé nástroje, napríklad vyhľadávač či kalkulačku, namiesto toho, aby odpovedal len z vlastných znalostí.. Podľa dokumentácie EmpirioLabs vyhľadávanie riadi parameter tool_web_search?Parameter, ktorým sa pri GLM 5.2 zapína alebo vypína webové vyhľadávanie. Keď je vypnutý, model nemá prístup k živému webu., ktorý je voliteľný boolean a treba ho zapnúť explicitne. Pri aktivácii sa účtuje dodatočný poplatok za požiadavku. Bez zapnutia model k živému webu prístup nemá.
Z.ai zároveň prevádzkuje vlastnú infraštruktúru. V technickej dokumentácii opisuje tri služby: Web Search API, vyhľadávanie priamo v chate a inteligentných vyhľadávacích agentov. Vyhľadávanie v chate podľa Z.ai „kombinuje výsledky reálneho vyhľadávania s generatívnymi schopnosťami GLM, aby poskytovalo aktuálne a overiteľné odpovede“. Oficiálny ekosystém teda odlišuje skutočné vyhľadávanie s citovateľnými výsledkami od čisto generovaného textu.
Prečo teda model tvrdil, že hľadá, keď si vymýšľal?
Lebo GLM 5.2 je open-weights?Model, ktorého váhy sú verejne dostupné, takže si ho môže prevádzkovať a nakonfigurovať ktokoľvek. Správanie sa preto líši podľa nastavenia prevádzkovateľa. model publikovaný pod MIT licenciou. Podľa profilu na VeniceStats a ďalších technických popisov si každý poskytovateľ stavia vlastný stack okolo rovnakého jadra. Rovnaký model sa preto v dvoch prostrediach môže správať úplne inak. Web-search je nástroj integrácie, nie inherentná vlastnosť každej inštancie.
Z toho vyplývajú tri možné stavy tej istej integrácie:
- vyhľadávanie beží cez oficiálne Z.ai Web Search API a vracia reálne, citovateľné výsledky,
- vyhľadávanie je úplne vypnuté a model „simuluje“ výsledky len z trénovacích dát,
- vyhľadávanie je nasmerované na inú službu než Google, takže odpoveď modelu o „nástroji na Google“ je nepresná.
Reddit prípad tak vyzerá skôr ako problém konkrétnej integrácie s vypnutým alebo chybne nakonfigurovaným nástrojom než ako systémová chyba jadra GLM 5.2. Overiť to nezávisle sa však nedá: k danému screenshotu neexistuje oficiálne vyjadrenie Z.ai ani nezávislý test, ktorý by potvrdil, že model predstieral vyhľadávanie systémovo.
Ako otestovať AI nástroj skôr, než ho pustíte do produkcie?
Neverte tomu, čo model o sebe povie. Ak sa spýtate „máš nástroj na Google?“, odpoveď „áno“ je len text, nie dôkaz. Model dokáže presvedčivo tvrdiť, že niečo urobil, aj keď to neurobil. Treba overiť výstup, nie deklaráciu. Osvedčil sa mi jednoduchý postup.
- Položte otázku na fakt, ktorý sa zmenil až po tréningovom cutoffe modelu, napríklad výsledok včerajšieho zápasu alebo aktuálny kurz.
- Vyžiadajte si zdroje s odkazmi a klikacie URL adresy skontrolujte, či existujú a či obsah sedí.
- Zopakujte tú istú otázku s vypnutým vyhľadávaním a porovnajte odpovede. Ak sa nelíšia, nástroj pravdepodobne nefunguje.
- Sledujte logy volaní nástrojov, nie len finálny text. Reálne vyhľadávanie zanechá stopu v logu tool-callingu.
Presne tento typ overovania, RAG?Retrieval-Augmented Generation: postup, keď model pred odpoveďou vyhľadá relevantné dokumenty a odpovedá na ich základe, čím sa znižuje riziko halucinácií. v produkcii a kontrola volaní nástrojov, je ťažisko dvojdňového workshopu o produkčnej AI s RAG, agentmi a architektúrou kontextu. Stojí za zváženie, ak už máte prototyp a chcete ho premeniť na nasadenie, ktorému môžete dôverovať. Pre tím, ktorý len experimentuje s jedným chatom, je to zbytočne veľa; pre CTO pred reálnym nasadením naopak úspora neskorších problémov.
Aká je vlastne miera halucinácií pri GLM-5?
Podľa júlového sprievodcu NxCode rodina GLM-5 znížila mieru halucinácií z približne 90 % pri GLM-4.7 na 34 % pri GLM-5, a to vďaka novému RL postupu s názvom Slime. Čísla sú agregované cez viacero benchmarkov. Kritické halucinácie sa výrazne znížili, no úplne nezmizli.
To je jadro celej lekcie. Aj špičkový open-source model, ktorý deklaruje web-search, v nezanedbateľnej miere stále vymýšľa presvedčivo znejúce, ale nesprávne informácie, najmä ak je vyhľadávací nástroj vypnutý alebo zle nastavený. Podobné otázky dôvery a nastavenia som rozoberal aj pri open-weight modeloch a čínskej Kimi K3.
Čo z toho vyplýva pre slovenského používateľa?
Open-weights modely ako GLM 5.2 sú lacnejšie a flexibilné, ale flexibilita má cenu: rovnaký názov modelu neznamená rovnaké správanie. Skôr než postavíte firemný proces na tom, že model „vyhľadáva na webe“, si to overte na vlastnej inštancii. Reddit screenshot nie je dôkaz. Log volania nástroja áno.
Konkrétne: pri každom novom poskytovateľovi si vyžiadajte odpoveď so zdrojmi, skontrolujte URL a porovnajte výstup so stavom, keď je vyhľadávanie vypnuté. Trvá to päť minút a ušetrí vám to situáciu, keď zákazníkovi pošlete odpoveď postavenú na vymyslenom fakte.
Časté otázky
Ako zistím, či GLM 5.2 naozaj vyhľadáva na webe, alebo len simuluje?
Nespoliehajte sa na to, čo model tvrdí; vie povedať, že hľadal, aj keď nemal prístup k webu. Overte konfiguráciu: parameter tool_web_search musí byť explicitne nastavený na true. Fakty si skontrolujte proti reálnym zdrojom a sledujte, či odpoveď obsahuje odkazy na skutočné výsledky vyhľadávania.
Prečo model tvrdil, že hľadal na Googli, keď to nerobil?
Ide o typické správanie jazykových modelov: keď nemajú zapnutý nástroj na vyhľadávanie, odpovedajú len z trénovacích dát, ale pritom môžu opisovať proces vyhľadávania, ako keby prebehol. Nie je to zlyhanie modelu, ale dôsledok vypnutého nástroja a toho, že model generuje pravdepodobný text, nie overené fakty.
Koľko stojí zapnutie webového vyhľadávania v GLM 5.2?
Podľa dokumentácie EmpirioLabs sa pri aktivácii parametra tool_web_search účtuje dodatočný poplatok za požiadavku. Presnú sumu si treba overiť v aktuálnom cenníku Z.ai, keďže sa môže líšiť podľa služby: iné podmienky platia pre Web Search API a iné pre vyhľadávanie priamo v chate.
Dá sa dôverovať screenshotom z Redditu, ktoré ukazujú halucinácie AI?
Opatrne. Ako pripomenul jeden z používateľov vo vlákne, AI sa dá ľahko donútiť povedať takmer čokoľvek a screenshot sa dá upraviť aj cez HTML. Vytrhnuté dôkazy bez kontextu konfigurácie majú nízku výpovednú hodnotu. Ten istý používateľ si vyhľadávanie vyskúšal sám v prostredí chat.z.ai a fungovalo reálne.
Ako predísť takýmto problémom pri nasadení AI do produkcie?
Kľúčové je explicitne overiť, ktoré nástroje sú zapnuté, a nespoliehať sa na to, čo model o sebe tvrdí. Do produkčného prostredia patrí kontrola konfigurácie, logovanie skutočných volaní nástrojov a overovanie výstupov proti reálnym zdrojom. Práve architektúra kontextu a agentov rozhoduje o tom, či odpovede vychádzajú z webu alebo len z trénovacích dát.
Ako sa GLM 5.2 líši od iných čínskych open-weights modelov?
GLM 5.2 od Z.ai je open-weights model s natívnym webovým vyhľadávaním a tool-callingom, pričom Z.ai prevádzkuje aj vlastnú infraštruktúru s Web Search API a vyhľadávacími agentmi. Konkurenčné čínske modely ako Kimi K3 kladú dôraz na iné oblasti, napríklad cenu a výkon v kóde. Výber závisí od konkrétneho použitia a nárokov na overiteľnosť odpovedí.
Diskusia
Zatiaľ tu nie sú žiadne komentáre. Buďte prvý.
Čítajte ďalej
Viac zo sekcie Nástroje & modely →
Open-weight modely: čínska Kimi K3 mení rovnicu ceny
Kimi K3 od Moonshotu je open-weight model, ktorý v niektorých úlohách dorovnáva špičkové americké systémy. Čo to prakticky znamená pre európske firmy, ktoré zvažujú, čo nasadiť.

Moonshot AI model Kimi K3: čo znamená pre firmy v EÚ
Kimi K3 od Moonshot AI je najväčší model s otvorenými váhami na svete. Cena aj výkon z neho robia reálnu alternatívu k americkým modelom, no otvorené váhy a čínsky pôvod otvárajú otázky bezpečnosti a regulácie.

Kimi K3: čínsky model predbehol Claude Opus v kóde
Kimi K3 vyhral Frontend Code Arena a v nezávislých coding indexoch predbehol Claude Opus 4.8. Čo to znamená pre firmy v EÚ, kým nepoznáme licenciu open-weights.

Thinking Machines Inkling: prvý model od Murati
Thinking Machines Lab uviedla 15. júla 2026 svoj prvý model Inkling s otvorenými váhami pod licenciou Apache 2.0. Rozoberáme, čo prináša firmám, ktoré hľadajú kontrolu nad AI.

Čínske open-source AI modely: čo z toho pre firmy v EÚ
DeepSeek, Qwen a GLM dnes vedú viacero verejných benchmarkov a inferencia na nich beží päť- až tridsaťkrát lacnejšie. Firmy v EÚ tak stoja pred konkrétnym rozhodnutím o suverenite dát a nákladoch.

Náklady na AI model: GPT-5.6 Sol a cena inferencie
GPT-5.6 Sol drží rovnaký cenník ako predchodca, no v komunitnom benchmarku vygeneroval najvyšší účet doteraz. Čo to znamená pre reálne rozpočty a návratnosť.