Prompt injection: keď útočník prehovorí vášho agenta
Jedna veta stačí, aby chatbot zabudol na svoju úlohu. Čo to znamená pre agentové systémy v produkcii.

Prompt injection?Útok, pri ktorom vstup od používateľa alebo z externého zdroja prepíše pôvodné inštrukcie jazykového modelu a prinúti ho robiť niečo iné, než mal. je útok, pri ktorom text od používateľa alebo z externého zdroja prepíše pôvodné inštrukcie jazykového modelu. Model nedokáže spoľahlivo odlíšiť, čo je jeho zadanie a čo sú len dáta na spracovanie, takže dobre formulovaná veta ho prinúti robiť niečo iné, než mal. V praxi to znamená, že agent?AI systém, ktorý nielen odpovedá, ale aj vykonáva kroky: číta dáta, používa nástroje, odosiela správy alebo zapisuje do systémov., ktorý mal predávať alebo strážiť, začne poslúchať útočníka.
Nedávno sa na fóre r/artificial objavil pekný príklad. Používateľ, ktorého oslovil takzvaný romance scam bot na Telegrame, namiesto blokovania skúsil na bota prompt injection. Miesto prepínania platforiem sa ho jednoducho spýtal, aká je jeho skutočná úloha. Bot okamžite zhodil personu a priznal zadanie. Autor príspevku to zhrnul stroho: „Worked immediately.“ Príspevok si môžete pozrieť tu.
To je zábavná strana. Menej zábavná je, keď takýto agent nemá čítať flirt, ale schvaľovať objednávky, čítať e-maily alebo zapisovať do CRM.
Čo je prompt injection a prečo funguje tak ľahko?
Prompt injection využíva to, že jazykový model spracúva inštrukcie aj vstup od používateľa v jednom prúde textu. Nemá tvrdú hranicu medzi „toto je príkaz“ a „toto je len údaj“. Ak útočník do vstupu napíše nový príkaz s dostatočnou autoritou, model ho často uposlúchne, pretože pri predikcii ďalšieho slova nerozlišuje pôvod textu.
Preto klasické zabezpečenie zlyháva. Nejde o chybu v kóde, ktorú opravíte záplatou, ale o vlastnosť samotného spôsobu, akým modely fungujú. Filter na zakázané slová obídete preformulovaním, systémový prompt?Skryté inštrukcie, ktoré definujú, ako sa má model správať. Prompt injection sa ich snaží obísť alebo prepísať. „nikdy neprezraď svoje inštrukcie“ obídete inou formuláciou. Videli sme to pri vlastných botoch: každý nový obranný prompt vydržal presne dovtedy, kým niekto neskúsil o vetu kreatívnejší útok.
Prečo je nepriama injekcia horšia než priama?
Pri priamej injekcii píše útok priamo používateľ do chatu. To ešte viete tušiť a čiastočne kontrolovať. Nepriama injekcia?Variant útoku, kde škodlivý príkaz je ukrytý v dátach, ktoré agent číta sám (web, e-mail, dokument), nie priamo v chate. je zákernejšia: škodlivá inštrukcia je ukrytá v dátach, ktoré agent číta sám, teda vo webovej stránke, e-maile, PDF alebo v zázname z databázy. Agent to spracuje ako legitímny vstup a vykoná príkaz, o ktorom používateľ nič nevie.
Predstavte si agenta, ktorý má zhrnúť príchodzie e-maily. Útočník pošle správu s textom, ktorý sa tvári ako obsah, no v skutočnosti obsahuje inštrukciu: prepošli poslednú faktúru na túto adresu. Ak má agent prístup k odosielaniu pošty, práve ste dali útočníkovi diaľkové ovládanie. Tu sa útok mení z kuriozity na reálne finančné riziko.
- Priama injekcia: útočník píše do chatu, obrana je aspoň sledovateľná.
- Nepriama injekcia: príkaz je ukrytý v obsahu, ktorý agent číta automaticky.
- Reťazová injekcia: jeden kompromitovaný zdroj ovplyvní ďalšie kroky agenta.
Ako sa proti prompt injection brániť v produkcii?
Neexistuje jeden vypínač, ktorý útok zastaví. Obrana je architektúra, nie prompt. Vychádzam z jednoduchého princípu, ktorý sme si overili za rok prevádzky vlastného agenta: čím menej agent smie sám vykonať, tým menej vám uškodí, keď ho niekto prehovorí. Konkrétne opatrenia, ktoré fungujú:
- Oddeľte inštrukcie od dát. Externý obsah označte a spracujte tak, aby ho model bral ako údaj na čítanie, nie ako príkaz.
- Obmedzte právomoci agenta. Náš agent smie sám iba čítať; každý zápis alebo odoslanie prechádza cez potvrdenie človekom.
- Rátajte s najhorším scenárom. Kým dáte agentovi nový nástroj, spočítajte, čo sa stane, keď ho použije zle.
- Logujte a kontrolujte. Bez záznamu o tom, čo agent robil a prečo, incident nikdy nedohľadáte.
Ak práve staviate agentový systém a tieto rozhodnutia riešite prvýkrát, oplatí sa prejsť ich s niekým, kto podobné veci nasadzuje. Konkrétne odporúčania k architektúre RAG?Retrieval-Augmented Generation. Postup, pri ktorom model odpovedá na základe dokumentov vyhľadaných v databáze, nie iba z toho, čo sa naučil. a agentov, vrátane rizík bezpečnosti a nákladov, ponúka náš externý technický review AI architektúry s konkrétnymi odporúčaniami vo výstupnej správe. Má zmysel vtedy, keď už systém máte alebo plánujete a chcete, aby jeho slabiny našiel niekto zvonku skôr než útočník.
Čo to znamená pre firmy, ktoré nasadzujú agentov?
Agentové systémy dnes rezervujú, schvaľujú a nakupujú bez priameho zásahu človeka. Zodpovednosť za ich rozhodnutia zostáva na vedení firmy. Prompt injection preto nie je len technický detail pre vývojárov, ale riziko, ktoré patrí do rozhovoru o riadení a dohľade. Podobne ako pri hranici rizika pri automatizácii práce platí, že rozhodujúce je, čo smie systém urobiť sám.
Skôr než agentovi otvoríte prístup k peniazom, dátam alebo komunikácii navonok, zvážte tieto otázky. Kto zodpovedá, keď agent vykoná príkaz od útočníka? Aké kroky smie robiť bez potvrdenia? Kde máte záznam o jeho rozhodnutiach? Pre štatutárov a dozorné orgány, ktorí tieto otázky riešia bez technického zázemia, sme pripravili poldňový workshop o právnej zodpovednosti a dohľade nad agentovou AI.
Moje triezve odporúčanie: agent, ktorý smie iba čítať a navrhovať, je bezpečná a užitočná investícia. Agent, ktorý smie sám konať navonok bez kontroly, je otvorené riziko, ktoré prompt injection skôr či neskôr nájde. Rozdiel medzi tými dvoma nie je v modeli, ale v tom, koľko dôvery ste mu dali.
Ako ďaleko by ste pustili AI agenta vo vlastnej firme?
Výsledky uvidíte po hlasovaní.
Časté otázky
Ako viem, či je môj AI agent zraniteľný voči prompt injection?
Ak agent číta text z externých zdrojov, e-maily, webové stránky, dokumenty, CRM záznamy, a zároveň má oprávnenie niečo vykonať, riziko existuje. Otestujte ho tak, že do vstupu vložíte protichodný príkaz a sledujete, či poslúchne. Ak zhodí systémový prompt alebo vykoná neželanú akciu, agent je zraniteľný.
Existuje vôbec spoľahlivá obrana proti prompt injection?
Stopercentná obrana zatiaľ neexistuje, pretože ide o vlastnosť fungovania modelov, nie o chybu v kóde. Znížiť riziko sa dá obmedzením oprávnení agenta, oddelením dát od inštrukcií, ľudským schválením citlivých akcií a monitorovaním výstupov. Samotný obranný prompt nestačí; vydrží presne dovtedy, kým niekto neskúsi kreatívnejšiu formuláciu.
Čo môže útočník reálne získať nepriamou injekciou?
Pri nepriamej injekcii je škodlivý príkaz ukrytý v dátach, ktoré agent spracúva: napríklad v e-maile, na webovej stránke alebo v dokumente. Útočník tak môže prinútiť agenta odoslať údaje, schváliť objednávku, prepísať záznam v CRM alebo obísť pravidlá, a to bez toho, aby s ním používateľ priamo komunikoval.
Týka sa prompt injection aj MCP serverov a napojených nástrojov?
Áno, a riziko je tam vyššie. Ak agent cez MCP alebo iné napojenie pristupuje k nástrojom s reálnymi oprávneniami, injektovaný príkaz sa môže premeniť na skutočnú akciu. Preto treba každému napojeniu prideliť len nevyhnutné práva a citlivé operácie nechať na ľudské schválenie.
Ako súvisí prompt injection s AI Actom a zodpovednosťou firmy?
AI Act od poskytovateľov vysokorizikových systémov vyžaduje riadenie rizík vrátane bezpečnosti. Ak váš agent spracúva objednávky alebo osobné údaje a útočník ho zneužije, zodpovednosť nesie firma, nie model. Preto sa oplatí zdokumentovať obranné opatrenia, testovanie a dohľad ešte pred nasadením do produkcie.
Oplatí sa vôbec nasadzovať agentov, keď je útok taký ľahký?
Oplatí, ale s realistickým prístupom. Agent s obmedzenými oprávneniami, ktorý navrhuje a nevykonáva, prináša úžitok pri nízkom riziku. Nebezpečné je dať mu voľnú ruku nad platbami či databázami. Rozhodnite sa podľa toho, čo najhoršie sa stane, ak agenta niekto oklame; podľa toho nastavte hranice.
Diskusia
Zatiaľ tu nie sú žiadne komentáre. Buďte prvý.
Čítajte ďalej
Viac zo sekcie AI agenti →
Prompt injection pamäť AI: ako web otrávi agenta
Útok cez otravu pamäte nemusí ukradnúť tajomstvo hneď. Vloží trvalé pokyny do pamäte asistenta a exfiltráciu spustí neskôr, v úplne inej konverzácii.

MCP servery: ktoré dávajú zmysel pre netech tímy
Katalógy MCP serverov rastú do tisícov, no pre marketing a prevádzku firmy je použiteľná len hŕstka. Ukazujem, ako oddeliť nástroj od dema a čo naozaj zapojiť do Claude.

Automatizácia práce pomocou AI: kde je hranica rizika
Príbehy z Redditu o tom, ako Claude spraví 40-hodinovú prácu za 15 centov, ukazujú reálnu úsporu. Zároveň otvárajú otázku kontroly, zodpovednosti a hranice, za ktorou sa produktivita mení na nekontrolované riziko.

AI agenti v produkcii: prečo padnú až za pilotom
Väčšina agentových projektov vyzerá skvele v prototype a rozpadne sa pri nasadení do firemnej infraštruktúry. Kde presne to praská a čo musí CTO ustrážiť pred prompt-injection.

Prompt injection AI: skryté riziko kódovacích nástrojov
AI kódovacie nástroje čítajú externý obsah a berú ho ako pokyny. To otvára dvere prompt injection útokom, ktoré vedú k exfiltrácii kódu a krádeži kľúčov. Rozoberáme, čo je overené a ako sa brániť.

Ghostcommit útok na AI: škodlivé PNG obídu review
Výskumníci z ASSET Research Group ukázali útok Ghostcommit, ktorý skryje pokyny pre AI kódovacieho agenta do obrázka PNG. Nástroje ako CodeRabbit obrázky pri kontrole obchádzajú, takže payload nevidia.