Zadanie
Dashboard na spracovanie e-mailov posiela nedôveryhodný obsah e-mailov tretích strán do LLM na extrakciu údajov — čím sa cieľom útoku stáva samotný model: nepriateľský odosielateľ môže napísať inštrukcie PRIAMO DO e-mailu a dúfať, že sa nimi model bude riadiť. Zákazka postavila deterministickú bezpečnostnú vrstvu, ktorá beží SKÔR, než sa čokoľvek dostane do promptu — na surovom prichádzajúcom texte — takže systém sa nikdy nespolieha, že útok na model odchytí sám model. Princíp platí všeobecne pre každý systém, ktorý posiela nedôveryhodný vstup do LLM: bezpečnostné rozhodnutie musí spraviť kód, ktorý sa nedá prehovoriť.
SK+EN detekčné vzory
Harness je plne deterministický a offline — iba pattern pravidlá, žiadne volanie modelu — takže jeho verdikty sú reprodukovateľné a nemanipulovateľné promptom. Pokrýva slovenčinu aj angličtinu, je necitlivý na diakritiku a obfuskáciu zero-width znakmi a mieri na kategórie OWASP LLM Top 10: prompt injection (LLM01), únik citlivých informácií (LLM02) a únik system promptu (LLM07), plus jailbreak formulácie a klasické web-injection markery (XSS, SQL injection) — tie posledné berie ako signál nepriateľského odosielateľa, aj keď ich cieľom nie je samotný LLM. Ten istý harness bol neskôr portovaný ako ochrana chat asistenta na tomto webe, takže je nezávisle overiteľný v produkcii.
Iba metadáta v logoch a ľudská kontrola
Návrh politiky, nie iba detekcia: nález s vysokou závažnosťou označí položku na povinnú ľudskú kontrolu — nikdy automatická akcia, nikdy auto-approve — s možnosťou tvrdého zablokovania celého LLM behu. Logovanie je čisto metadátové: kódy kategórií a počty, nikdy samotný zachytený text, takže audit trail sa nemôže stať druhou kópiou nepriateľského či citlivého obsahu. Defense-in-depth okolo harnessu: modelu nie sú počas spracovania nedôveryhodného obsahu vystavené žiadne nástroje, výstup je viazaný schémou so striktnou re-validáciou a pri zobrazení sa escapuje. Výsledok: každý prichádzajúci e-mail je deterministicky preverený pred akýmkoľvek LLM spracovaním a čokoľvek podozrivé skončí pred človekom namiesto tichej automatizovanej akcie — režim zlyhania sa mení z „útočník riadi systém" na „útočník premrhá minútu kontrolóra".