Preskočiť na obsah
VF Vladimir Fejdi
Prípadové štúdie EN Rezervovať hovor
← Všetky prípadové štúdie
Prípadová štúdia

Lokálny LLM asistent pre desktopovú aplikáciu na evidenciu času

Súvisiaca služba: AI spoľahlivosť

Zadanie

Desktopová aplikácia na evidenciu času potrebovala AI asistenta priamo v aplikácii, ktorý odpovie na otázky v prirodzenom jazyku o vlastných zaznamenaných dátach používateľa — hodiny podľa aktivity, podľa obdobia, porovnania s predchádzajúcimi mesiacmi — bez toho, aby tieto dáta čo i len raz opustili počítač. Požiadavka na súkromie úplne vylúčila cloudové API: asistent beží na lokálne hostovanom kvantizovanom otvorenom modeli. Keďže malé lokálne modely fabrikujú s istotou v hlase, základné dizajnové pravidlo bolo striktné: model nikdy neodpovedá na dátovú otázku z pamäte — každá dátová otázka spustí tool call do databázy samotnej aplikácie a odpoveď musí zopakovať presne tie hodnoty, ktoré nástroj vrátil; nikdy premenované, nikdy pomiešané medzi kategóriami.

Výber modelu a evaluačná slučka

Kandidátske lokálne modely sa porovnávali skriptovanou evaluačnou slučkou, nie pocitom: golden set reálnych vzorov otázok (dopyty za jeden mesiac, porovnania s predchádzajúcim obdobím, celoročné agregácie) skórovaný na presnosť a na fabrikáciu. Prenositeľné zistenia: streaming a volanie nástrojov sa v lokálnych runtime prostrediach spoľahlivo nekombinujú, takže kolá s nástrojmi bežia bez streamingu; nízka teplota generovania je pre faktické odpovede nutnosť; a model s reasoningom v triede ~8B spoľahlivo zreťazil viacero tool callov tam, kde o niečo menší model bez reasoningu zamieňal obdobia a vymýšľal záznamy — zatiaľ čo najbližšia vyššia veľkostná trieda sa do dostupnej pamäte nezmestila vôbec. Promotion gate pre každý nový model: minimálny prah presnosti na golden sete s nulou vyfabrikovaných entít, meraný proti aktuálne nasadenému modelu ako baseline. Vybraný model týmto gate-om prešiel; evaluačná slučka zostáva natrvalo ako regresný harness pre každú budúcu výmenu modelu — žiadna zmena modelu sa nenasadí, kým neporazí úradujúci model na tom istom golden sete.

Guardraily proti fabrikácii

Ochrana proti fabrikácii bežala v troch vrstvách. Pravidlá v system prompte: tool call je povinný pre KAŽDÚ dátovú otázku; nikdy nevymýšľať mená ani čísla; hodnoty z nástroja kopírovať presne; dnešný dátum sa injektuje, aby sa relatívne obdobia („minulý mesiac") vyhodnocovali deterministicky, s ukážkovými príkladmi, ako vyplniť argumenty nástroja. Obmedzenia generovania: teplota zastropovaná nízko — vyššie nastavenia viedli malé modely k vymýšľaniu klientov a čísel namiesto volania nástroja. Vynucovanie cez eval: kontrola proti fabrikácii zhodí celý evaluačný beh, ak čo i len jedna odpoveď obsahuje entitu alebo číslo, ktoré sa nenachádza vo výstupe nástroja. Je to ten istý typ halucinačného zlyhania, aký linka AI Reliability meria v RAG systémoch — tu vyriešený ukotvením každej odpovede vo výstupe nástroja namiesto získaných chunkov.

Riešite podobný problém?

Rezervovať hovor
VF © 2026 Vladimir Fejdi · TGS Consult s.r.o. · IČO 54 396 590
Služby Prípadové štúdie Ochrana súkromia LinkedIn