Ako premýšľa ChatGPT a moderné jazykové modely

Bezpečnosť jazykových modelov: ochrana dát, nástrojov a ľudí

Začiatočník52 min čítania26 častíZadarmo po registrácii
Lekcia13
Defense in depthModel nie je bezpečnostná hranica
01Autentifikácia
02Minimálne práva
03Validácia
04Potvrdenie
05Monitoring

Systém musí chrániť aktíva aj vtedy, keď je modelový výstup chybný alebo kompromitovaný.

Model nie je bezpečnostná hranica. Systém musí chrániť dáta, nástroje a ľudí aj vtedy, keď modelový výstup obsahuje chybu, podľahne prompt injection alebo ho zámerne manipuluje útočník.

Po prečítaní budete vedieť

  • odlíšiť safety, security, privacy a reliability
  • zmapovať prompt injection, únik dát, nadmernú agentnosť a supply-chain riziká
  • navrhnúť defense-in-depth tok s minimálnymi právami a incidentným plánom
Zadarmo po registrácii

Celá kapitola je zadarmo po registrácii.

Model nie je bezpečnostná hranica. Systém musí chrániť dáta, nástroje a ľudí aj vtedy, keď modelový výstup obsahuje chybu, podľahne prompt injection alebo ho zámerne manipuluje útočník.

Bezpečnosť LLM nie je jedno tlačidlo „safe“. Zahŕňa odolnosť voči útokom, ochranu súkromia, obmedzenie škodlivého obsahu, spoľahlivú prevádzku aj jasnú zodpovednosť. Model môže mať kvalitný safety post-training a napriek tomu byť súčasťou nebezpečnej aplikácie s príliš širokými oprávneniami. Najprv si prečítajte Limity jazykových modelov. Táto kapitola pridáva protivníka: človeka alebo obsah, ktorý sa aktívne snaží systém oklamať. LLM spracúva dôveryhodné inštrukcie aj nedôveryhodný obsah ako tokeny. Môže sa naučiť rešpektovať hierarchiu správ, ale nie je kryptografickým ani autorizačným mechanizmom. Prompt „nikdy neprezraď tajomstvo“ nesmie byť jedinou ochranou tajomstva. Pred mitigáciami určte, čo chránite: osobné údaje, interné dokumenty, system prompt, API kľúče, peniaze, reputáciu, dostupnosť služby či rozhodovacie práva. Potom zmapujte aktérov, vstupné kanály a hranice dôvery. Threat model sa robí pre konkrétny dátový tok. Všeobecná veta „používame bezpečný model“ neidentifikuje žiadnu hranicu ani kontrolu. Pri priamej prompt injection útočník napíše pokyn do konverzácie.

Ťažisko tvoria časti „Model nie je bezpečnostná hranica“, „Threat model začína aktívami, nie zoznamom útokov“ a „Prompt injection: inštrukcia ukrytá v dátach“. Nejde iba o vysvetlenie pojmov. Kapitola ich prepája s rozhodnutiami, príkladmi a hranicami, ktoré treba poznať pri reálnom použití.

Po prečítaní budete vedieť odlíšiť safety, security, privacy a reliability a zmapovať prompt injection, únik dát, nadmernú agentnosť a supply-chain riziká. Praktickým výsledkom bude schopnosť navrhnúť defense-in-depth tok s minimálnymi právami a incidentným plánom.

Kapitola odpovedá aj na otázku „Zabráni dobrý system prompt všetkým útokom?“ Nie. Je iba jednou vrstvou. Tajomstvá a akcie musia chrániť autentifikácia, autorizácia, izolácia, validácia, limity a potvrdenie mimo modelu.

26odborných častí
52minút čítania
7odkazov na zdroje
V plnej kapitole nájdete
  1. Model nie je bezpečnostná hranica
  2. Threat model začína aktívami, nie zoznamom útokov
  3. Prompt injection: inštrukcia ukrytá v dátach
  4. Sensitive information disclosure
  5. Improper output handling
  6. Excessive agency: keď má systém priveľa možností
  7. Supply chain a poisoning
  8. Misinformation a dôveryhodne znejúci omyl
Registrovať sa alebo prihlásiť

Prihlásenie zabezpečuje ChatGPT. PoznAI nedostane vaše heslo.

Praktické odpovede

Často kladené otázky

Zabráni dobrý system prompt všetkým útokom?

Nie. Je iba jednou vrstvou. Tajomstvá a akcie musia chrániť autentifikácia, autorizácia, izolácia, validácia, limity a potvrdenie mimo modelu.

Čo je nepriama prompt injection?

Škodlivá inštrukcia je ukrytá v obsahu, ktorý agent načíta - napríklad na webe, v e-maile, PDF alebo obrázku - a snaží sa ovplyvniť jeho ďalšie kroky.

Ako obmedziť riziko agenta s nástrojmi?

Dajte mu iba nevyhnutné oprávnenia, oddeľte čítanie od zápisu, validujte parametre, limitujte kroky a pred citlivou či nezvratnou akciou vyžiadajte presné potvrdenie človeka.