LLM-sikkerhedssikringsoverensstemmelsesliste
Brug denne liste før du udgiver en LLM-funktion, der læser ukendt indhold, henter private data eller kalder værktøjer.
1. Arbejdsgangsgrænse
- Arbejdsgangens ejer er navngivet.
- Arbejdsgangens tilladte handlinger er dokumenteret.
- Eksterne, ødelagende, finansielle, juridiske, HR-relaterede eller kundevisible handlinger er identificeret.
- Der findes en dokumenteret måde til hurtigt at deaktivere arbejdsgangen.
- Arbejdsgangen har en roll-back eller manuel reserveløsning.
2. Ukendt input-inventar
- Direkte brugerinput behandles som ukendt.
- Hentede dokumenter behandles som ukendt data, ikke instruktioner.
- Værktøjsudgange behandles som ukendte, medmindre de er genereret inden for den tilladte grænse.
- Oploadede PDF’er, billeder, lyd, regneark og transskriptioner behandles som ukendt.
- Websteder og browseragentobservationer behandles som ukendt.
- Admin-redigerbare prompts, arbejdsgangsmaljer, CMS-indhold og videnkilder gennemgås før produktion.
3. Data- og hentningsgrænse
- Hemmeligheder, legitimationsoplysninger, rå tokens og private URLs sendes aldrig til modellen.
- Hentning filtreres efter lejevært, bruger, rolle og kildeadgang før rangordning.
- De hentede dele bevare kilde-ID, lejevært-ID, synlighed, ejer, version og gennemgåelsesdato.
- Svarstien kan citere eller logge, hvilke kilde-ID’er der blev brugt.
- Forældede, ikke-gennemgåede eller lav-trust-kilder udelukkes eller markeres.
- Logfiler censurerer personoplysninger og legitimationsoplysninger.
4. Prompt- og kontekstkontrakt
- System-/udviklerinstruktioner versioneres og gennemgås som kode.
- Ukendt indhold omslås og mærkes som data.
- Modellen bliver fortalt, hvad den skal gøre, når ukendt indhold konflikterer med opgaveinstruktioner.
- Modellen modtager kun den minimumskontekst, der er nødvendig for opgaven.
- Højrisikoarbejdsgange bruger en smal ekstraktionsskridt før hovedagenten ser indholdet.
- Prompt-canary-frafraser bruges kun til detektion, ikke som primær forsvar.
5. Værktøjs- og handlingdesign
- Værktøjer er smalle og opgave-specifikke.
- Værktøjer udleder bruger, lejevært og rolle fra server-side autentificeringskontekst, ikke modellens argumenter.
- Hvert værktøj validerer argumenter med en skema og forretningsregler.
- Hvert værktøj udfører autorisering uafhængigt af modellen.
- Skriv-værktøjer er idempotente, hvor det er muligt.
- Eksterne sideeffekter kræver menneskelig godkendelse eller deterministiske politikkontroller.
- Ratestimer, kvoter og omkostningsgrænser er konfigureret.
- Værktøjsopkald logges med bruger, lejevært, arbejdsgang, promptversion, model, argumentoversigt og resultat.
6. Outputvalidering
- Modellens output analyseres med et strengt skema før brug.
- Ukendte felter afvises, når kontrakten bør være lukket.
- URLs, Markdown, HTML, filnavne og kodeblokke renses, hvor det er relevant.
- Output kan ikke indeholde dataklasser uden for opgavens tilladte omfang.
- Fakta fra private kilder kræver kilde-ID’er eller kildefragmenter.
- Fejlformateret output fejler lukket i stedet for at falde tilbage til frit tekst.
7. Regresstest
- Direkte injektionstest: brugerinput beder modellen om at ignorere instruktioner.
- Indirekte injektionstest: hentet indhold beder modellen om at afsløre data eller kalde et værktøj.
- Tvært-lejeværts-test: en anmodning prøver at få adgang til anden lejeværtsdata.
- Usikker værktøjsopkaldstest: modellen beder om en utilgåelig eller forbudt handling.
- Fejlformateret outputtest: ekstra felter eller ugyldige enum-værdier afvises.
- Ekstraktionstest: output prøver at inkludere hemmeligheder, private data eller prompttekst.
- Perspektivtest: opbevaret indhold indeholder skadelige instruktioner, der senere hentes.
- Multimodal test, hvis relevant: OCR- eller billedeviselige instruktioner behandles som ukendt.
8. Overvågning og incidentresponse
- Promptekstraktionssøgninger er opdagelige.
- Gentagne validatorfejl kan varsles.
- Ualmindelig hentningsbredde, værktøjsopkaldsvolumen, udgående modtagere, omkostninger eller hastighedsstigninger kan varsles.
- Promptinjektionssøgninger kan linkes til bruger, lejevært, arbejdsgang, kilde-ID’er og værktøjsopkald.
- Holdet ved, hvordan arbejdsgangen eller enkelte værktøjer deaktiveres.
- Holdet ved, hvordan leverandørnøgler revokeres og berørte legitimationsoplysninger roteres.
- Der er en ejer for beslutninger om kundekommunikation, juridisk kommunikation, sikkerhed og regulatorrapportering.
Udgangsgate
Mærk arbejdsgangen ikke som produktionssikker, før:
- Alle højriskofunktioner har en gate.
- Mindst én adversariske dokumenttest er bestået.
- Mindst én ukontrolleret adgangsbesøg har fejlet sikkert.
- Mindst én usikker værktøjsopkaldsbesøg har fejlet sikkert.
- Mindst én fejlformateret outputtest har fejlet lukket.
- Mindst én arbejdsgang-deaktiveringssti er testet.