# LLM-sikkerhedssikringsoverensstemmelsesliste

Brug denne liste før du udgiver en LLM-funktion, der læser ukendt indhold, henter private data eller kalder værktøjer.

## 1. Arbejdsgangsgrænse

- [ ] Arbejdsgangens ejer er navngivet.
- [ ] Arbejdsgangens tilladte handlinger er dokumenteret.
- [ ] Eksterne, ødelagende, finansielle, juridiske, HR-relaterede eller kundevisible handlinger er identificeret.
- [ ] Der findes en dokumenteret måde til hurtigt at deaktivere arbejdsgangen.
- [ ] Arbejdsgangen har en roll-back eller manuel reserveløsning.

## 2. Ukendt input-inventar

- [ ] Direkte brugerinput behandles som ukendt.
- [ ] Hentede dokumenter behandles som ukendt data, ikke instruktioner.
- [ ] Værktøjsudgange behandles som ukendte, medmindre de er genereret inden for den tilladte grænse.
- [ ] Oploadede PDF'er, billeder, lyd, regneark og transskriptioner behandles som ukendt.
- [ ] Websteder og browseragentobservationer behandles som ukendt.
- [ ] Admin-redigerbare prompts, arbejdsgangsmaljer, CMS-indhold og videnkilder gennemgås før produktion.

## 3. Data- og hentningsgrænse

- [ ] Hemmeligheder, legitimationsoplysninger, rå tokens og private URLs sendes aldrig til modellen.
- [ ] Hentning filtreres efter lejevært, bruger, rolle og kildeadgang før rangordning.
- [ ] De hentede dele bevare kilde-ID, lejevært-ID, synlighed, ejer, version og gennemgåelsesdato.
- [ ] Svarstien kan citere eller logge, hvilke kilde-ID'er der blev brugt.
- [ ] Forældede, ikke-gennemgåede eller lav-trust-kilder udelukkes eller markeres.
- [ ] Logfiler censurerer personoplysninger og legitimationsoplysninger.

## 4. Prompt- og kontekstkontrakt

- [ ] System-/udviklerinstruktioner versioneres og gennemgås som kode.
- [ ] Ukendt indhold omslås og mærkes som data.
- [ ] Modellen bliver fortalt, hvad den skal gøre, når ukendt indhold konflikterer med opgaveinstruktioner.
- [ ] Modellen modtager kun den minimumskontekst, der er nødvendig for opgaven.
- [ ] Højrisikoarbejdsgange bruger en smal ekstraktionsskridt før hovedagenten ser indholdet.
- [ ] Prompt-canary-frafraser bruges kun til detektion, ikke som primær forsvar.

## 5. Værktøjs- og handlingdesign

- [ ] Værktøjer er smalle og opgave-specifikke.
- [ ] Værktøjer udleder bruger, lejevært og rolle fra server-side autentificeringskontekst, ikke modellens argumenter.
- [ ] Hvert værktøj validerer argumenter med en skema og forretningsregler.
- [ ] Hvert værktøj udfører autorisering uafhængigt af modellen.
- [ ] Skriv-værktøjer er idempotente, hvor det er muligt.
- [ ] Eksterne sideeffekter kræver menneskelig godkendelse eller deterministiske politikkontroller.
- [ ] Ratestimer, kvoter og omkostningsgrænser er konfigureret.
- [ ] Værktøjsopkald logges med bruger, lejevært, arbejdsgang, promptversion, model, argumentoversigt og resultat.

## 6. Outputvalidering

- [ ] Modellens output analyseres med et strengt skema før brug.
- [ ] Ukendte felter afvises, når kontrakten bør være lukket.
- [ ] URLs, Markdown, HTML, filnavne og kodeblokke renses, hvor det er relevant.
- [ ] Output kan ikke indeholde dataklasser uden for opgavens tilladte omfang.
- [ ] Fakta fra private kilder kræver kilde-ID'er eller kildefragmenter.
- [ ] Fejlformateret output fejler lukket i stedet for at falde tilbage til frit tekst.

## 7. Regresstest

- [ ] Direkte injektionstest: brugerinput beder modellen om at ignorere instruktioner.
- [ ] Indirekte injektionstest: hentet indhold beder modellen om at afsløre data eller kalde et værktøj.
- [ ] Tvært-lejeværts-test: en anmodning prøver at få adgang til anden lejeværtsdata.
- [ ] Usikker værktøjsopkaldstest: modellen beder om en utilgåelig eller forbudt handling.
- [ ] Fejlformateret outputtest: ekstra felter eller ugyldige enum-værdier afvises.
- [ ] Ekstraktionstest: output prøver at inkludere hemmeligheder, private data eller prompttekst.
- [ ] Perspektivtest: opbevaret indhold indeholder skadelige instruktioner, der senere hentes.
- [ ] Multimodal test, hvis relevant: OCR- eller billedeviselige instruktioner behandles som ukendt.

## 8. Overvågning og incidentresponse

- [ ] Promptekstraktionssøgninger er opdagelige.
- [ ] Gentagne validatorfejl kan varsles.
- [ ] Ualmindelig hentningsbredde, værktøjsopkaldsvolumen, udgående modtagere, omkostninger eller hastighedsstigninger kan varsles.
- [ ] Promptinjektionssøgninger kan linkes til bruger, lejevært, arbejdsgang, kilde-ID'er og værktøjsopkald.
- [ ] Holdet ved, hvordan arbejdsgangen eller enkelte værktøjer deaktiveres.
- [ ] Holdet ved, hvordan leverandørnøgler revokeres og berørte legitimationsoplysninger roteres.
- [ ] Der er en ejer for beslutninger om kundekommunikation, juridisk kommunikation, sikkerhed og regulatorrapportering.

## Udgangsgate

Mærk arbejdsgangen ikke som produktionssikker, før:

- [ ] Alle højriskofunktioner har en gate.
- [ ] Mindst én adversariske dokumenttest er bestået.
- [ ] Mindst én ukontrolleret adgangsbesøg har fejlet sikkert.
- [ ] Mindst én usikker værktøjsopkaldsbesøg har fejlet sikkert.
- [ ] Mindst én fejlformateret outputtest har fejlet lukket.
- [ ] Mindst én arbejdsgang-deaktiveringssti er testet.
