Tre undersøgte mønstre til udformning af prompts eller søgning er chain-of-thought, self-critique og tree-of-thoughts. Chain-of-thought blev evalueret af Wei et al., 2022, og tree-of-thoughts af Yao et al., 2023, på bestemte modeller og benchmarks. Artiklerne dokumenterer ikke en universel forbedring for aktuelle modeller eller forretningsopgaver. Behandl hvert mønster som en hypotese, der skal sammenlignes med en direkte prompt på dit eget evalueringssæt.
Denne artikel forklarer hver teknik, hvornår du skal bruge den, og hvordan omkostningerne står mål med udbyttet.
Hvilket problem teknikkerne løser
Alle tre teknikker håndterer det samme grundproblem: En sprogmodel genererer normalt et svar autoregressivt, ét token ad gangen. Uden en særskilt fase til overvejelse eller søgning begrænser de første tokens hurtigt det efterfølgende forløb og kan fastholde svaret på en svag konklusion. Til enkle opgaver er det både tilstrækkeligt og effektivt. Ved ræsonnement i flere trin, kompleks analyse eller andre opgaver, hvor svaret afhænger af flere korrekte mellemresultater, kan standardforløbet give selvsikre, men forkerte resultater.
Prompterne beder om en mellemstruktur eller flere gennemløb. Mere synlig tekst eller flere kald kan øge omkostningen uden at dokumentere, at det underliggende svar er korrekt.
Chain-of-thought (CoT)
Det oprindelige mønster beder en model om at generere mellemliggende ræsonnement før en konklusion. I en virkelig arbejdsgang bør du i stedet bede om de kontrollerbare artefakter, du har brug for, eksempelvis ligninger, antagelser, kildebelæg, testresultater eller en kort beslutningsbegrundelse. Behandl ikke en frit formuleret intern redegørelse som dokumentation.
Et gennemarbejdet eksempel. Sammenlign:
Uden teknik: Et tog forlader Tallinn kl. 9:00 med en fart på 80 km/t. Et andet tog forlader Tartu kl. 9:30 og kører mod Tallinn med 100 km/t. Afstanden mellem byerne er 190 km. Hvornår mødes de?
med:
Med CoT: Samme spørgsmål. Tænk trin for trin. Beregn først, hvor langt det første tog når, før det andet starter. Opstil derefter ligningen for, hvornår de mødes. Vis dine beregninger, og giv så dit endelige svar.
Artiklen fra 2022 rapporterede forbedringer på flere benchmarks inden for aritmetik, hverdagsræsonnement og symbolsk ræsonnement for tilstrækkeligt store modeller, med væsentlig variation mellem opgaver og modeller. Overfør ikke disse historiske resultater til en aktuel model, en anden prompt eller produktionsdata. Kør begge promptvarianter, og vurder det endelige svar og de kontrollerbare mellemresultater.
Brug chain-of-thought til:
- Aritmetik i flere trin, især med enheder, datoer eller præcis afrunding. Selv stærke modeller fejler i disse opgaver.
- Logiske gåder og lignende problemer, hvor svaret er afslutningen på en kæde.
- Fejlfinding i kode, hvor svaret afhænger af, at tilstanden følges gennem programmet.
- Strategisk analyse, hvor konklusionen afhænger af en afvejning af flere faktorer.
Lad være med at bruge det til:
- Enkel genkaldelse af fakta. ”Hvad er Estlands hovedstad?” kræver ikke CoT.
- Genereringsopgaver. Skrivning, opsummering og udarbejdelse af udkast. CoT bruger blot flere tokens uden at forbedre kvaliteten.
- Ræsonnerende modeller. o3, Claude Extended Thinking og DeepSeek R1 udfører allerede CoT internt. Hvis du føjer ”tænk trin for trin” til prompten, er det i bedste fald overflødigt og i værste fald skadeligt.
Det sidste punkt er afgørende, og vi vender tilbage til det.
Self-critique
En teknik med to gennemløb. Bed først modellen om at fremstille et svar. Bed den derefter om at kritisere sit eget svar og fremstille en revideret version.
Promptens struktur:
Trin 1: [Your original question]
Trin 2: Gennemgå dit svar ovenfor. Find fejl, svagheder og steder, hvor du har gjort antagelser, der måske ikke holder. Vær en skarp kritiker af dit eget arbejde.
Trin 3: Udarbejd et revideret svar på baggrund af din kritik.
Et kritikgennemløb kan opdage visse fejl, men den samme model kan gentage eller rationalisere den samme fejl. Behandl self-critique som endnu en fejlbar evaluator. Brug deterministiske kontroller, indhentet dokumentation, test eller en uafhængig kvalificeret gennemgang, når konsekvenserne berettiger det.
En mere avanceret variant er konstitutionel eller principbaseret self-critique. Du definerer et sæt principper, som svaret skal opfylde, og beder derefter modellen vurdere svaret i forhold til hvert princip.
Principper for et godt svar på denne type spørgsmål:
- Det besvarer det faktiske spørgsmål, ikke en generalisering af det.
- Det citerer konkret dokumentation frem for blot at henvise løst til kilder.
- Det anerkender udtrykkeligt usikkerhed, hvor den findes.
- Det er kalibreret — sikkert på stærke punkter og forsigtigt på svage.
Udarbejd et svar. Vurdér det derefter i forhold til hvert princip. Revidér det til sidst.
Det er teknikken bag Anthropics arbejde med Constitutional AI og lignende tilgange i moderne forskning i AI-alignment.
Brug self-critique til:
- Skriveopgaver, hvor du ønsker et andet gennemløb uden at forlade samtalen.
- Analytisk arbejde, hvor modellen sandsynligvis er for selvsikker.
- Beslutningsstøtte, hvor modellen skal finde hullerne i sin egen argumentation.
- Kode, hvor du ønsker en gennemgang efter genereringen.
Lad være med at bruge det til:
- Opgaver, hvor der ikke findes et ”korrekt” svar at revidere hen imod, eksempelvis kreativ brainstorming og idégenerering.
- Opgaver, hvor du foretrækker selv at udføre kritikken, fordi din dømmekraft er selve værdien.
- Hurtige samtalesvar, hvor den ekstra svartid koster mere end kvalitetsgevinsten er værd.
Tree-of-thoughts (ToT)
Den dyreste teknik. I stedet for at fremstille én enkelt ræsonnementskæde overvejer modellen udtrykkeligt flere veje, vurderer hver af dem og vælger den mest lovende.
Strukturen i et gennemarbejdet eksempel:
Trin 1: Generér tre forskellige tilgange til dette problem.
Trin 2: Gennemgå de første skridt i hver tilgang uden at lægge dig fast på et endeligt svar.
Trin 3: Vurdér, hvilken tilgang der med størst sandsynlighed vil lykkes, og hvorfor. Vær konkret om styrker og svagheder.
Trin 4: Vælg den bedste tilgang, og færdiggør løsningen.
En træbaseret søgning kan være relevant, når et problem har flere plausible tilgange, og arbejdsgangen kan evaluere delvise løsningsveje. Tre genererede muligheder sikrer hverken reel variation eller beskyttelse mod en fælles fejlagtig antagelse. Fastlæg evalueringskriterier, og bevar dokumentationen for den valgte vej.
Praktisk eksempel — en vanskelig prompt:
Jeg har en kompleks SQL-forespørgsel, der kører for langsomt. Hjælp mig med at optimere den.
Trin 1: Generér tre forskellige optimeringsstrategier. Trin 2: Angiv for hver strategi den konkrete flaskehals, den vil afhjælpe, samt omkostningen. Trin 3: Vurdér, hvilken strategi der mest sandsynligt giver os den største gevinst med den mindste risiko. Trin 4: Implementér den valgte tilgang.
Prompten beder om mere end ”her er én omskrivning”: tre tilgange, en sammenligning, en anbefaling og en implementering. Vurdér, om den ekstra struktur faktisk forbedrer løsningen.
Brug tree-of-thoughts til:
- Problemer med flere troværdige løsninger. Arkitekturbeslutninger, valg af algoritme og strategiske valg.
- Optimeringsproblemer. Hvor du har grund til at sammenligne flere forslag frem for at acceptere det første.
- Kreative opgaver, hvor udforskningen er formålet. Navngivning, indramning og positionering.
- Alt, hvor du har mistanke om, at det oplagte svar er forkert.
Lad være med at bruge det til:
- Opgaver med én korrekt tilgang. Bed ikke om tre SQL-forespørgsler, når én virker.
- Enkle faktaspørgsmål. Det er overdrevet.
- De fleste opgaver til ræsonnerende modeller. Modellerne udfører nu denne form for udforskning internt.
Et praktisk beslutningstræ
Når du står med et vanskeligt problem, er spørgsmålet ikke ”skal jeg bruge CoT, self-critique eller ToT?” Det er ”hvilken form har problemet?”
- Lineært problem med flere trin (aritmetik, logisk gåde, stringent ræsonnement) → chain-of-thought.
- Problem, hvor overdreven selvsikkerhed er risikoen (analyse, anbefaling, kode, der skal gennemgås) → self-critique.
- Problem med flere plausible tilgange (optimering, strategisk valg, kreativ udforskning) → tree-of-thoughts.
- Samtalepræget, enkelt eller generativt → ingen af dem. Spring ekstraarbejdet over.
Kombinér ikke teknikkerne som standard. Sammenlign en direkte prompt, én form for stilladsering og en eventuel kombination på de samme eksempler. Behold den enkleste variant, der opfylder kriterierne for frigivelse.
Hvordan ræsonnerende modeller ændrer testen af prompts
Modeller med ræsonnement kan have styringsmuligheder og adfærd, der varierer mellem udbydere og versioner. Modelnavne, udfasningsdatoer, indstillinger for ræsonnement og synligheden af mellemliggende indhold ændrer sig. Brug udbyderens aktuelle dokumentation frem for en fastfrosset liste i en artikel.
Det ændrer den måde, du skal skrive prompts til dem på, på tre vigtige områder:
1. Begynd med resultatet. Beskriv målet, den vigtige kontekst, begrænsningerne, kravene til dokumentation og kriterierne for, hvornår opgaven er løst. OpenAI anbefaler i sin aktuelle vejledning til prompts for GPT-5.6, at du beskriver destinationen og validerer forenklinger af prompten på repræsentative opgaver.
2. Kontrollér resultatet, ikke mængden af ræsonnement. En større indsats til ræsonnement eller længere svartid er ikke bevis for, at svaret er korrekt. Kræv kildehenvisninger, beregninger, validering mod et skema, test eller anden dokumentation, der passer til opgaven, og mål det endelige resultat.
3. Sammenlign en direkte prompt med den nødvendige struktur. Fjern én gruppe af overflødige instruktioner ad gangen, men behold reelle begrænsninger og obligatoriske outputskemaer. En kortere prompt er kun bedre, hvis den fortsat består de samme evalueringer.
Et gennemarbejdet eksempel. Sammenlign disse to prompts til en ræsonnerende model:
Prompt A: ”Tænk trin for trin over følgende spørgsmål. Identificér først de vigtigste begrænsninger. Angiv derefter mulighederne. Vurdér så hver mulighed i forhold til begrænsningerne. Vælg til sidst. Vis din ræsonnering ved hvert trin. Spørgsmål: Bør vi indføre en firedages arbejdsuge?”
Prompt B: ”Bør vi indføre en firedages arbejdsuge? Kontekst: B2B SaaS med 80 medarbejdere; kundesupporten arbejder mandag-fredag.”
Prompt B er et nyttigt udgangspunkt, men den mangler beslutningskriterier, dokumentation, konsekvenser for interessenter og et kriterium for, hvornår opgaven er løst. Sammenlign den med en kort, struktureret prompt, og bedøm begge. Udpeg ikke en vinder alene ud fra promptens længde.
Forskellige modeller og indstillinger kan reagere forskelligt på stilladsering. Gem prompts sammen med model, version og evalueringsresultater, og test dem igen ved opgraderinger.
Beregning af omkostninger og udbytte
Teknikkerne kan tilføje genererede tokens, modelkald og svartid. Der findes ingen generel faktor, som kan overføres mellem modeller, uden at model, opgave, prompt, indstilling for ræsonnement og stopkriterium er fastlagt:
| Teknik | Hvad du skal måle | Mulig anvendelse |
|---|---|---|
| Ønsket mellemliggende arbejde | endelig nøjagtighed, artefakternes korrekthed, tokens, svartid | opgaver med kontrollerbare mellemresultater |
| Self-critique | fundne fejl, nye fejl, falsk sikkerhed, omkostning ved andet gennemløb | revision efter tydelige kriterier |
| Søgning ad flere veje | variation mellem vejene, evaluatorens nøjagtighed, samlet antal kald, svartid i de langsomste tilfælde | problemer med reelt forskellige mulige tilgange |
| Udbyderens ræsonnementstilstand | beståelsesprocent pr. indsatsniveau, tokens, svartid, pris | kun når en højere indsats forbedrer evalueringen før frigivelse |
Brug en direkte prompt som udgangspunkt. Tilføj kun stilladsering eller en indstilling for ræsonnement, når den målte kvalitetsforbedring er den ekstra omkostning og svartid værd for den konkrete opgave.
En praktisk regel: Før du vælger en teknik, skal du spørge, om omkostningen ved at tage fejl i denne opgave er stor nok til at retfærdiggøre teknikkens ekstra omkostning. Hvis ja, så brug den rette. Hvis nej, så send blot prompten.
Gennemarbejdet eksempel: En virkelig vanskelig opgave
Forestil dig, at du vurderer to tilbud fra leverandører og ønsker en kalibreret sammenligning.
Uden teknik (almindelig prompt):
Sammenlign disse to leverandørtilbud [paste]. Hvilket skal vi vælge?
Du får et forsigtigt svar, der ser begge sider. Et nyttigt udgangspunkt, men ikke tilstrækkeligt.
Med CoT:
Sammenlign disse to leverandørtilbud. Tænk trin for trin:
- Angiv de kriterier, der har betydning for vores beslutning.
- Giv hver leverandør en score på hvert kriterium.
- Find de kriterier, hvor scorerne afviger mest.
- Giv derefter din anbefaling.
Du får en langt mere struktureret analyse. Hvert trin er synligt, så du kan kontrollere eller rette det.
Med self-critique ovenpå:
[same as above]
Kritiser din egen analyse efter anbefalingen:
- Hvilke kriterier kan jeg have vægtet forkert?
- Hvad antog jeg, som jeg ikke burde have antaget?
- Hvad er den stærkeste troværdige argumentation for den anden leverandør?
Udarbejd derefter om nødvendigt en revideret anbefaling.
Kritikken skaber en mulighed for at finde blinde vinkler. Kontrollér, om den faktisk gjorde det.
Med ToT:
Sammenlign disse to leverandørtilbud.
Trin 1: Generér tre forskellige rammer for beslutningstagning til denne type valg, eksempelvis minimering af risiko, maksimering af værdi og tilpasning til kompetencer. Trin 2: Anvend hver ramme. Fremstil tre anbefalinger. Trin 3: Hvor er rammerne enige? Hvor afviger de? Trin 4: Hvilken ramme er mest passende i betragtning af vores faktiske begrænsninger? Giv en endelig anbefaling.
Prompten beder om tre vinkler. Kontrollér, at de er reelt forskellige og bygger på dokumentation frem for at være omformuleringer af den samme antagelse.
Med en ræsonnerende model:
Sammenlign disse to leverandørtilbud. Hvilket skal vi vælge, og hvorfor? Medtag de forhold, der ville ændre dit svar.
Dette er det direkte udgangspunkt. Det synlige svar dokumenterer ikke, hvilken intern proces der fandt sted. Sammenlign svarets korrekthed, dokumentation, tokenforbrug og svartid med de strukturerede varianter.
Ved vanskeligt analytisk arbejde bør du evaluere en aktuel model med ræsonnement og en direkte prompt, der begynder med resultatet, før du tilføjer stilladsering. Behold kun stilladseringen, hvis den forbedrer opgavens evaluering.
Nogle praktiske vaner
Gør teknikken synlig for dig selv. Notér i prompten, hvilken teknik du brugte. Det hjælper dig med at opbygge intuition for, hvad der virker.
Sammenlign resultater. Kør de samme repræsentative eksempler med og uden teknikken efter relevante ændringer af model, prompt, data eller politik. Bedøm dem efter faste kriterier. En synlig forskel er ikke i sig selv kvalitet.
Kombinér ikke teknikker uden omtanke. En kombination af CoT + self-critique + ToT + en ræsonnerende model er sjældent bedre end at vælge den rette teknik. Hvert lag øger omkostningen. Tilføj kun lag, der reelt forbedrer svaret på netop din opgave.
Opbevar teknikkerne i dit bibliotek. Tekststumper til ”med CoT”, ”med self-critique” og ”med ToT”, som kan anvendes på den aktuelle opgave, sparer reel tid sammenlignet med at skrive stilladseringen igen.
Vælg den teknik, der tjener sin omkostning hjem
Teknikkerne er mulige hjælpemidler, ikke garantier: mellemresultater til kontrollerbart arbejde i flere trin, self-critique til et andet gennemløb efter faste kriterier og søgning ad flere veje til problemer med reelt forskellige tilgange. Modeller med ræsonnement ændrer sammenligningen, så evaluér på ny i stedet for at videreføre historiske forestillinger om prompts.
Brug den rette teknik til problemet. Spring den over, når den ikke tjener sin omkostning hjem. Skeln mellem et ”vanskeligere problem” og et ”anderledes problem”. Teknikken skal vælges ud fra denne forskel.



