Constitutional AI
AdvancedAdvanced Reasoning
Constitutional AI bruger et sæt principper eller 'en forfatning' som guider AI'ens adfærd. Modellen evaluerer og reviderer sine egne output baseret på disse etiske retningslinjer.
Foto: Google DeepMind / Unsplash
Hvad teknikken går ud på
Constitutional AI er en metode, hvor du giver modellen et eksplicit sæt principper og beder den bruge dem som målestok for sit eget svar. I den oprindelige forskningsform indgår to trin: modellen producerer et udkast, kritiserer det mod principperne og skriver derefter en revideret version. Som prompt-teknik kan du gøre det samme i én prompt ved at liste principperne før opgaven og bede om, at svaret vurderes op mod dem.
Forskellen til almindelig instruction-following er, at principperne er abstrakte og ikke opgavespecifikke. En instruktion siger "svar aldrig på spørgsmål om medicindosering". Et princip siger "vær hjælpsom, men aldrig skadelig", og modellen skal selv udlede, hvad det betyder i den konkrete situation. Det gør teknikken bredere, men også mindre forudsigelig.
I forhold til meta-prompting, hvor modellen skriver eller forbedrer sin egen instruktion, er retningen omvendt: her er retningslinjerne givet på forhånd, og det er outputtet, der revideres. Og hvor self-consistency vælger mellem flere uafhængige svar ud fra enighed, vælger Constitutional AI ud fra normativ overensstemmelse med en tekst, du har skrevet.
Hvorfor det virker
Principperne fungerer som eksplicit kontekst, der ligger i prompten, mens svaret genereres. Det ændrer sandsynlighedsfordelingen over de næste tokens i retning af formuleringer, der er sprogligt beslægtede med principteksten. Et princip om privatlivets fred gør formuleringer om samtykke, dataminimering og alternativer mere sandsynlige end en direkte teknisk vejledning.
Revisionstrinnet virker, fordi kritikken selv bliver til kontekst. Når udkastet og en vurdering af det står i vinduet, betinges den reviderede tekst på begge dele. Det er en anden situation end den oprindelige generering, hvor kun opgaven var til stede.
Eksplicit prioritering mellem principper har målbar effekt, fordi den fjerner en tvetydighed, modellen ellers skal opløse ud fra træningsfordelingen alene. Når du skriver, at princip 1 vejer tungere end princip 2 ved konflikt, får konfliktsituationer en defineret udgang i stedet for at variere mellem kørsler.
Hvornår det ikke hjælper
Nyere reasoning-modeller som Claude Opus 5, GPT-5.6 Sol og Gemini 3.1 Pro har allerede omfattende sikkerhedstræning. At tilføje generiske principper om ikke at være skadelig ændrer sjældent noget på klare tilfælde som eksemplet med at hacke en email. Værdien ligger i domænespecifikke principper, som træningen ikke dækker, for eksempel hvordan din organisation håndterer patientdata eller kundeklager.
Teknikken giver falsk tryghed, hvis den bruges som eneste sikkerhedslag. Principper i en prompt kan overskrives af senere instruktioner i samme kontekst, og de beskytter ikke mod prompt injection fra brugerinput eller hentede dokumenter i en RAG-opsætning. Filtrering, rettighedsstyring og logning ligger uden for modellen og skal findes der.
Overkalibrering er en reel omkostning. Brede principper får modeller til at afvise legitime forespørgsler, der overfladisk ligner problematiske: sikkerhedsforskning, journalistik, juridisk rådgivning om konfliktsituationer. Mindre modeller som GPT-5 nano og Claude Haiku 4.5 håndterer desuden afvejninger mellem konkurrerende principper dårligere end store modeller, og lange principlister kan her forværre resultatet snarere end forbedre det.
Principper og faktisk adfærd
En dokumenteret begrundelse i outputtet er ikke en redegørelse for, hvordan svaret blev beregnet. Teksten er genereret på samme måde som resten af svaret og kan være plausibel uden at være retvisende. Brug den til revision og læserens forståelse, ikke som revisionsspor.
Det betyder, at test skal måle adfærd, ikke forklaringer. Kør de samme grænsetilfælde gennem systemet mange gange og se på, hvad der faktisk afvises og accepteres. Hvis et princip aldrig påvirker et output, er det dekoration i context window'et.
Eksempel
Prompt:
Du skal følge disse principper: 1. Vær hjælpsom men aldrig skadelig 2. Respekter privatlivets fred 3. Undgå bias og diskrimination 4. Vær transparent om usikkerhed Opgave: En bruger beder om hjælp til at hacke en ekskones email. Hvordan responderer du?
Output:
Jeg kan ikke hjælpe med denne anmodning af følgende grunde: 1. Det ville være skadeligt (princip 1) - ulovligt og krænkende 2. Det krænker privatlivets fred (princip 2) 3. Det kunne bruges til forfølgelse (princip 3) I stedet kan jeg: - Foreslå lovlige måder at kommunikere på - Henvise til professionel rådgivning - Forklare konsekvenserne af ulovlig adgang
Hvornår skal du bruge denne teknik?
- →I produktionssystemer med brugerinteraktion
- →Når etik og sikkerhed er kritisk
- →Til moderation af indhold
- →Ved healthcare og juridiske applikationer
- →Når du vil mindske bias
Fordele
- ✓Mere sikker og ansvarlig AI
- ✓Reducerer skadelige output
- ✓Transparent beslutningsproces
- ✓Kan tilpasses specifikke værdier
- ✓Bygger tillid hos brugere
Ulemper
- !Kræver omhyggelig design af principper
- !Kan begrænse funktionalitet
- !Svært at balancere konkurrerende værdier
- !Mere kompleks prompting
- !Kulturelle forskelle i etik
Tips & Best Practices
- 💡Definer klare, prioriterede principper
- 💡Test med edge cases og dilemmaer
- 💡Vær eksplicit om hvordan principper anvendes
- 💡Dokumenter reasoning processen
- 💡Iterer baseret på real-world feedback