Self-Consistency

Self-Consistency

Advanced

Advanced Reasoning

Self-consistency genererer multiple reasoning paths for samme problem og vælger det mest konsistente svar. Dette forbedrer accuracy markant ved komplekse opgaver.

Foto: Markus Spiske / Unsplash

Hvad teknikken går ud på

Self-consistency er en sampling-strategi, ikke en prompt-formulering. Du kører den samme prompt flere gange med temperatur over nul, lader modellen resonnere sig frem til et svar hver gang, og tæller bagefter hvor ofte hvert slutsvar optræder. Det hyppigste svar bliver det endelige.

Forskellen til Chain-of-Thought er antallet af forsøg. CoT producerer én kæde af mellemregninger, og knækker kæden tidligt, følger fejlen med hele vejen til konklusionen. Self-consistency forudsætter CoT og lægger et lag ovenpå, hvor kun slutsvarene sammenlignes.

Forskellen til Tree-of-Thought er, hvornår sammenligningen sker. Tree-of-Thought forgrener undervejs og vurderer delresultater, så svage grene kan beskæres før de er færdige. Self-consistency lader hver kæde løbe til ende uden indblanding og afgør først bagefter. Det gør kaldene fuldt parallelle og implementeringen enklere.

Hvorfor det virker

Tokens vælges fra en sandsynlighedsfordeling. Ved temperatur over nul rammer valget ind imellem et andet token end det mest sandsynlige, og en lille afvigelse tidligt i resonnementet kan sende resten af udregningen ad en anden rute. Flere kald giver derfor flere forskellige mellemregninger.

Det afgørende er, at der typisk findes mange veje til det rigtige svar, mens forkerte svar fordeler sig spredt. En regnefejl i tredje skridt giver ét forkert tal, en anden fejl et andet. De korrekte kæder lander derimod på samme værdi, uanset hvilken rute de tog.

Optællingen marginaliserer altså over de latente reasoning paths i stedet for at stole på en enkelt stikprøve. Mekanismen svarer til ensemble-metoder i klassisk machine learning: variansen falder, når uafhængige forsøg lægges sammen, forudsat at fejlene ikke er korrelerede.

Hvornår det ikke hjælper

Antagelsen om ukorrelerede fejl holder ikke altid. Har modellen en systematisk misforståelse af opgaven, en fejllæst enhed eller en forkert præmis fra prompten, gentager alle fem kæder samme fejl. Så får du fem enslydende forkerte svar og et konsensustal, der ser overbevisende ud.

Teknikken kræver også et svar, der kan sammenlignes maskinelt. Tal, klassifikationer og valg mellem faste kategorier kan tælles op. Fritekst, kode og oversættelser kan ikke, fordi to lige gode besvarelser sjældent er tegnidentiske.

Stemmefordelingen er ikke et kalibreret konfidensmål. Fire ud af fem betyder ikke 80 procents sandsynlighed for at svaret er korrekt, kun at fire kæder konvergerede.

Reasoning-modeller som Claude Opus 5, GPT-5.6 Sol og Gemini 3.1 Pro udfører allerede en intern afsøgning med selvkontrol før de svarer. Gevinsten ved ekstern stemmeoptælling er derfor mindre end på tidligere modelgenerationer. På opgaver som modellen i forvejen løser stabilt, betaler du mange gange så mange tokens for det samme resultat.

Opsætning og optælling

Temperatur nul ødelægger teknikken. Uden variation bliver kaldene næsten identiske, og optællingen bekræfter blot det første svar. Typisk ligger temperaturen mellem 0,6 og 1,0, højt nok til at ruterne adskiller sig, lavt nok til at kæderne hænger sammen.

En variant beder om flere løsninger i ét enkelt kald. Det er billigere, men kæderne er ikke uafhængige, fordi hver ny løsning kan se de foregående i modellens context window. Resultatet bliver ofte fem varianter af samme tankegang.

Bed om slutsvaret i et fast format, så udtrækningen kan automatiseres. Et afsluttende felt med kun tallet eller kun kategorien fjerner tvivl om, hvad der stemmes om.

Eksempel

Prompt:

Generer 5 forskellige løsninger til problemet og vælg den mest almindelige konklusion.

Output:

Gennem majoritetsstemme finder vi det mest pålidelige svar.

Hvornår skal du bruge denne teknik?

  • Kritiske beslutninger
  • Matematiske problemer
  • Når høj accuracy er vigtig
  • Kompleks reasoning

Fordele

  • Højere accuracy end single-path
  • Reducerer fejl
  • Robust til forskellige formuleringer
  • God til usikre problemer

Ulemper

  • !Meget dyr (5-10x tokens)
  • !Langsom
  • !Overkill til simple opgaver

Tips & Best Practices

  • 💡Brug 5-10 samples typisk
  • 💡Kombiner med Chain-of-Thought
  • 💡Brug kun når accuracy er kritisk
  • 💡Implementer parallel processing

Relaterede Teknikker