Temperature Tuning
IntermediateIntermediate Prompting
Temperature er en parameter (0-2) der styrer hvor kreativ vs. deterministisk modellen er. Lav temperature (0-0.3) giver præcise, konsistente svar. Høj temperature (0.7-1.5) giver kreative, varierede svar.
Foto: Zach M / Unsplash
Hvad teknikken går ud på
Temperature er ikke noget du skriver i prompten. Det er en parameter i API-kaldet, som ændrer hvordan modellen vælger det næste token. Selve prompten kan stå uændret, mens outputtet skifter karakter fra tørt og forudsigeligt til varieret og associativt.
Forskellen til top-p sampling ligger i, hvor indgrebet sker. Top-p skærer halen af kandidatlisten væk og beholder kun de tokens, der tilsammen udgør en given sandsynlighedsmasse. Temperature fjerner ingen kandidater, men ændrer vægtningen mellem dem. Du kan derfor køre med høj temperature og alligevel få et snævert udvalg, hvis top-p er lav.
Self-consistency bruger temperature som middel frem for mål. Der genereres flere svar ved en temperature over nul, hvorefter det hyppigste svar vælges. Temperature tuning alene sigter mod at ramme det rigtige niveau i ét enkelt kald.
Hvorfor det virker
For hvert nyt token beregner modellen en score, et logit, for hvert element i vokabularet. Scorerne omregnes til sandsynligheder med en softmax-funktion. Temperature divideres ind i logits, før det sker.
En værdi under 1 forstørrer afstanden mellem høje og lave scorer. Fordelingen bliver spids, og det mest sandsynlige token vinder næsten altid. En værdi over 1 trykker fordelingen fladere, så tokens med moderat sandsynlighed får reel chance for at blive valgt.
Effekten er kumulativ. Et usædvanligt token tidligt i svaret indgår i konteksten for alle efterfølgende tokens. Derfor kan en lille justering give store forskelle i tekstens retning og struktur, ikke kun i det enkelte ordvalg.
Hvornår det ikke hjælper
Temperature 0 er ikke det samme som garanteret reproducerbarhed. Rækkefølgen af flydende taloperationer på GPU'er, batching af flere forespørgsler og routing i mixture-of-experts-arkitekturer kan give forskellige svar på identiske kald. Lav temperature reducerer variansen, men fjerner den ikke.
Parameteren fjerner heller ikke hallucination. En faktuelt forkert påstand kan sagtens være det mest sandsynlige næste token, og temperature 0 vælger den så hver gang. Konsistente svar føles mere troværdige, end de er.
Nyere reasoning-modeller flytter en del af behovet. Når Claude Opus 5 eller GPT-5.6 Sol kører med udvidet tænkning, anbefaler udbyderne typisk en fast temperature, og nogle endpoints ignorerer eller afviser parameteren i den tilstand. Kvaliteten styres i stedet af, hvor meget reasoning-budget du tildeler.
Ved struktureret output er høj temperature direkte skadelig. JSON, kode og faste skemaer har få gyldige fortsættelser, og en fladere fordeling øger risikoen for syntaksfejl. Over cirka 1.2 producerer de fleste modeller sprogligt svækket tekst, hvor variationen ligner tilfældighed mere end idérigdom.
Samspil med øvrige sampling-parametre
Temperature deler kontrollen med top-p, top-k og eventuelle repetition penalties. Skruer du på to ting samtidig, kan du ikke afgøre hvilken der gav effekten. Hold de øvrige fast, mens du varierer én.
En optimal værdi kan sjældent overføres mellem modeller. Gemini 3.1 Pro og Claude Haiku 4.5 har forskellige logit-fordelinger, og 0.7 hos den ene svarer ikke til 0.7 hos den anden. Når du skifter model eller modelversion, skal indstillingen valideres på ny.
Eksempel
Prompt:
Skriv en produktbeskrivelse for en smartwatch Temperature 0.1: 'SmartWatch Pro har 1.4" AMOLED display, 7 dages batteritid, pulsmåler og vandtæthed til 50m. Kompatibel med iOS og Android.' Temperature 1.0: 'Oplev fremtidens teknologi på dit håndled! SmartWatch Pro forener elegant skandinavisk design med kraftfuld sundhedsteknologi. Din personlige wellness-coach følger din puls, søvn og aktivitet 24/7.'
Output:
Hvornår skal du bruge denne teknik?
- →Lav (0-0.3): Fakta, kode, matematik, klassifikation
- →Medium (0.5-0.7): Almindelig chat, Q&A
- →Høj (0.8-1.5): Kreativ skrivning, brainstorming, marketing
Fordele
- ✓Nem at eksperimentere med
- ✓Stor indflydelse på output kvalitet
- ✓Ingen ekstra tokens
- ✓Understøttes af alle APIs
- ✓Kan finjusteres til use case
Ulemper
- !Kan give uforudsigelige resultater ved høje værdier
- !Ikke en løsning på dårlige prompts
- !Kræver eksperimentering
- !Optimal værdi varierer per model
Tips & Best Practices
- 💡Start med 0 for faktuelle opgaver
- 💡Brug 0.7-0.9 for kreativt indhold
- 💡Test systematisk i 0.1 intervaller
- 💡Kombiner lav temperature med Chain-of-Thought
- 💡Brug høj temperature til brainstorming, lav til udvælgelse
- 💡Log og sammenlign resultater