Top-P Sampling (Nucleus)
IntermediateIntermediate Prompting
Top-P (nucleus sampling) er en alternativ metode til temperature for at kontrollere variation. I stedet for at justere randomness, vælger modellen fra de top P% mest sandsynlige tokens (f.eks. top-p=0.9 = top 90%).
Foto: Markus Spiske / Unsplash
Hvad teknikken går ud på
Top-P, også kaldet nucleus sampling, er et afskæringsfilter på modellens sandsynlighedsfordeling over næste token. Tokens sorteres faldende efter sandsynlighed, og der lægges sammen indtil den kumulative masse når P. Kun de tokens sættes tilbage i puljen, resten får sandsynlighed nul, og de tilbageværende renormaliseres.
Forskellen til temperature er hvor i kæden indgrebet sker. Temperature skalerer logits før softmax og ændrer hele fordelingens form, så halen bliver enten fladere eller stejlere, men den fjerner ingenting. Top-P ændrer ikke de indbyrdes forhold mellem de valgte tokens, den beskærer kun hvor mange kandidater der overhovedet er i spil.
Den nærmeste nabo er top-k, som beholder et fast antal kandidater uanset situationen. Top-k=10 giver ti muligheder både når modellen er næsten sikker og når den er i vildrede. Top-P giver derimod få kandidater ved skarpe fordelinger og mange ved flade, fordi grænsen defineres af sandsynlighedsmasse og ikke af antal.
Hvorfor det virker
Sprogmodellers fordeling over næste token har en lang hale. Selv når de fem øverste kandidater dækker 80 procent af massen, ligger der tusindvis af tokens med hver især en brøkdel af en procent. Ved ren sampling bliver et af dem valgt jævnligt, simpelthen fordi halen er så bred.
Et enkelt token fra halen er sjældent en isoleret fejl. Det bliver del af konteksten for alle efterfølgende tokens, og modellen fortsætter konsistent ud fra det den allerede har skrevet. En upassende ordvalg tidligt i et afsnit kan trække resten af afsnittet i en retning, der aldrig lå i den oprindelige intention.
Top-P fjerner halen uden at røre ved de dele af fordelingen, hvor der reelt er flere gode svar. Det er den adaptive del af mekanismen. Efter "Katten sad på" er der ægte variation at hente, og nucleus'et rummer flere ord. Midt i et fast udtryk eller et tal er fordelingen næsten degenereret, og nucleus'et krymper automatisk til en eller to kandidater.
Hvornår det ikke hjælper
Ved temperature 0 eller ren greedy decoding er Top-P uden effekt. Det mest sandsynlige token bliver valgt uanset hvad, og parameteren ændrer intet i outputtet. Det samme gælder i praksis ved meget lave temperature-værdier, hvor fordelingen allerede er kollapset til én dominerende kandidat.
Top-P beskytter ikke mod faktuelle fejl. Hallucinationer er typisk sammensat af tokens med høj sandsynlighed, fordi en opdigtet reference eller et forkert årstal ligner de rigtige rent sprogligt. En stram nucleus gør outputtet mere forudsigeligt og dermed mere overbevisende, uden at gøre det mere korrekt. Det er teknikkens vigtigste kilde til falsk tryghed.
Flere reasoning-modeller accepterer desuden ikke sampling-parametre sammen med extended thinking. Claude Opus 5 og Gemini 3.1 Pro kører deres interne ræsonnement på faste indstillinger, og forsøg på at justere Top-P bliver enten afvist eller ignoreret. Til den type opgaver ligger kontrollen i prompten og i valget af model, ikke i decoding-parametrene.
Rækkefølgen af filtre i praksis
Når du bruger flere parametre samtidig, anvendes de i en bestemt rækkefølge i de fleste implementeringer. Temperature skalerer logits først, derefter beskærer top-k, og til sidst top-p på det der er tilbage. Rækkefølgen forklarer hvorfor kombinationer opfører sig kontraintuitivt.
Hæver du temperature, flyttes masse ud i halen, og Top-P slipper derfor flere tokens igennem ved samme værdi. To indstillinger, der virker ens hver for sig, kan give meget forskellige resultater sammen. Skift kun én parameter ad gangen, når du kalibrerer.
Enkelte API'er anvender også et minimumsantal tokens, så nucleus'et aldrig bliver tomt. En Top-P på 0,1 udelukker derfor ikke sampling, den reducerer bare puljen til det ene eller de to mest sandsynlige. Detaljen er sjældent dokumenteret og varierer mellem udbydere.
Eksempel
Prompt:
Næste ord efter 'Katten sad på' Top-P = 1.0 (alle muligheder): Muligheder: måtten (40%), stolen (15%), bordet (10%), taget (8%), græsset (5%)... Top-P = 0.5 (top 50%): Kun: måtten (40%), stolen (15%) - mere fokuseret output Top-P = 0.1 (top 10%): Næsten altid: måtten (40%) - højst sandsynligt output
Output:
Hvornår skal du bruge denne teknik?
- →Når temperature ikke giver ønsket kontrol
- →For mere dynamisk variation end temperature
- →Til kreativ skrivning der skal være coherent
- →Kombiner med lav temperature for finere kontrol
- →Ved lange tekster hvor konsistens er vigtig
Fordele
- ✓Mere naturlig variation end temperature
- ✓Undgår helt usandsynlige ord
- ✓Adaptiv - tilpasser sig kontekst
- ✓God til lang tekst generering
- ✓Bedre coherence ved kreative opgaver
Ulemper
- !Mindre intuitiv end temperature
- !Kan være svært at forudsige output
- !Interagerer komplekst med temperature
- !Ikke alle APIs dokumenterer det godt
Tips & Best Practices
- 💡Brug 0.9-0.95 for balanceret kvalitet
- 💡Kombiner med temperature=0.7 for kreativitet
- 💡Sænk til 0.5 for mere fokuseret output
- 💡Undgå at bruge både lav temperature OG lav top-p
- 💡Test med forskellige værdier for din use case
- 💡Dokumenter hvad der virker for forskellige opgaver