Klassificering & Kategorisering
Data
Automatisk klassificering af tekst, emails, dokumenter og content i kategorier med høj præcision ved hjælp af LLMs.
Foto: Brett Jordan / Unsplash
Sværhedsgrad
Intermediate
Estimeret Omkostning
Lav til Medium
Hvad det er
Klassificering dækker den opgave, hvor en model tildeler et stykke tekst en eller flere labels fra en på forhånd defineret liste. Input kan være en email, en supportsag, et dokument, en produktbeskrivelse eller et kundesvar. Output er ikke fri tekst, men et valg inden for en lukket mængde kategorier.
Grænsen mod ekstraktion går ved, hvad der kommer ud. Ekstraktion trækker værdier ud af teksten, som CVR-numre eller datoer, mens klassificering vælger blandt kategorier, du selv har bestemt. En sag kan sagtens involvere begge dele, men de bør bygges og evalueres hver for sig.
Opgaven adskiller sig også fra søgning og RAG. Der finder du relevant indhold på baggrund af et spørgsmål, mens klassificering placerer et kendt stykke indhold i en struktur. Sentimentanalyse og intent-detektion er i praksis specialtilfælde af klassificering med en fast, lille taksonomi.
Sådan fungerer det
Kernen er en taksonomi og en prompt. Taksonomien er listen over kategorier med en definition af hver enkelt, og typisk et par eksempler samt en afgrænsning mod naboklassen. Prompten indeholder definitionerne, teksten der skal klassificeres, og en instruktion om outputformat.
Output bør være struktureret. Brug JSON med et felt, der kun må indeholde værdier fra en enum, og eventuelt et felt til begrundelse og et til confidence. Structured output eller function calling håndhæver formatet, så du undgår parsing af fritekst. Sæt temperatur til 0 for at gøre resultatet så deterministisk som muligt.
Kvaliteten afgøres først og fremmest af, hvor skarpt kategorierne er defineret, og hvor repræsentative eksemplerne er. Modellens størrelse betyder mindre end taksonomiens klarhed. GPT-5 nano og Claude Haiku 4.5 klarer typisk veldefinerede taksonomier med 5 til 20 klasser, mens Claude Sonnet 5 og GPT-5.6 Sol bliver relevante ved lange taksonomier, tvetydige tekster eller flere labels ad gangen.
Du måler kvaliteten på et gold-datasæt, hvor mennesker har sat labels i forvejen. 200 til 500 eksempler med rimelig dækning af alle klasser er ofte nok til at se, hvor systemet fejler.
Hvad der går galt i praksis
Den hyppigste fejlkilde er ikke modellen, men taksonomien. Kategorier, der overlapper semantisk, giver ustabile resultater, fordi to labels begge kan forsvares. Hvis to mennesker er uenige om samme sag, kan du ikke forvente, at modellen rammer det ene svar konsistent.
Lange kategorilister skaber positionsbias. Modeller har tendens til at vælge klasser, der står tidligt i listen, eller som har mest tekst i definitionen. Test det ved at rotere rækkefølgen og se, om fordelingen flytter sig.
Klasseubalance skjuler fejl. En samlet accuracy på 94 procent kan dække over, at den sjældne, men forretningskritiske kategori rammes i under halvdelen af tilfældene. Mål precision og recall per klasse i stedet for et samlet tal.
Endelig flytter små promptændringer fordelingen af labels uden varsel. En omformulering, en tilføjet kategori eller et modelskifte kan ændre, hvor sagerne lander, uden at noget fejler synligt. Kør derfor dit gold-datasæt igennem ved hver ændring og sammenlign fordelingen med den forrige version.
Eskalering og driftsøkonomi
Ved høje volumener giver det mening at køre i to trin. Lad en billig model som GPT-5 nano eller Claude Haiku 4.5 tage hovedparten, og send kun sager med lav confidence eller flertydigt output videre til Claude Sonnet 5 eller GPT-5.6 Sol. Det holder omkostningen nede, uden at de svære sager forsvinder i statistikken.
Husk at holde et spor tilbage til mennesker. De sager, hvor systemet er usikkert, er også dem, der giver de bedste nye eksempler til taksonomien.
Anbefalede Modeller
Fordele
- ✓Automatisk kategorisering
- ✓Konsistent klassificering
- ✓Håndter komplekse taxonomier
- ✓Multi-label classification
- ✓Skalér til store volumener
- ✓Nemt at opdatere kategorier
Udfordringer
- !Kræver klare kategoridefinitioner
- !Edge cases håndtering
- !Accuracy validering
- !Cost ved høje volumener
- !Bias i klassificering
Implementation Tips
- 💡Definer kategorier præcist
- 💡Giv eksempler for hver kategori
- 💡Brug confidence scores
- 💡Implementer feedback loop
- 💡A/B test med traditional ML
Eksempler fra Den Virkelige Verden
- →Email routing og triage
- →Content tagging
- →Support ticket kategorisering
- →Document classification
- →Lead scoring