Claude 3 Opus

Claude 3 Opus

AnthropicÆldre generation

Claude 3 Opus er Anthropic's mest kraftfulde model med state-of-the-art ydeevne på tværs af komplekse opgaver. Modellen udmærker sig i reasoning, analyse og kreativ skrivning.

Foto: Logan Voss / Unsplash

Ikke offentliggjort

Parametre

200K

Kontekst

$0.015

Input/1K

$0.075

Output/1K

Hvad modellen var

Claude 3 Opus udkom 4. marts 2024 som den største model i Anthropics Claude 3-familie. Den var udbyderens topmodel og blev placeret som svaret på de tungeste opgaver: lange analyser, kompleks reasoning, kodegenerering og kreativ skrivning. Parameterantallet er ikke offentliggjort.

Det tekniske spring lå især i to ting. Modellen håndterer et context window på 200.000 tokens, hvilket gjorde det praktisk at lægge hele kontrakter, rapporter eller kodebaser ind i én prompt. Samtidig er den multimodal og kan læse billeder, diagrammer og scannede sider sammen med tekst.

Opus blev også kendt for en bestemt arbejdsstil. Den fulgte lange instruktioner tæt, holdt tråden gennem flere trin og skrev prosa der ikke lød mekanisk. Det gjorde den til et almindeligt valg hos juridiske, akademiske og redaktionelle brugere i løbet af 2024. Træningsdata går frem til august 2023, hvilket sætter en fast grænse for hvad modellen ved uden RAG eller søgning.

Hvorfor den er blevet overhalet

Senere generationer fra både Anthropic og andre udbydere har flyttet sig på flere fronter samtidig. Reasoning er blevet stærkere, især på opgaver med mange trin, og nyere modeller er bedre til at bruge værktøjer, kalde funktioner og arbejde agentisk over længere forløb.

Hastighed og pris har rykket sig mest markant. Opus koster 0,015 USD per 1.000 input-tokens og 0,075 USD per 1.000 output-tokens, og den var langsom sammenlignet med mindre modeller allerede da den udkom. Nyere modeller leverer bedre resultater til lavere pris per token, og det ændrer regnestykket for stort set enhver produktionsopgave.

Dertil kommer at træningsdata fra august 2023 nu er gammelt. Modellen kender ikke udviklingen siden da, og du skal kompensere med kontekst i prompten. Kodegenerering er det område hvor afstanden til nutidige modeller er tydeligst.

Har den stadig en rolle

For nye projekter er svaret reelt nej. Der er ikke en opgavetype hvor Opus er det rigtige valg i dag, når nyere Claude-modeller er billigere, hurtigere og stærkere på de samme opgaver.

Der findes to undtagelser. Hvis du har et system i drift med prompts der er finjusteret til Opus' adfærd, kan det være rationelt at blive til der er tid til at teste om. Og hvis du reproducerer forskning eller evalueringer fra 2024, er adgang til den præcise model nødvendig for at resultaterne kan sammenlignes.

Modellen er ikke open source, så den kan ikke køres lokalt eller studeres på vægtniveau. Dens historiske betydning ligger i at den viste hvad et stort context window kombineret med stabil, lang reasoning kunne bruges til i praksis.

Capabilities

Opgaver

Avanceret reasoningKodegenereringAnalyse af lange dokumenterKreativ skrivningBilledforståelseMatematisk problemløsningForskningsassistent

Sprog Support

DanskEngelskSpanskFranskTyskItalienskPortugisiskJapansk+2 flere

Styrker

  • Ekstremt stærk reasoning og analyse
  • Meget stort kontekstvindue (200K)
  • Multimodal - forstår billeder
  • Fremragende til komplekse opgaver
  • Stærk i etik og sikkerhed
  • Glimrende til kreativ skrivning

Begrænsninger

  • !Dyr i forhold til mindre modeller
  • !Kan være overkill til simple opgaver
  • !Langsommere end mindre modeller

Use Cases

Juridisk dokumentanalyse
Forskningsassistent
Kompleks kodegenerering
Kreativ storytelling
Analyse af lange rapporter
Strategisk rådgivning
Avanceret dataanalyse

Benchmarks

86.8%
MMLU
95.4%
HellaSwag
84.9%
HumanEval
95%
GSM8K

Tekniske Detaljer

Release Dato
4.3.2024
Provider
Anthropic
Parametre
Ikke offentliggjort
Kontekstvindue
200,000 tokens
Træningsdata
Data frem til august 2023