OpenAI o1-preview

OpenAI o1-preview

OpenAIÆldre generation

OpenAI o1-preview er en ny serie af reasoning models designet til at bruge tid på at 'tænke' før de svarer. Modellen exceller i kompleks reasoning, videnskab, kodning og matematik gennem forstærket læring.

Foto: Zach M / Unsplash

Ikke offentliggjort

Parametre

128K

Kontekst

$0.015

Input/1K

$0.06

Output/1K

Hvad modellen var

o1-preview udkom 12. september 2024 og var OpenAIs første offentligt tilgængelige model i den serie, der blev markedsført som reasoning models. Den centrale idé var, at modellen bruger regnekraft på at tænke sig frem til et svar under inference, i stedet for at producere svaret direkte token for token. Det gav mærkbart bedre resultater på opgaver med mange trin.

Modellen blev brugt til matematik, videnskabelig analyse, algoritmisk design og kodeopgaver, hvor et forkert mellemregningstrin ødelægger hele svaret. Den havde et context window på 128.000 tokens og træningsdata frem til oktober 2023. Parameterantallet blev aldrig offentliggjort.

Navnet preview var ikke pynt. Udgaven var eksplicit en tidlig version med færre funktioner end en færdig model, og prisen på 0,015 USD per 1.000 input-tokens og 0,06 USD per 1.000 output-tokens placerede den som et værktøj til svære opgaver frem for daglig brug. Betydningen lå i, at den flyttede opmærksomheden fra modelstørrelse til, hvor meget beregning en model får lov at bruge på det enkelte svar.

Hvorfor den er blevet overhalet

Udviklingen efter o1-preview gik i flere retninger på én gang. Senere reasoning models blev hurtigere, billigere per opgave og fik mulighed for at justere, hvor meget tænkning der bruges, så simple spørgsmål ikke koster det samme som svære.

Samtidig lukkede de nyere modeller hullerne i preview-udgaven. Function calling, struktureret output, værktøjsbrug og bredere multimodal input blev standard, og det gjorde reasoning-modeller anvendelige i produktion i stedet for kun til enkeltstående, tunge spørgsmål.

Træningsdata frem til oktober 2023 er desuden blevet gammelt. Det betyder mindre for ren matematik og logik end for spørgsmål om biblioteker, API'er og andet, der ændrer sig løbende.

Har den stadig en rolle

Nej, ikke i praktisk brug. Modellens vægte er ikke frigivet, så du kan ikke køre den lokalt eller bruge den til at studere reasoning-adfærd på egen hardware. Adgangen går udelukkende gennem OpenAIs API, og den er en legacy-model, som ikke er udbyderens aktuelle valg til nogen opgavetype.

Den eneste reelle rolle er historisk og dokumentarisk. Har du evalueringer, benchmarks eller forskningsresultater fra efteråret 2024, der refererer til o1-preview, er det nyttigt at vide, hvad modellen var, og hvorfor tallene ikke uden videre kan overføres til nyere reasoning models.

Bygger du noget nyt, bør du gå direkte til en aktuel model i samme familie.

Capabilities

Opgaver

Avanceret reasoningKompleks matematisk problemløsningVidenskabelig analyseKodegenerering og debuggingMulti-step problemløsningLogisk deduktionStrategisk planlægningAlgoritmisk design

Sprog Support

DanskEngelskSpanskFranskTyskItalienskPortugisiskOg flere

Styrker

  • Eksceptionel reasoning evne
  • Overlegen i matematisk problemløsning
  • State-of-the-art kodning performance
  • Fremragende til videnskabelige opgaver
  • Chain-of-thought reasoning
  • Kan løse meget komplekse problemer
  • PhD-niveau ekspertise i STEM

Begrænsninger

  • !Langsommere responstid (bruger tid på at tænke)
  • !Dyrere end standard GPT-4 modeller
  • !Ikke optimeret til simple opgaver
  • !Begrænset multimodal support
  • !Ingen function calling i preview version

Use Cases

Matematisk forskning og problemløsning
Kompleks kodegenerering
Videnskabelig analyse
Algoritmisk design
Competitive programming
PhD-niveau research assistance
Kompleks dataanalyse
Strategic planning

Benchmarks

90.8%
MMLU
92%
HumanEval
94.8%
GSM8K

Tekniske Detaljer

Release Dato
12.9.2024
Provider
OpenAI
Parametre
Ikke offentliggjort
Kontekstvindue
128,000 tokens
Træningsdata
Data frem til oktober 2023