GPT-4o
OpenAIÆldre generationGPT-4o (omni) er OpenAI's mest avancerede multimodale model, der kan forstå og generere tekst, billeder, audio og video. Modellen kombinerer hastighed med intelligens og tilbyder samme niveau af ekspertise som GPT-4 Turbo, men er hurtigere og mere omkostningseffektiv.
Foto: Markus Spiske / Unsplash
Parametre
Kontekst
Input/1K
Output/1K
Hvad modellen var
GPT-4o udkom 13. maj 2024 og var OpenAI's forsøg på at samle flere modaliteter i én model. Bogstavet o står for omni. Hvor tidligere opsætninger koblede separate komponenter sammen til tale og billedforståelse, håndterede GPT-4o tekst, billeder, lyd og video inden for samme model.
Det gav en mærkbart lavere latenstid i talebaserede samtaler, fordi færre led skulle passere data videre. Samtidig lå prisen på 0,005 USD per 1.000 input-tokens og 0,015 USD per 1.000 output-tokens, hvilket gjorde multimodal brug realistisk i produktion og ikke kun i demoer.
Modellen har et context window på 128.000 tokens og træningsdata frem til oktober 2023. Parameterantallet er ikke offentliggjort. I en periode var GPT-4o standardvalget hos OpenAI til stort set alt fra chatbots til kodegennemgang, og den satte forventningen om at en generel model også skal kunne se og høre.
Hvorfor den er blevet overhalet
Udviklingen efter GPT-4o gik i to retninger. Den ene er reasoning: modeller der bruger flere beregningsressourcer under inference til at arbejde sig gennem et problem, før de svarer. Det giver bedre resultater på matematik, kode og flertrinsopgaver, end en model der svarer i ét gennemløb.
Den anden retning er drift. Nyere generationer er blevet billigere per token, bedre til at kalde værktøjer pålideligt og mere stabile i lange agent-forløb. Kontekstvinduer er vokset hos flere udbydere.
Dertil kommer en simpel ting: træningsdata frem til oktober 2023 bliver mere mærkbart forældet for hver måned. Hvis du spørger til noget efter det tidspunkt, skal information leveres i prompten eller via RAG, ellers stiger risikoen for hallucination.
Har den stadig en rolle
For nye projekter er svaret reelt nej. GPT-4o er en lukket model bag API, så den kan hverken køres på egen hardware eller bruges til den slags forskning hvor du har brug for adgang til vægtene. De argumenter der holder liv i ældre open source-modeller, gælder ikke her.
Der er én undtagelse, og den er praktisk. Kører du allerede et system der er testet og tunet mod GPT-4o, har du en kendt baseline med forudsigelig adfærd. Det kan være rigtigt at blive stående indtil du har tid til at evaluere en nyere model ordentligt.
Behandl det som teknisk gæld med en tidsfrist. Legacy-modeller bliver før eller siden udfaset, og migreringen bliver nemmere hvis du planlægger den selv i stedet for at vente på en nedlukningsdato.
Capabilities
Opgaver
Sprog Support
Styrker
- ✓True multimodal - tekst, billede, audio, video
- ✓2x hurtigere end GPT-4 Turbo
- ✓50% billigere end GPT-4 Turbo
- ✓128K kontekstvindue
- ✓Overlegen multilingval performance
- ✓Realtids responsiveness
- ✓Stærk vision capabilities
- ✓Glimrende til kompleks reasoning
Begrænsninger
- !Stadig dyrere end mindre modeller
- !Nogle multimodale features er begrænset i API
- !Cutoff dato i oktober 2023
Use Cases
Benchmarks
Tekniske Detaljer
- Release Dato
- 13.5.2024
- Provider
- OpenAI
- Parametre
- Ikke offentliggjort
- Kontekstvindue
- 128,000 tokens
- Træningsdata
- Data frem til oktober 2023