GPT-Neo
EleutherAIGPT-Neo er EleutherAI's familie af open-source transformer models, designet som reproducerbare GPT-3 alternativer. Tilgængelig i flere størrelser.
Parametre
Kontekst
Input/1K
Output/1K
Hvad modellen var
GPT-Neo udkom 21. marts 2021 og var EleutherAI's forsøg på at lave en åben pendant til de lukkede GPT-3-modeller. Projektet var lige så meget et bevis på, at et frivilligt forskningsmiljø kunne træne store sprogmodeller, som det var et færdigt produkt. Vægtene blev lagt frit ud under MIT-licens, og det var på det tidspunkt usædvanligt for modeller i den størrelsesorden.
Teknisk er GPT-Neo en decoder-only transformer trænet på The Pile, EleutherAI's eget tekstkorpus. Modellen findes i tre størrelser og har et context window på 2.048 tokens. Den er trænet på engelsk tekst og fungerer bedst på engelsk.
Brugsmønsteret var klassisk completion. Du gav modellen en tekststump, og den fortsatte den. Instruction tuning og chatformater var endnu ikke standard, så prompts blev typisk skrevet som few-shot eksempler i stedet for som instruktioner.
Hvorfor den er blevet overhalet
GPT-Neo blev hurtigt afløst inden for EleutherAI's eget økosystem, først af GPT-J og siden af GPT-NeoX. Begge var større og bedre trænet, og de overtog rollen som referencepunkt for åbne modeller.
Siden da har hele feltet flyttet sig. Nyere åbne modeller trænes på markant mere data i forhold til deres størrelse, hvilket giver bedre resultater ved samme parameterantal. De leveres desuden ofte i instruction-tunede varianter, så de kan følge instruktioner direkte uden few-shot eksempler.
Context window er en anden væsentlig forskel. Moderne modeller håndterer langt længere input, hvilket er en forudsætning for RAG, dokumentanalyse og længere samtaler. Flersprogethed er også blevet normen, hvor GPT-Neo reelt er en engelsk model.
Endelig er kvalitetsforskellen mærkbar i praksis. GPT-Neo hallucinerer ofte, taber tråden i længere tekster og har svært ved opgaver, der kræver flertrinsræsonnement.
Har den stadig en rolle
Til produktion er svaret nej. Der findes nyere åbne modeller i samme eller mindre størrelsesklasse, som er bedre på stort set alle parametre, og som også kan køre på beskeden hardware. Vælger du GPT-Neo til en ny opgave i dag, vælger du et dårligere udgangspunkt uden nogen modydelse.
Til undervisning og forskning er billedet et andet. De mindste varianter er små nok til at køre og inspicere på en almindelig CPU, og det gør dem brugbare, hvis du vil forstå, hvordan en transformer opfører sig indefra. MIT-licensen fjerner samtidig juridiske forbehold ved at pille modellen fra hinanden.
Dertil kommer forskningshistorik. GPT-Neo indgår i en del ældre artikler og benchmarks, og reproducerbarhed kræver, at modellen stadig er tilgængelig. Det er den primære grund til, at den bliver vedligeholdt som legacy frem for at forsvinde.
Capabilities
Opgaver
Sprog Support
Styrker
- ✓Flere størrelser tilgængelige
- ✓MIT licens
- ✓Kan køres på CPU
- ✓God til læring
Begrænsninger
- !Ældre teknologi
- !Mindre capabilities
- !Primært engelsk
- !Overtaget af GPT-J og NeoX
Use Cases
Tekniske Detaljer
- Release Dato
- 21.3.2021
- Provider
- EleutherAI
- Parametre
- 125M, 1.3B, 2.7B
- Kontekstvindue
- 2,048 tokens
- Træningsdata
- The Pile dataset