GPT-Neo

EleutherAI

GPT-Neo er EleutherAI's familie af open-source transformer models, designet som reproducerbare GPT-3 alternativer. Tilgængelig i flere størrelser.

125M, 1.3B, 2.7B

Parametre

2K

Kontekst

$0

Input/1K

$0

Output/1K

Hvad modellen var

GPT-Neo udkom 21. marts 2021 og var EleutherAI's forsøg på at lave en åben pendant til de lukkede GPT-3-modeller. Projektet var lige så meget et bevis på, at et frivilligt forskningsmiljø kunne træne store sprogmodeller, som det var et færdigt produkt. Vægtene blev lagt frit ud under MIT-licens, og det var på det tidspunkt usædvanligt for modeller i den størrelsesorden.

Teknisk er GPT-Neo en decoder-only transformer trænet på The Pile, EleutherAI's eget tekstkorpus. Modellen findes i tre størrelser og har et context window på 2.048 tokens. Den er trænet på engelsk tekst og fungerer bedst på engelsk.

Brugsmønsteret var klassisk completion. Du gav modellen en tekststump, og den fortsatte den. Instruction tuning og chatformater var endnu ikke standard, så prompts blev typisk skrevet som few-shot eksempler i stedet for som instruktioner.

Hvorfor den er blevet overhalet

GPT-Neo blev hurtigt afløst inden for EleutherAI's eget økosystem, først af GPT-J og siden af GPT-NeoX. Begge var større og bedre trænet, og de overtog rollen som referencepunkt for åbne modeller.

Siden da har hele feltet flyttet sig. Nyere åbne modeller trænes på markant mere data i forhold til deres størrelse, hvilket giver bedre resultater ved samme parameterantal. De leveres desuden ofte i instruction-tunede varianter, så de kan følge instruktioner direkte uden few-shot eksempler.

Context window er en anden væsentlig forskel. Moderne modeller håndterer langt længere input, hvilket er en forudsætning for RAG, dokumentanalyse og længere samtaler. Flersprogethed er også blevet normen, hvor GPT-Neo reelt er en engelsk model.

Endelig er kvalitetsforskellen mærkbar i praksis. GPT-Neo hallucinerer ofte, taber tråden i længere tekster og har svært ved opgaver, der kræver flertrinsræsonnement.

Har den stadig en rolle

Til produktion er svaret nej. Der findes nyere åbne modeller i samme eller mindre størrelsesklasse, som er bedre på stort set alle parametre, og som også kan køre på beskeden hardware. Vælger du GPT-Neo til en ny opgave i dag, vælger du et dårligere udgangspunkt uden nogen modydelse.

Til undervisning og forskning er billedet et andet. De mindste varianter er små nok til at køre og inspicere på en almindelig CPU, og det gør dem brugbare, hvis du vil forstå, hvordan en transformer opfører sig indefra. MIT-licensen fjerner samtidig juridiske forbehold ved at pille modellen fra hinanden.

Dertil kommer forskningshistorik. GPT-Neo indgår i en del ældre artikler og benchmarks, og reproducerbarhed kræver, at modellen stadig er tilgængelig. Det er den primære grund til, at den bliver vedligeholdt som legacy frem for at forsvinde.

Capabilities

Opgaver

TekstgenereringCompletionSimple prompts

Sprog Support

Engelsk

Styrker

  • Flere størrelser tilgængelige
  • MIT licens
  • Kan køres på CPU
  • God til læring

Begrænsninger

  • !Ældre teknologi
  • !Mindre capabilities
  • !Primært engelsk
  • !Overtaget af GPT-J og NeoX

Use Cases

Uddannelsesformål
Lightweight deployment
Eksperimentering
Legacy support

Tekniske Detaljer

Release Dato
21.3.2021
Provider
EleutherAI
Parametre
125M, 1.3B, 2.7B
Kontekstvindue
2,048 tokens
Træningsdata
The Pile dataset