GPT-J-6B
EleutherAIÆldre generationGPT-J er EleutherAI's open-source alternativ til GPT-3, med 6 milliarder parametre. En af de første store open-source language models.
Foto: BoliviaInteligente / Unsplash
Parametre
Kontekst
Input/1K
Output/1K
Hvad modellen var
GPT-J-6B blev udgivet af EleutherAI den 4. juni 2021 som et åbent alternativ til de dengang lukkede sprogmodeller. Modellen har 6 milliarder parametre og er trænet på The Pile, et datasæt på 800 GB sammensat af tekst fra bøger, kode, videnskabelige artikler og web. Den er udgivet under Apache 2.0.
Betydningen lå i tilgængeligheden. Før GPT-J var store autoregressive sprogmodeller i praksis noget, du tilgik gennem et API hos en udbyder. Med GPT-J kunne du hente vægtene, inspicere dem og køre inference lokalt.
Rent teknisk håndterer modellen tekstgenerering, completion, opsummering og kodegenerering med et context window på 2.048 tokens. Træningsdataene er primært engelske, og modellen præsterer tilsvarende svagere på andre sprog. The Pile indeholder en betydelig mængde kildekode, hvilket gav modellen en vis kodeforståelse på et tidspunkt hvor det ikke var standard.
Hvorfor den er blevet overhalet
Udviklingen siden 2021 har flyttet sig på flere fronter samtidig. Nyere åbne modeller i samme størrelsesklasse er trænet på langt større og bedre kurateret datamængder, og de bruger arkitekturændringer som forbedret positionsindkodning, grouped-query attention og mere effektive aktiveringsfunktioner.
Instruction tuning er den anden store forskel. GPT-J er en ren base-model, der fortsætter tekst. Den følger ikke instruktioner, medmindre du strukturerer din prompt som few-shot eksempler. Moderne modeller er finjusteret til dialog og instruktionsfølgning fra start, hvilket ændrer hvordan du overhovedet arbejder med dem.
Context window er den tredje. 2.048 tokens rækker til korte opgaver, men udelukker de arbejdsformer der er blevet almindelige, som RAG med flere hentede dokumenter eller analyse af længere tekster. Endelig er flersproget dækning blevet standard i nyere åbne modeller, hvor GPT-J reelt er en engelsk model.
Har den stadig en rolle
Til produktionsbrug er svaret nej. Der findes åbne modeller i samme eller mindre størrelsesklasse med bedre kvalitet, længere context og reel instruktionsfølgning, og de kan køre på tilsvarende hardware. Vælger du GPT-J til et nyt projekt i dag, betaler du i kvalitet uden at få noget igen.
I forskning og undervisning er billedet et andet. Modellen er velbeskrevet, vægtene er frit tilgængelige under en permissiv licens, og træningsdatasættet er offentligt dokumenteret. Det gør den brugbar som studieobjekt, når du vil undersøge hvordan træningsdata slår igennem i en models output, eller når du har brug for en stabil baseline over tid.
Den sidste kategori er vedligeholdelse. Kører du et system bygget på GPT-J, fungerer det stadig, og licensen lægger ingen hindringer i vejen. Men behandl det som teknisk gæld frem for et fundament at bygge videre på.
Capabilities
Opgaver
Sprog Support
Styrker
- ✓Historisk vigtig open-source model
- ✓Apache 2.0 licens
- ✓Kan køres på consumer GPU
- ✓Aktiv community
Begrænsninger
- !Ældre arkitektur
- !Mindre end moderne modeller
- !Primært engelsk
- !Overtaget af nyere modeller
Use Cases
Benchmarks
Tekniske Detaljer
- Release Dato
- 4.6.2021
- Provider
- EleutherAI
- Parametre
- 6B
- Kontekstvindue
- 2,048 tokens
- Træningsdata
- The Pile dataset (800GB)