GPT-J-6B

GPT-J-6B

EleutherAIÆldre generation

GPT-J er EleutherAI's open-source alternativ til GPT-3, med 6 milliarder parametre. En af de første store open-source language models.

Foto: BoliviaInteligente / Unsplash

6B

Parametre

2K

Kontekst

$0

Input/1K

$0

Output/1K

Hvad modellen var

GPT-J-6B blev udgivet af EleutherAI den 4. juni 2021 som et åbent alternativ til de dengang lukkede sprogmodeller. Modellen har 6 milliarder parametre og er trænet på The Pile, et datasæt på 800 GB sammensat af tekst fra bøger, kode, videnskabelige artikler og web. Den er udgivet under Apache 2.0.

Betydningen lå i tilgængeligheden. Før GPT-J var store autoregressive sprogmodeller i praksis noget, du tilgik gennem et API hos en udbyder. Med GPT-J kunne du hente vægtene, inspicere dem og køre inference lokalt.

Rent teknisk håndterer modellen tekstgenerering, completion, opsummering og kodegenerering med et context window på 2.048 tokens. Træningsdataene er primært engelske, og modellen præsterer tilsvarende svagere på andre sprog. The Pile indeholder en betydelig mængde kildekode, hvilket gav modellen en vis kodeforståelse på et tidspunkt hvor det ikke var standard.

Hvorfor den er blevet overhalet

Udviklingen siden 2021 har flyttet sig på flere fronter samtidig. Nyere åbne modeller i samme størrelsesklasse er trænet på langt større og bedre kurateret datamængder, og de bruger arkitekturændringer som forbedret positionsindkodning, grouped-query attention og mere effektive aktiveringsfunktioner.

Instruction tuning er den anden store forskel. GPT-J er en ren base-model, der fortsætter tekst. Den følger ikke instruktioner, medmindre du strukturerer din prompt som few-shot eksempler. Moderne modeller er finjusteret til dialog og instruktionsfølgning fra start, hvilket ændrer hvordan du overhovedet arbejder med dem.

Context window er den tredje. 2.048 tokens rækker til korte opgaver, men udelukker de arbejdsformer der er blevet almindelige, som RAG med flere hentede dokumenter eller analyse af længere tekster. Endelig er flersproget dækning blevet standard i nyere åbne modeller, hvor GPT-J reelt er en engelsk model.

Har den stadig en rolle

Til produktionsbrug er svaret nej. Der findes åbne modeller i samme eller mindre størrelsesklasse med bedre kvalitet, længere context og reel instruktionsfølgning, og de kan køre på tilsvarende hardware. Vælger du GPT-J til et nyt projekt i dag, betaler du i kvalitet uden at få noget igen.

I forskning og undervisning er billedet et andet. Modellen er velbeskrevet, vægtene er frit tilgængelige under en permissiv licens, og træningsdatasættet er offentligt dokumenteret. Det gør den brugbar som studieobjekt, når du vil undersøge hvordan træningsdata slår igennem i en models output, eller når du har brug for en stabil baseline over tid.

Den sidste kategori er vedligeholdelse. Kører du et system bygget på GPT-J, fungerer det stadig, og licensen lægger ingen hindringer i vejen. Men behandl det som teknisk gæld frem for et fundament at bygge videre på.

Capabilities

Opgaver

TekstgenereringKodegenereringOpsummeringCompletion

Sprog Support

Primært engelsk

Styrker

  • Historisk vigtig open-source model
  • Apache 2.0 licens
  • Kan køres på consumer GPU
  • Aktiv community

Begrænsninger

  • !Ældre arkitektur
  • !Mindre end moderne modeller
  • !Primært engelsk
  • !Overtaget af nyere modeller

Use Cases

Læring og eksperimentering
Legacy projekter
Resource-constrained deployment
Baseline sammenligninger

Benchmarks

66.1%
HellaSwag
11.6%
HumanEval

Tekniske Detaljer

Release Dato
4.6.2021
Provider
EleutherAI
Parametre
6B
Kontekstvindue
2,048 tokens
Træningsdata
The Pile dataset (800GB)