BLOOM

BLOOM

BigScienceÆldre generation

BLOOM er en massiv multilingual open-source model udviklet af hundredvis af forskere. Støtter 46 sprog og 13 programmeringssprog.

Foto: Ling App / Unsplash

176B

Parametre

2K

Kontekst

$0

Input/1K

$0

Output/1K

Hvad modellen var

BLOOM udkom 6. juli 2022 som resultat af BigScience-samarbejdet, hvor hundredvis af forskere arbejdede sammen om at bygge en stor sprogmodel i åbenhed. Modellen har 176 milliarder parametre og blev trænet på 366 milliarder tokens fordelt på 46 sprog og 13 programmeringssprog. Vægtene blev udgivet under en RAIL-licens, så du kunne hente dem og køre dem selv.

Det var udgivelsesformen mere end selve ydeevnen der gjorde BLOOM vigtig. På det tidspunkt var de største modeller lukkede, og adgang gik gennem API'er hos enkelte udbydere. BLOOM viste at et offentligt finansieret konsortium kunne træne en model i den størrelsesorden og dokumentere både træningsdata, metode og beslutningsprocesser undervejs.

Sprogdækningen var det andet særkende. De fleste store modeller fra samme periode var trænet overvejende på engelsk, mens BLOOM bevidst prioriterede sprog med færre ressourcer, herunder flere afrikanske og sydasiatiske sprog. Det gjorde modellen til et udgangspunkt for forskere der arbejdede uden for engelsk.

Hvorfor den er blevet overhalet

Arkitekturen og træningsopskriften er fra 2022. Senere modeller er trænet på markant større datamængder i forhold til deres størrelse, og erfaringen fra de mellemliggende år er at datamængde og datakvalitet vejer tungere end ren parametertælling. Nyere åbne modeller med langt færre parametre leverer derfor typisk bedre svar end BLOOM.

Kontekstvinduet på 2.048 tokens er den mest håndfaste begrænsning. Det rækker ikke til lange dokumenter, længere samtaler eller RAG-opsætninger hvor du sender flere hentede tekststykker med i din prompt. Nyere modeller har kontekstvinduer der er størrelsesordener større.

BLOOM blev desuden udgivet som en ren basismodel, uden den instruction tuning og præferenceoptimering der siden er blevet standard. Den varianten BLOOMZ, der blev finetunet på instruktioner, afhjalp noget af det, men niveauet ligger under nyere åbne modeller. Endelig kræver 176 milliarder parametre en serverpark, hvilket gør drift dyr i forhold til udbyttet.

Har den stadig en rolle

Til produktion er svaret reelt nej. Der findes åbne modeller med bedre sprogforståelse, længere kontekstvindue og langt lavere hardwarekrav, og for dansk gælder det også. Vælger du BLOOM til en ny applikation, betaler du mest i compute for mindst i kvalitet.

I forskning har modellen fortsat værdi. Træningsdata, dokumentation og de mange rapporter fra BigScience-processen er offentlige, hvilket er sjældent for modeller i den størrelse. Det gør BLOOM brugbar til studier af multilingual repræsentation, bias og forholdet mellem træningsdata og adfærd.

Dertil kommer den historiske betydning. BLOOM er et referencepunkt for hvordan åben udvikling af store modeller kan organiseres, og RAIL-licensen har påvirket senere diskussioner om ansvarlig udgivelse af vægte.

Capabilities

Opgaver

Multilingual tekstgenereringOversættelseKodegenereringOpsummering

Sprog Support

46 sprog inkl. Dansk, Arabisk, Kinesisk, Fransk, Engelsk

Styrker

  • Fremragende multilingual støtte
  • Massiv størrelse (176B)
  • Open science projekt
  • Bredt sprog coverage

Begrænsninger

  • !Kræver massiv compute
  • !Ældre arkitektur
  • !Lille kontekstvindue
  • !Svær at deploye

Use Cases

Multilingual applikationer
Oversættelse
Forskning i mange sprog
Low-resource sprog

Tekniske Detaljer

Release Dato
6.7.2022
Provider
BigScience
Parametre
176B
Kontekstvindue
2,048 tokens
Træningsdata
366B tokens på 46 sprog