BLOOM
BigScienceÆldre generationBLOOM er en massiv multilingual open-source model udviklet af hundredvis af forskere. Støtter 46 sprog og 13 programmeringssprog.
Foto: Ling App / Unsplash
Parametre
Kontekst
Input/1K
Output/1K
Hvad modellen var
BLOOM udkom 6. juli 2022 som resultat af BigScience-samarbejdet, hvor hundredvis af forskere arbejdede sammen om at bygge en stor sprogmodel i åbenhed. Modellen har 176 milliarder parametre og blev trænet på 366 milliarder tokens fordelt på 46 sprog og 13 programmeringssprog. Vægtene blev udgivet under en RAIL-licens, så du kunne hente dem og køre dem selv.
Det var udgivelsesformen mere end selve ydeevnen der gjorde BLOOM vigtig. På det tidspunkt var de største modeller lukkede, og adgang gik gennem API'er hos enkelte udbydere. BLOOM viste at et offentligt finansieret konsortium kunne træne en model i den størrelsesorden og dokumentere både træningsdata, metode og beslutningsprocesser undervejs.
Sprogdækningen var det andet særkende. De fleste store modeller fra samme periode var trænet overvejende på engelsk, mens BLOOM bevidst prioriterede sprog med færre ressourcer, herunder flere afrikanske og sydasiatiske sprog. Det gjorde modellen til et udgangspunkt for forskere der arbejdede uden for engelsk.
Hvorfor den er blevet overhalet
Arkitekturen og træningsopskriften er fra 2022. Senere modeller er trænet på markant større datamængder i forhold til deres størrelse, og erfaringen fra de mellemliggende år er at datamængde og datakvalitet vejer tungere end ren parametertælling. Nyere åbne modeller med langt færre parametre leverer derfor typisk bedre svar end BLOOM.
Kontekstvinduet på 2.048 tokens er den mest håndfaste begrænsning. Det rækker ikke til lange dokumenter, længere samtaler eller RAG-opsætninger hvor du sender flere hentede tekststykker med i din prompt. Nyere modeller har kontekstvinduer der er størrelsesordener større.
BLOOM blev desuden udgivet som en ren basismodel, uden den instruction tuning og præferenceoptimering der siden er blevet standard. Den varianten BLOOMZ, der blev finetunet på instruktioner, afhjalp noget af det, men niveauet ligger under nyere åbne modeller. Endelig kræver 176 milliarder parametre en serverpark, hvilket gør drift dyr i forhold til udbyttet.
Har den stadig en rolle
Til produktion er svaret reelt nej. Der findes åbne modeller med bedre sprogforståelse, længere kontekstvindue og langt lavere hardwarekrav, og for dansk gælder det også. Vælger du BLOOM til en ny applikation, betaler du mest i compute for mindst i kvalitet.
I forskning har modellen fortsat værdi. Træningsdata, dokumentation og de mange rapporter fra BigScience-processen er offentlige, hvilket er sjældent for modeller i den størrelse. Det gør BLOOM brugbar til studier af multilingual repræsentation, bias og forholdet mellem træningsdata og adfærd.
Dertil kommer den historiske betydning. BLOOM er et referencepunkt for hvordan åben udvikling af store modeller kan organiseres, og RAIL-licensen har påvirket senere diskussioner om ansvarlig udgivelse af vægte.
Capabilities
Opgaver
Sprog Support
Styrker
- ✓Fremragende multilingual støtte
- ✓Massiv størrelse (176B)
- ✓Open science projekt
- ✓Bredt sprog coverage
Begrænsninger
- !Kræver massiv compute
- !Ældre arkitektur
- !Lille kontekstvindue
- !Svær at deploye
Use Cases
Tekniske Detaljer
- Release Dato
- 6.7.2022
- Provider
- BigScience
- Parametre
- 176B
- Kontekstvindue
- 2,048 tokens
- Træningsdata
- 366B tokens på 46 sprog