Yi-34B

Yi-34B

01.AIÆldre generation

Yi-34B er 01.AI's (Kai-Fu Lee's firma) bilingual large language model optimeret til både engelsk og kinesisk. Modellen er open source og viser fremragende performance i både østlige og vestlige språk.

Foto: Wei Yu / Unsplash

34B parametre

Parametre

4K

Kontekst

$0

Input/1K

$0

Output/1K

Hvad modellen var

Yi-34B udkom 5. november 2023 fra det kinesiske selskab 01.AI, grundlagt af Kai-Fu Lee. Modellen var trænet på 3 billioner tokens engelsk og kinesisk og havde 34 milliarder parametre. Den blev udgivet med åbne vægte og en licens der tillod kommerciel brug.

Det interessante ved udgivelsen var balancen mellem de to sprog. De fleste åbne modeller på det tidspunkt var trænet med engelsk som primærsprog og behandlede kinesisk som et sekundært tilfælde. Yi-34B håndterede begge sprog som hovedsprog, både i tekstforståelse og i generering.

Størrelsen var også et argument. En model på 34B parametre kunne køre på hardware der lå under det, de største åbne modeller krævede, uden at give afkald på brugbar kvalitet i reasoning og kodegenerering. Det gjorde den til et realistisk valg for teams der selv ville hoste.

Context window var 4.096 tokens. Det var normalt for åbne modeller i efteråret 2023, men det satte en klar grænse for hvor lange dokumenter du kunne arbejde med i én prompt.

Hvorfor den er blevet overhalet

Kontekstvinduet er den mest håndgribelige forskel. Åbne modeller udgivet efter Yi-34B arbejder med længder der gør det praktisk at lægge hele dokumenter, kodebaser eller lange samtaler ind i én forespørgsel. Med 4.096 tokens skal du chunke og bruge RAG til opgaver som nyere modeller klarer direkte.

Træningsopskrifterne er også flyttet sig. Senere generationer bruger mere data, bedre datafiltrering og kraftigere efterfølgende instruktionstræning. Resultatet er at modeller med færre parametre i dag ofte følger instruktioner mere præcist end Yi-34B gør.

Dertil kommer økosystemet. Værktøjsbrug, funktionskald og struktureret output i JSON er blevet standardforventninger, og de er indbygget i nyere modeller fra bunden. Yi-34B er fra tiden før den slags var en fast del af træningen.

01.AI har selv udgivet nyere modeller efter Yi-34B, og virksomhedens aktuelle valg ligger ikke her.

Har den stadig en rolle

Til nye produktionssystemer er svaret reelt nej. Der findes åbne modeller med samme eller mindre hardwarebehov, længere context window og bedre instruktionsfølgning. Vælger du Yi-34B i dag, betaler du hostingomkostninger for en model der ikke leverer det bedste per GPU-time.

Der er dog to steder hvor den fortsat giver mening. Det ene er forskning i tosprogede modeller, hvor Yi-34B er et veldokumenteret referencepunkt for hvordan kinesisk og engelsk kan trænes sammen uden at det ene sprog dominerer. Det andet er eksisterende installationer, hvor modellen kører stabilt og en migrering ville koste mere end den giver.

For dansk er den ikke relevant. Sprogdækningen var koncentreret om kinesisk og engelsk, og dansk lå i den svage ende allerede ved udgivelsen.

Capabilities

Opgaver

TekstgenereringKodegenereringReasoningKinesisk-engelsk oversættelseMatematisk problemløsningBilingual opgaverAnalyseKreativ skrivning

Sprog Support

Kinesisk (Native)Engelsk (Native)SpanskFranskTyskJapanskKoreanskDansk (begrenset)+1 flere

Styrker

  • Best-in-class bilingual (kinesisk/engelsk)
  • Open source og kommerciel licens
  • Stærk reasoning
  • God kodning performance
  • Konkurrerer med Llama 2 70B
  • Kulturel forståelse af Kina
  • Community support i Asien

Begrænsninger

  • !Mindre kontekstvindue end moderne modeller
  • !Mindre kendt i Vesten
  • !34B størrelse kræver decent hardware
  • !Færre vestlige integrationer

Use Cases

Kinesisk-engelsk applikationer
Cross-cultural kommunikation
Asiatiske markeder
Bilingual customer support
Kinesisk kodegenerering
Cultural translation
Research i Asien

Benchmarks

76.3%
MMLU
83.8%
HellaSwag
46.2%
HumanEval
67.9%
GSM8K

Tekniske Detaljer

Release Dato
5.11.2023
Provider
01.AI
Parametre
34B parametre
Kontekstvindue
4,096 tokens
Træningsdata
3T tokens (engelsk og kinesisk)