DBRX

Databricks

DBRX er Databricks' open source Mixture-of-Experts (MoE) model der sætter ny standard for open LLMs. Med 132B total parametre men kun 36B aktive per inference, konkurrerer den med GPT-3.5 og Mixtral.

132B total, 36B aktive parametre

Parametre

32K

Kontekst

$0

Input/1K

$0

Output/1K

Hvad modellen var

DBRX udkom 27. marts 2024 som Databricks' bud på en fuldt åben sprogmodel med vægte og kode frit tilgængelige. Den blev positioneret som den stærkeste åbne model på udgivelsestidspunktet og som et argument for, at virksomheder kunne køre kvalificerede modeller på egen infrastruktur.

Teknisk bygger modellen på en Mixture-of-Experts-arkitektur med 132 milliarder parametre i alt, hvoraf 36 milliarder er aktive ved hver inference. Det giver en beregningsprofil, der ligger under, hvad det samlede parameterantal ellers ville antyde. Kontekstvinduet er på 32.000 tokens, og træningen omfattede 12 billioner tokens.

Betydningen lå især i to ting. MoE blev demonstreret som en praktisk arkitektur uden for de lukkede laboratorier, og Databricks knyttede modellen tæt til sit eget dataøkosystem med vægt på SQL, dataanalyse og kodegenerering.

Hvorfor den er blevet overhalet

Udviklingen efter foråret 2024 gik hurtigt på flere fronter samtidig. Åbne modeller fra andre udbydere kom med bedre reasoning, mere pålidelig instruktionsfølgning og markant større kontekstvinduer, og flere af dem blev udgivet i varianter, der kunne køre på beskedent udstyr.

Samtidig blev MoE almindeligt. Det, der gjorde DBRX bemærkelsesværdig ved lanceringen, findes nu i mange nyere modeller, ofte kombineret med bedre træningsdata og efterbehandling. Understøttelse af værktøjskald, struktureret output og multimodalitet er også blevet standardforventninger, som modellen ikke er bygget til.

Dertil kommer økosystemet. Modelfamilier med stor udbredelse får hurtigere kvantiserede varianter, finetuning-opskrifter og fejlrettelser fra fællesskabet. DBRX fik aldrig samme volumen af eksterne bidrag, og det påvirker, hvor let modellen er at arbejde med i dag.

Har den stadig en rolle

For nye projekter er svaret reelt nej. Kravet til compute er højt i forhold til det, du får ud af modellen, og deployment af MoE-arkitekturen er mere besværlig end for tættere modeller i samme klasse. Nyere åbne alternativer løser de samme opgaver bedre og billigere.

Der er to undtagelser. Kører du allerede DBRX i produktion i et Databricks-miljø med finetunede varianter og validerede workflows, er der ingen akut grund til at rive det ned, før du har testet en afløser. Og som forskningsobjekt har modellen fortsat værdi, fordi både vægte og træningskode er offentlige, hvilket gør den brugbar til studier af MoE-adfærd.

Uden for de tilfælde bør du behandle DBRX som et historisk referencepunkt i udviklingen af åbne modeller, ikke som et aktivt valg.

Capabilities

Opgaver

TekstgenereringKodegenereringReasoningMatematisk problemløsningDataanalyseSQL genereringTeknisk skrivningLange dokumenter

Sprog Support

EngelskSpanskFranskTyskItalienskPortugisiskDansk (begrenset)Og flere

Styrker

  • Fully open source (weights og kode)
  • Mixture-of-Experts arkitektur
  • Effektiv inference (36B aktive)
  • Stærk kodning og SQL
  • Kommercielt anvendelig
  • 32K kontekstvindue
  • Databricks ecosystem integration
  • Best open model ved release

Begrænsninger

  • !Kræver betydelige compute ressourcer
  • !MoE kompleksitet i deployment
  • !Ikke lige så god som GPT-4
  • !Mindre community support end Llama

Use Cases

Enterprise data applikationer
SQL og dataanalyse
Kodegenerering
On-premise deployment
Custom finetuning
Databricks workflows
Privacy-sensitive applikationer
Research

Benchmarks

73.7%
MMLU
89%
HellaSwag
70.8%
HumanEval
72.8%
GSM8K

Tekniske Detaljer

Release Dato
27.3.2024
Provider
Databricks
Parametre
132B total, 36B aktive parametre
Kontekstvindue
32,000 tokens
Træningsdata
12T tokens af høj kvalitet data