DBRX
DatabricksDBRX er Databricks' open source Mixture-of-Experts (MoE) model der sætter ny standard for open LLMs. Med 132B total parametre men kun 36B aktive per inference, konkurrerer den med GPT-3.5 og Mixtral.
Parametre
Kontekst
Input/1K
Output/1K
Hvad modellen var
DBRX udkom 27. marts 2024 som Databricks' bud på en fuldt åben sprogmodel med vægte og kode frit tilgængelige. Den blev positioneret som den stærkeste åbne model på udgivelsestidspunktet og som et argument for, at virksomheder kunne køre kvalificerede modeller på egen infrastruktur.
Teknisk bygger modellen på en Mixture-of-Experts-arkitektur med 132 milliarder parametre i alt, hvoraf 36 milliarder er aktive ved hver inference. Det giver en beregningsprofil, der ligger under, hvad det samlede parameterantal ellers ville antyde. Kontekstvinduet er på 32.000 tokens, og træningen omfattede 12 billioner tokens.
Betydningen lå især i to ting. MoE blev demonstreret som en praktisk arkitektur uden for de lukkede laboratorier, og Databricks knyttede modellen tæt til sit eget dataøkosystem med vægt på SQL, dataanalyse og kodegenerering.
Hvorfor den er blevet overhalet
Udviklingen efter foråret 2024 gik hurtigt på flere fronter samtidig. Åbne modeller fra andre udbydere kom med bedre reasoning, mere pålidelig instruktionsfølgning og markant større kontekstvinduer, og flere af dem blev udgivet i varianter, der kunne køre på beskedent udstyr.
Samtidig blev MoE almindeligt. Det, der gjorde DBRX bemærkelsesværdig ved lanceringen, findes nu i mange nyere modeller, ofte kombineret med bedre træningsdata og efterbehandling. Understøttelse af værktøjskald, struktureret output og multimodalitet er også blevet standardforventninger, som modellen ikke er bygget til.
Dertil kommer økosystemet. Modelfamilier med stor udbredelse får hurtigere kvantiserede varianter, finetuning-opskrifter og fejlrettelser fra fællesskabet. DBRX fik aldrig samme volumen af eksterne bidrag, og det påvirker, hvor let modellen er at arbejde med i dag.
Har den stadig en rolle
For nye projekter er svaret reelt nej. Kravet til compute er højt i forhold til det, du får ud af modellen, og deployment af MoE-arkitekturen er mere besværlig end for tættere modeller i samme klasse. Nyere åbne alternativer løser de samme opgaver bedre og billigere.
Der er to undtagelser. Kører du allerede DBRX i produktion i et Databricks-miljø med finetunede varianter og validerede workflows, er der ingen akut grund til at rive det ned, før du har testet en afløser. Og som forskningsobjekt har modellen fortsat værdi, fordi både vægte og træningskode er offentlige, hvilket gør den brugbar til studier af MoE-adfærd.
Uden for de tilfælde bør du behandle DBRX som et historisk referencepunkt i udviklingen af åbne modeller, ikke som et aktivt valg.
Capabilities
Opgaver
Sprog Support
Styrker
- ✓Fully open source (weights og kode)
- ✓Mixture-of-Experts arkitektur
- ✓Effektiv inference (36B aktive)
- ✓Stærk kodning og SQL
- ✓Kommercielt anvendelig
- ✓32K kontekstvindue
- ✓Databricks ecosystem integration
- ✓Best open model ved release
Begrænsninger
- !Kræver betydelige compute ressourcer
- !MoE kompleksitet i deployment
- !Ikke lige så god som GPT-4
- !Mindre community support end Llama
Use Cases
Benchmarks
Tekniske Detaljer
- Release Dato
- 27.3.2024
- Provider
- Databricks
- Parametre
- 132B total, 36B aktive parametre
- Kontekstvindue
- 32,000 tokens
- Træningsdata
- 12T tokens af høj kvalitet data