Mixtral 8x7B
Mistral AIÆldre generationMixtral er en Sparse Mixture of Experts model, der kombinerer 8 ekspert-modeller til overlegen ydeevne. Konkurrerer med GPT-3.5 og Claude 2 mens den forbliver open-source.
Foto: Markus Winkler / Unsplash
Parametre
Kontekst
Input/1K
Output/1K
Hvad modellen var
Mixtral 8x7B blev udgivet af Mistral AI den 11. december 2023 og var en af de første åbne modeller, der brugte en sparse mixture of experts-arkitektur i praksis. Modellen har 46,7 milliarder parametre i alt, men aktiverer kun 12,9 milliarder pr. token. Det gav en beregningsprofil tættere på en mindre model, mens kvaliteten lå på niveau med væsentligt tungere tætte modeller.
Den betød noget, fordi den flyttede grænsen for hvad du kunne køre selv. Indtil da var stærk generel sprogforståelse, kodegenerering og flersproget arbejde noget du købte adgang til gennem et API. Mixtral gjorde det til noget du kunne hoste på egen hardware, med vægte du frit kunne hente.
Et context window på 32.768 tokens var også rummeligt efter datidens standard for åbne modeller. Kombinationen af åbne vægte, flersproget dækning på tværs af blandt andet engelsk, fransk, tysk, spansk og italiensk samt en effektiv arkitektur gjorde den til et almindeligt udgangspunkt for fine-tuning og forskning i det åbne økosystem.
Hvorfor den er blevet overhalet
Udviklingen siden slutningen af 2023 er gået hurtigt på flere fronter samtidigt. Nyere åbne modeller leverer bedre reasoning og kodegenerering ved samme eller mindre størrelse, fordi træningsdata og træningsopskrifter er blevet markant bedre. Det betyder at den effektivitetsfordel, MoE-arkitekturen gav Mixtral, ikke længere er et særkende.
Context windows er vokset kraftigt i hele feltet, og lange dokumenter håndteres i dag af modeller der både rummer mere og holder bedre sammenhæng over afstand. Samtidig er multimodalitet blevet almindelig, og Mixtral arbejder kun med tekst.
Instruction following, struktureret output og værktøjskald er også modnet betydeligt. Hvis du bygger noget der skal kalde funktioner eller returnere pålidelig JSON, mærker du forskellen tydeligt. Mistral AI har selv udgivet flere generationer siden, og Mixtral 8x7B er ikke længere udbyderens aktuelle valg.
Har den stadig en rolle
Ja, men en snæver en. Modellen er stadig relevant som studieobjekt, fordi den er en veldokumenteret og åbent tilgængelig implementering af sparse mixture of experts. Forskning i routing, ekspert-udnyttelse og kvantisering bruger den fortsat som referencepunkt.
Til ny produktion er svaret reelt nej. Deployment kræver betydelig hukommelse, fordi alle eksperter skal være tilgængelige selv om kun nogle af dem aktiveres pr. token. Den byrde giver bedre mening at bære for en nyere model.
Har du allerede en fine-tunet Mixtral i drift, der løser opgaven, er der ingen grund til hastværk. Starter du forfra, bør du kigge på en senere generation.
Capabilities
Opgaver
Sprog Support
Styrker
- ✓State-of-the-art open-source ydeevne
- ✓Stort kontekstvindue (32K)
- ✓Effektiv MoE arkitektur
- ✓Konkurrerer med GPT-3.5
- ✓Gratis og open-source
Begrænsninger
- !Kræver betydelig compute
- !Kompleks deployment
- !Ikke multimodal
Use Cases
Benchmarks
Tekniske Detaljer
- Release Dato
- 11.12.2023
- Provider
- Mistral AI
- Parametre
- 46.7B total (12.9B aktive)
- Kontekstvindue
- 32,768 tokens
- Træningsdata
- Ikke offentliggjort i detaljer