DeepSeek Coder
DeepSeekÆldre generationDeepSeek Coder er en specialiseret open source kodningsmodel fra det kinesiske firma DeepSeek. Modellen er trænet på 2T tokens af kode og exceller i code completion, generation og debugging.
Foto: Daniil Komov / Unsplash
Parametre
Kontekst
Input/1K
Output/1K
Hvad modellen var
DeepSeek Coder udkom 2. november 2023 som en familie af åbne kodningsmodeller fra det kinesiske firma DeepSeek. Den var trænet fra bunden på 2 billioner tokens kode fordelt på 87 programmeringssprog, og den var ikke en generel sprogmodel med kode som sidegevinst. Det var en dedikeret kodemodel.
Den betød noget, fordi den kom i tre størrelser og under MIT-licens. Du kunne hente vægtene, køre dem lokalt og bruge dem kommercielt uden forhandling med en udbyder. Den mindste variant kunne køre på beskeden hardware, mens den største var beregnet til rigtige GPU'er.
Teknisk understøtter modellen fill-in-the-middle, altså udfyldning af kode mellem en kendt start og en kendt slutning. Det er præcis det mønster en IDE bruger til autocomplete, og det gjorde modellen brugbar som lokal backend for kodeforslag. Kontekstvinduet på 16.000 tokens rakte til en fil eller nogle få filer ad gangen.
Hvorfor den er blevet overhalet
Udviklingen i kodemodeller er gået i to retninger siden slutningen af 2023. Kontekstvinduerne er vokset betydeligt, så nyere modeller kan holde større dele af et repository i hovedet på én gang. Det ændrer, hvilke opgaver der overhovedet er realistiske: refaktorering på tværs af mange filer var ikke en naturlig opgave for en 16K-model.
Samtidig er skellet mellem kodemodeller og generelle modeller blevet mindre skarpt. Store generelle modeller er blevet stærke til kode, og de kan samtidig ræsonnere om krav, arkitektur og fejlbeskrivelser i naturligt sprog. DeepSeek Coder er specialiseret til kode alene, og den svaghed vejer tungere nu.
DeepSeek har selv udgivet nyere generationer, herunder senere Coder-versioner og de generelle modeller, som firmaet i dag markedsfører. Den oprindelige model er dermed ikke længere udbyderens aktuelle valg. Hertil kommer, at værktøjskæden omkring agentisk kodning, værktøjskald og struktureret output er blevet standard i nyere modeller og ikke var en del af designet her.
Har den stadig en rolle
Ja, men en snæver en. Den mindste variant på 1,3B parametre er stadig relevant, hvis du har meget begrænset hardware og kun skal bruge lokal code completion uden netværksadgang. Den slags opgave stiller lave krav, og en lille model svarer hurtigt.
I forskning har modellen også fortsat værdi. Vægtene er frit tilgængelige, træningsopsætningen er dokumenteret, og modellen bruges som baseline i sammenligninger af kodemodeller. MIT-licensen gør den nem at bygge videre på.
Til produktivt udviklingsarbejde er svaret nærmere nej. Skal du bruge en model til at læse større kodebaser, arbejde i en agent-loop eller kombinere kode med almindelig tekstforståelse, findes der nyere valg fra DeepSeek selv og fra andre. Vælg den oprindelige DeepSeek Coder, hvis begrænsningen er hardware eller licens, ikke hvis begrænsningen er budget alene.
Capabilities
Opgaver
Sprog Support
Styrker
- ✓Specialiseret til kodning
- ✓87 programmeringssprog
- ✓Multiple størrelser (1.3B-33B)
- ✓Open source med MIT licens
- ✓16K kontekstvindue
- ✓Fill-in-the-middle support
- ✓Stærk i HumanEval
- ✓Kan køre lokalt
Begrænsninger
- !Kun fokuseret på kode
- !Mindre kendt end GitHub Copilot
- !Primært kinesisk dokumentation
- !Begrænset community support i Vesten
Use Cases
Benchmarks
Tekniske Detaljer
- Release Dato
- 2.11.2023
- Provider
- DeepSeek
- Parametre
- 1.3B, 6.7B, 33B parametre
- Kontekstvindue
- 16,000 tokens
- Træningsdata
- 2T tokens af kode (87 sprog)