Databricks

Databricks

Grundlagt 2013San Francisco, USA

Databricks er en unified analytics platform der tilbyder DBRX, deres egen open source foundation model. De fokuserer på at integrere AI med data lakehouse arkitektur.

Foto: Leif Christoph Gottwald / Unsplash

Hvad udbyderen tilbyder

Databricks henvender sig til organisationer, der allerede har deres data samlet et sted, og som vil køre sprogmodeller tæt på de data. Platformen er bygget op om lakehouse-arkitekturen, hvor datalagring, transformation, ML-træning og model serving hører til samme miljø. Sprogmodellerne er et lag oven på det, ikke et selvstændigt produkt.

Det adskiller sig fra udbydere, der leverer en model bag et API og ikke andet. Hos Databricks køber du en dataplatform, og adgangen til modeller følger med. Virksomheden blev grundlagt i 2013 med hovedkvarter i San Francisco, og AI-delen er kommet til oven på et fundament af Spark og datateknik.

DBRX er Databricks' egen foundation model, udgivet som open source. Den kan bruges på platformen, men vægten kan også hentes og køres andetsteds. Ud over DBRX kan du serve og finjustere andre åbne modeller, herunder Dolly og MPT-familien, samt egne modeller.

Sådan er det at bygge på den

Du kommer i gang gennem et workspace, ikke gennem en API-nøgle. Det betyder opsætning af compute, adgangsstyring og forbindelse til datakilder, før du kan kalde den første model. Er infrastrukturen allerede på plads i din organisation, er trinnet kort. Er den ikke, er det et projekt i sig selv.

Selve arbejdsgangen læner sig op ad MLflow. Du logger eksperimenter, registrerer modelversioner og udstiller dem som endpoints fra samme sted. Det giver sporbarhed fra rådata til det svar en model returnerer, hvilket er svært at etablere, hvis dele af kæden ligger hos en ekstern leverandør.

Friktionen ligger typisk to steder. Det ene er læringskurven, fordi du skal forstå både platformens datamodel og dens ML-værktøjer for at få noget produktionsklart. Det andet er compute, som du styrer og betaler for direkte, i modsætning til en ren API-tjeneste hvor du betaler per token og ikke tænker over maskinerne.

Hvad du skal være opmærksom på

Bindingen er reel. Model serving, feature store og governance-lag fungerer, fordi de er en del af platformen, og en migrering væk indebærer, at du skal genopbygge dele af opsætningen andetsteds. DBRX kan følge med ud, da modellen er open source, men det gælder ikke arbejdsgangen omkring den.

Til gengæld er datahåndteringen forudsigelig. Data bliver i dit eget miljø, og du bestemmer region og adgangspolitik. Det er relevant for finans, sundhed og offentlig sektor, hvor krav til dokumentation og revision vejer tungere end hurtig prototyping.

Skal du bare have tekstgenerering ind i et produkt, er en almindelig model-API hurtigere og enklere at komme videre med. Databricks giver mening, når modellen skal arbejde på virksomhedens egne data, når finjustering på interne datasæt er en del af planen, eller når governance-kravene gør en løsrevet API-integration besværlig at forsvare.

Modeller

DBRXDBRX InstructDolly 2.0MPT-7BMPT-30B

Key Features

  • Data lakehouse integration
  • DBRX open source model
  • Fine-tuning på egne data
  • Enterprise data governance
  • Spark integration
  • MLflow integration

API Features

Model serving endpoints
MLflow API
Feature store
Batch og real-time inference
Custom model deployment
Delta Lake integration

Pricing Model

Platform-baseret med compute pricing

Styrker

  • Tæt integration med data platform
  • Stærk i enterprise data scenarios
  • God governance og compliance
  • Open source DBRX model
  • Skalerbar infrastructure

Begrænsninger

  • !Kræver Databricks platform
  • !Kompleks setup
  • !Dyrere end pure API services
  • !Steeper learning curve

Populære Use Cases

Enterprise data analytics
Custom model fine-tuning
Data lakehouse AI integration
Regulated industries
Large-scale ML operations