Databricks
Grundlagt 2013 • San Francisco, USA
Databricks er en unified analytics platform der tilbyder DBRX, deres egen open source foundation model. De fokuserer på at integrere AI med data lakehouse arkitektur.
Foto: Leif Christoph Gottwald / Unsplash
Hvad udbyderen tilbyder
Databricks henvender sig til organisationer, der allerede har deres data samlet et sted, og som vil køre sprogmodeller tæt på de data. Platformen er bygget op om lakehouse-arkitekturen, hvor datalagring, transformation, ML-træning og model serving hører til samme miljø. Sprogmodellerne er et lag oven på det, ikke et selvstændigt produkt.
Det adskiller sig fra udbydere, der leverer en model bag et API og ikke andet. Hos Databricks køber du en dataplatform, og adgangen til modeller følger med. Virksomheden blev grundlagt i 2013 med hovedkvarter i San Francisco, og AI-delen er kommet til oven på et fundament af Spark og datateknik.
DBRX er Databricks' egen foundation model, udgivet som open source. Den kan bruges på platformen, men vægten kan også hentes og køres andetsteds. Ud over DBRX kan du serve og finjustere andre åbne modeller, herunder Dolly og MPT-familien, samt egne modeller.
Sådan er det at bygge på den
Du kommer i gang gennem et workspace, ikke gennem en API-nøgle. Det betyder opsætning af compute, adgangsstyring og forbindelse til datakilder, før du kan kalde den første model. Er infrastrukturen allerede på plads i din organisation, er trinnet kort. Er den ikke, er det et projekt i sig selv.
Selve arbejdsgangen læner sig op ad MLflow. Du logger eksperimenter, registrerer modelversioner og udstiller dem som endpoints fra samme sted. Det giver sporbarhed fra rådata til det svar en model returnerer, hvilket er svært at etablere, hvis dele af kæden ligger hos en ekstern leverandør.
Friktionen ligger typisk to steder. Det ene er læringskurven, fordi du skal forstå både platformens datamodel og dens ML-værktøjer for at få noget produktionsklart. Det andet er compute, som du styrer og betaler for direkte, i modsætning til en ren API-tjeneste hvor du betaler per token og ikke tænker over maskinerne.
Hvad du skal være opmærksom på
Bindingen er reel. Model serving, feature store og governance-lag fungerer, fordi de er en del af platformen, og en migrering væk indebærer, at du skal genopbygge dele af opsætningen andetsteds. DBRX kan følge med ud, da modellen er open source, men det gælder ikke arbejdsgangen omkring den.
Til gengæld er datahåndteringen forudsigelig. Data bliver i dit eget miljø, og du bestemmer region og adgangspolitik. Det er relevant for finans, sundhed og offentlig sektor, hvor krav til dokumentation og revision vejer tungere end hurtig prototyping.
Skal du bare have tekstgenerering ind i et produkt, er en almindelig model-API hurtigere og enklere at komme videre med. Databricks giver mening, når modellen skal arbejde på virksomhedens egne data, når finjustering på interne datasæt er en del af planen, eller når governance-kravene gør en løsrevet API-integration besværlig at forsvare.
Modeller
Key Features
- ✦Data lakehouse integration
- ✦DBRX open source model
- ✦Fine-tuning på egne data
- ✦Enterprise data governance
- ✦Spark integration
- ✦MLflow integration
API Features
Pricing Model
Platform-baseret med compute pricing
Styrker
- ✓Tæt integration med data platform
- ✓Stærk i enterprise data scenarios
- ✓God governance og compliance
- ✓Open source DBRX model
- ✓Skalerbar infrastructure
Begrænsninger
- !Kræver Databricks platform
- !Kompleks setup
- !Dyrere end pure API services
- !Steeper learning curve