Replicate
Grundlagt 2019 • San Francisco, USA
Replicate gør det nemt at køre og deploye machine learning models i cloud. De tilbyder API-adgang til open source models uden at skulle håndtere infrastruktur selv.
Foto: Fay Lee / Unsplash
Hvad udbyderen tilbyder
Replicate er en platform til at køre open source machine learning-modeller via API uden selv at drive GPU-infrastruktur. Udbyderen blev grundlagt i 2019 og har hovedkvarter i San Francisco. Kataloget dækker både sprogmodeller som Llama 2, Mistral, Vicuna og CodeLlama og billedmodeller som Stable Diffusion og SDXL.
Målgruppen er udviklere og teams, der vil bruge en model uden at eje driften af den. Hvor OpenAI og Anthropic giver dig adgang til deres egne lukkede modeller, giver Replicate adgang til et bredt udvalg af modeller trænet af andre. Det gør platformen relevant, når du har brug for en specifik open source-model eller vil sammenligne flere modeller mod hinanden.
Afregningen sker per sekund compute-tid. Det passer til arbejdsbelastninger, der svinger, eller som kun kører i perioder. Betaler du kun for de sekunder, modellen faktisk arbejder, undgår du at holde en GPU kørende mellem opgaverne.
Sådan er det at bygge på den
Du kommer i gang med en konto og en API-token. Derfra kan du kalde en model direkte over HTTP eller bruge SDK'erne til Python og Node.js. Et kald angiver typisk model, version og input-parametre, og du får enten et svar tilbage eller et job-id at følge op på.
API'et er bygget omkring asynkron kørsel. Længerevarende opgaver som billedgenerering eller videobehandling starter som en prediction, og du henter resultatet bagefter eller får det leveret via webhook. Den model kræver, at din applikation kan håndtere ventetid og delvise tilstande, hvilket er en anden struktur end et synkront chat-kald.
Den typiske friktion er cold starts. Har en model ikke kørt et stykke tid, skal den indlæses på en GPU, før den svarer, og den første forespørgsel tager længere tid. For interaktive brugsscenarier skal du enten holde modellen varm, vise en tydelig ventetilstand eller vælge en model med hyppig trafik.
En anden ting at planlægge for er versionering. Modeller på platformen udgives i versioner, og adfærden kan ændre sig mellem dem. Lås en konkret version i produktion frem for at pege på den nyeste.
Hvad du skal være opmærksom på
Du er afhængig af to led: platformen selv og de modeller, andre har lagt op. En model kan blive opdateret, deprecated eller fjernet af den, der vedligeholder den. Har en model en central rolle i dit produkt, bør du kende licensen og have en plan for at hoste den selv eller skifte til en tilsvarende.
Selve API-integrationen er forholdsvis let at flytte, fordi de underliggende modeller er open source og også findes hos andre inference-udbydere eller kan køres på egen hardware. Lock-in ligger derfor mindre i modellen og mere i den byggede logik omkring predictions, webhooks og versionsstyring.
Datahåndtering kræver en konkret vurdering. Udbyderen er amerikansk, og inference kører på infrastruktur uden for EU, medmindre andet er aftalt. Behandler du personoplysninger, skal du gennemgå databehandleraftale, overførselsgrundlag og hvad der logges af input og output.
En anden udbyder passer bedre, hvis du kører stabil høj volumen, hvor per-sekund-afregning bliver dyrere end dedikeret kapacitet. Har du brug for lav og forudsigelig latency, eller for at holde data inden for EU under kontraktlige rammer, er en europæisk udbyder eller egen hosting mere oplagt. Skal du bruge de stærkeste lukkede modeller, findes de slet ikke her.
Modeller
Key Features
- ✦Serverless ML inference
- ✦Pay-per-second pricing
- ✦Auto-scaling infrastructure
- ✦Nem model deployment
- ✦GPU optimization
- ✦API-first approach
API Features
Pricing Model
Pay-per-use - betaling per sekund compute tid
Styrker
- ✓Ingen infrastruktur management
- ✓Bred vifte af open source models
- ✓Simpel API integration
- ✓Cost-effektiv for sporadisk brug
- ✓Hurtig model deployment
Begrænsninger
- !Kan blive dyrt ved høj volume
- !Cold start latency
- !Afhængig af third-party models
- !Mindre kontrol over infrastruktur