DALL-E 3
OpenAIÆldre generationDALL-E 3 er OpenAI's mest avancerede billedgenereringsmodel, der kan skabe detaljerede og nøjagtige billeder fra tekstbeskrivelser. Modellen er integreret med ChatGPT og forstår langt mere nuance og detalje end tidligere versioner.
Foto: Zach M / Unsplash
Parametre
Kontekst
Input/1K
Output/1K
Hvad modellen var
DALL-E 3 udkom 1. oktober 2023 og var OpenAI's daværende topmodel til billedgenerering fra tekst. Den blev lanceret tæt integreret med ChatGPT, så du kunne beskrive et motiv i almindeligt sprog og få prompten omskrevet automatisk inden generering. Det flyttede arbejdet væk fra de tætpakkede nøgleordsprompter, som tidligere billedmodeller krævede.
Modellen fulgte lange og sammensatte beskrivelser tættere end forgængeren. Den kunne holde styr på flere objekter, deres indbyrdes placering og en angivet stil i samme billede. Læsbar tekst inde i billederne var stadig upålidelig, men markant bedre end i DALL-E 2.
Træningsdata bestod af billeder og tekst frem til 2023. Parameterantallet er ikke offentliggjort, og context window er ikke et relevant mål for modellen. Prissætningen var per billede, med 0,04 USD input og 0,08 USD output for standard 1024x1024 i HD-kvalitet.
Hvorfor den er blevet overhalet
Senere billedmodeller er blevet bedre til det, DALL-E 3 kun delvist løste. Tekst i billeder gengives mere pålideligt, anatomi og hænder fejler sjældnere, og komplekse scener med mange elementer falder mindre ofte fra hinanden.
En anden forskel er redigering. DALL-E 3 kunne generere et billede, men ikke redigere dele af det gennem API'et. Nyere modeller understøtter i højere grad, at du uploader et billede og beder om målrettede ændringer, eller at du bevarer en figur på tværs af flere billeder.
Dertil kommer, at billedgenerering i dag typisk ligger som en funktion i en multimodal model frem for som en separat tjeneste. Det giver tættere sammenhæng mellem samtale, redigering og resultat, og gør den arbejdsgang, DALL-E 3 introducerede via ChatGPT, til standard snarere end til et særkende.
Har den stadig en rolle
Til nyt produktionsarbejde er svaret reelt nej. Modellen er lukket og hostet, så du kan ikke køre den lokalt, studere vægtene eller finjustere den. De argumenter, der holder ældre open source-modeller i live, gælder ikke her.
Der er to undtagelser af praktisk art. Har du eksisterende integrationer eller pipelines bygget op om DALL-E 3, kan de køre videre, indtil endpointet udfases. Og har du et etableret visuelt udtryk skabt med modellen, kan der være grund til at blive, fordi nyere modeller giver en anden æstetik ved samme prompt.
Ellers hører DALL-E 3 hjemme som et historisk referencepunkt. Den viste, at prompt-forståelse og sproglig nuance betød mere for brugbare resultater end rå billedskarphed, og den præmis er blevet fulgt af alle senere modeller på området.
Capabilities
Opgaver
Sprog Support
Styrker
- ✓Overlegen forståelse af komplekse prompts
- ✓Højere billedkvalitet end DALL-E 2
- ✓Bedre tekstgenerering i billeder
- ✓ChatGPT integration
- ✓Færre sikkerhedsbegrænsninger
- ✓Fotorealistiske resultater
- ✓Konsistent stil
Begrænsninger
- !Dyrere end konkurrenter
- !Begrænset antal billeder per minut
- !Kan ikke generere kendte personers ansigter
- !Content policy begrænsninger
- !Ingen inpainting eller outpainting API endnu
Use Cases
Tekniske Detaljer
- Release Dato
- 1.10.2023
- Provider
- OpenAI
- Parametre
- Ikke offentliggjort
- Kontekstvindue
- N/A tokens
- Træningsdata
- Billeder og tekst frem til 2023