KI-produktbilder fra ett eneste telefonbilde: hva som fungerte og hva som røk

KI-produktbilder fra ett eneste telefonbilde: hva som fungerte og hva som røk

CasestudierPublisert på

På skrivebordet mitt står en navnløs sprayflaske i ravfarget glass, av typen man heller parfyme over i. Jeg tok ett bilde av den med telefonen og ville finne ut om det ene bildet holdt til å lage et sett KI-produktbilder som duger på en produktside, pluss en kort KI-produktvideo.

Ingen studio, ingen softboks, ingen innleid. Her er hele gjennomkjøringen, inkludert de to delene som ikke gikk.

Hva et telefonbilde faktisk mangler

Utgangsmateriale for KI-produktbilder: et ubehandlet telefonbilde av flasken på et fullt trebord

Et trebord, en floket ladekabel, en halv kald kaffe, en hard skygge fra taklampa og et gulgrønt skjær over alt sammen. Det er herfra de fleste små selgere faktisk starter.

Det som mangler er ikke skarphet. Det er tre andre ting: bakgrunnen er rotete, lyset har ingen retning, og utsnittet vil ikke passe til de andre bildene på siden. Nettopp de tre er det KI-produktbilder løser mest stabilt i dag.

Kravene til råbildet er små: hele gjenstanden synlig, ikke uskarpt, ikke druknet i skygge. Er det på plass, holder et telefonbilde.

Første steg er ikke å generere, men å frilegge

Konklusjonen først: å fjerne bakgrunnen var den minst brysomme delen av hele jobben.

Originalbilde, frilegging på gjennomsiktig bakgrunn og en pikselnær forstørrelse av glasskanten

Originalen til venstre, frileggingen i midten, og glasskanten forstørret til pikslene synes til høyre. Den gjennomsiktige overhetten overlevde hel, og kanten kom tilbake uten hvit glorie og uten frynser — glass og gjennomsiktig plast er ellers akkurat der frilegginger ryker, og denne gikk gjennom på første forsøk. Det steget gikk via fjerning av bakgrunn.

Å zoome inn avdekket likevel noe annet: det gulgrønne skjæret fra originalen fulgte uendret med. Frilegging skiller motivet fra bakgrunnen, den retter ikke farge. Denne fila med gjennomsiktig bakgrunn er altså ikke et ferdig KI-produktbilde, men referansen alle de neste bygger på.

Lys slår kulisse: skriv lyset, ikke stedet

Med en referanse på plass brukte jeg KI-bildegenerering til å lage de fire scenene produktsider oftest ber om.

Fire KI-produktbilder: rent hvitt, beige stein i motlys, mørkt hardt lys og en marmorbenk

Øverst til venstre hovedbildet på hvitt: flatt lys, en reflektor til høyre og en liten kontaktskygge under bunnen. Øverst til høyre står den på beige stein i varmt, lavt motlys, så skyggen strekkes lang og en gyllen kant løper nedover høyre side av glasset. Nederst til venstre en mørk bunn med ett hardt lys, der venstre halvdel synker i skygge. Nederst til høyre livsstilssporet: marmorbenk og et par eukalyptuskvister.

Det nyttigste fra dette steget: skriv scene og lys sammen. «På en steinflate» gir deg en flate og et retningsløst lysbad. «Varmt, lavt motlys fra øvre høyre hjørne, skygge strukket mot venstre, gyllen kant på høyre side av glasset» gir deg bildet over. Retning, hardhet og fargetemperatur flytter et KI-produktbilde langt mer enn hva du plasserer i bakgrunnen.

Lysretningen blir forresten ikke alltid fulgt. Jeg prøvde ett bilde til på svart akryl og ba om lys fra venstre med skygge som faller mot høyre. Speilingen ble nydelig, men det lyse feltet på gulvet ble liggende til venstre, og skyggen var knapt synlig. Det bildet røk ut.

Å få en hånd inn i bildet

Enhver produktside trenger et «hvor stort er det i hånda»-bilde, og hånda er nettopp der KI-produktbilder røper seg: sammenvokste fingre, én for mye, en knoke som bøyer feil vei.

KI-produktbilde av en hånd som holder den ravfargede glassflasken i mykt dagslys

Jeg zoomet inn og telte: fem fingre, ledd som bøyer riktig vei, negler like lange, til og med hudfolden ved tommelroten. Første forsøk, ingen omkjøring.

Det som røk: teksten holdt, korken gjorde ikke

Bildemodeller klarer ikke å skrive lesbar tekst. Det har jeg regnet som avgjort, så jeg sjekket.

To KI-produktbilder med trykte etiketter, én på engelsk LAVENDER MIST og én på kinesisk

«LAVENDER MIST / 50 ml» kom tilbake korrekt stavet. Byttet til kinesisk — 薰衣草喷雾 / 净含量 50 毫升 — ga ni tegn uten en eneste feil strek. På lengden av en kort etikett har den nedarvede sannheten gått ut på dato.

Det som faktisk røk, var jeg nær ved å overse.

Korken på originalbildet sammenlignet med korkene på de fire ferdige bildene, hver med sin egen form

Ytterst til venstre korken på originalen: kantet skulder, rett kropp, flat på toppen. De fire til høyre er de ferdige bildene. Alle korkene har blitt kuppelformede, ingen to like høye eller like brede, og dysen inni skifter form hver gang.

De store tingene holdt modellen godt — glassfargen, etikettens plassering, bakgrunn, lys. Det som driver, er akkurat denne typen strukturell detalj, litt lenger for hver ny opptegning. På et ekte produkt teller det: en kjøper som får en pakke som ikke stemmer med hovedbildet, legger igjen én stjerne.

Løsningen er grov, men den virker: velg bildet der korken ligger nærmest den ekte gjenstanden, lås det som eneste referanse, og generer resten av KI-produktbildene ut fra det i stedet for å starte hvert bilde på nytt.

Fra stillbilde til en KI-produktvideo på 10 sekunder

Jeg valgte bildet på stein og sendte det gjennom første og siste bilde til video, som ga en KI-produktvideo på 10 sekunder.

Klipp fra en KI-produktvideo generert fra et stillestående KI-produktbilde, der kameraet sakte kjører inn mot flasken

Ledeteksten ba om to ting: en svært langsom innkjøring, og et sidelys som feier fra høyre mot venstre slik at skyggen kortes ned. Bare det første skjedde. Innkjøringen er knallstabil — flaskens form, etikettens proporsjoner og glassets farge vakler ikke gjennom drøyt to hundre bilder — men lyset står praktisk talt stille, og skyggen er like lang til slutt som i starten.

Den byttehandelen tar jeg. Det verste som kan skje i en KI-produktvideo, er at motivet deformeres mens kameraet beveger seg, og et veloppdragent kamera er billig forsikring. Trenger du flere vinkler, kjør et par KI-produktvideoer til fra det samme låste bildet og klipp dem sammen.

Hva det kostet i tid

Førti minutter og litt til fra knipsing til ferdige filer, og mer enn halvparten gikk med til å vente på genereringer og velge mellom dem. To omkjøringer: bildet på svart akryl bommet på lysretningen, bommet igjen på andre forsøk og ble lagt bort; korkens drift dukket ikke opp før alt var ferdig, og strøk en hel runde med fire bakgrunner. Hadde referansen vært låst fra start, var den runden spart.

Verdt å merke seg at nøyaktig ett steg i hele prosessen krever smak: å velge hvilket bilde som blir referansen. Resten er repetisjon.

Har du et produkt du ikke får fotografert skikkelig, trenger ikke utgangspunktet ditt å være bedre enn knipset mitt. KI-bildegenerering tar stillbildene, KI-videogenerering tar klippet, og når du vil legge et dusin KI-produktbilder og et par videoer side om side for å vurdere dem, dra hele bunken over på generativt canvas — hva som blir med og hva som må kjøres om, ser du med én gang.

Del