
OpenAI je upravo predstavio novu generaciju modela za generiranje slika — ChatGPT Images 2.5.
Prema službenim najavama, novi model donosi poboljšanja u kvaliteti detalja, brzini generiranja, preciznosti uređivanja i dosljednosti kroz višekratne izmjene. Uz to, uvedene su i nove mogućnosti: Sketch (ručno crtanje kao vizualna referenca), predlošci za kreativne projekte te uređivanje slika putem komentara — sve s ciljem da korisnici što više priđu profesionalnom dizajnerskom procesu.

OpenAI navodi da korisnici trenutačno tjedno generiraju više od 3 milijarde slika putem ChatGPT Images i GPT Image modela dostupnih kroz API.
Lansiranjem Images 2.5 OpenAI jasno pokazuje da želi proširiti primjenu AI alata za slike — od osobnih kreativnih projekata, preko marketinškog dizajna, do vizuala za proizvode.

U usporedbi s prethodnim Images 2.0, najveći napredak u Images 2.5 odnosi se na razumijevanje korisničkih zahtjeva za izmjenama.

Dosad su AI modeli za generiranje slika bili puno bolji u stvaranju slike od nule nego u preciznom uređivanju. Kad bi korisnik zatražio izmjenu nekog detalja, model bi često nehotice mijenjao i druge dijelove slike — primjerice, pri promjeni odjeće lika moglo bi doći do promjene crta lica, a prilagodba pozadine znala je poremetiti cjelokupni vizualni stil.
OpenAI tvrdi da je Images 2.5 optimiziran upravo za precizno uređivanje: model sada točnije izvršava tražene izmjene, a pritom čuva originalni subjekt, kompoziciju i vizualni stil. Korisnici mogu zasebno prilagođavati pojedine elemente — proizvod, pozadinu, tekst — bez potrebe da iznova generiraju cijelu sliku. Ukratko: pogađa točno tamo gdje mu se kaže.

U primjerima koje je OpenAI prikazao, portretna fotografija može se pretvoriti u različite scene i stilove — primjerice, obična profilna slika može dobiti izgled retro studijskog portreta, a fotografija kućnog ljubimca može biti smještena u potpuno novi vizualni kontekst, uz zadržavanje ključnih karakteristika osobe ili životinje.
Sam sam isprobao Images 2.5 na nekoliko različitih vrsta zadataka.
U testu generiranja portreta, zatražio sam od modela da zadrži crte lica referentne osobe i na temelju toga stvori visokokvalitetnu kreativnu fotografiju.

Rezultati su pokazali da Images 2.5 bolje čuva karakteristike referentne osobe nego prethodne verzije. Model uspijeva promijeniti fotografski stil, odjeću i okruženje, a da identitet osobe ostane prepoznatljiv i dosljedan.
Osim toga, Images 2.5 konačno prikazuje napredak generiranja slike u obliku postotka — pa korisnik uvijek zna koliko je posla ostalo.

Prema testovima korisnika s interneta, za vrijeme čekanja čak možete igrati Snake.
Slične sposobnosti pokazao sam i u scenariju montaže filmskih likova. Testirao sam scenu u kojoj Musk snima selfie s likom iz Kuma na filmskom setu — od modela sam zatražio da zadrži strukturu lica, izraz i pozu referentne fotografije te generira kvadratnu sliku u stilu zakulisnog selfija.

Ovakvi zadaci ranije su često rezultirali promjenama crta lica i pogreškama u proporcijama, no Images 2.5 znatno stabilnije čuva izgled glavnog subjekta.
U stilu uličnih fotografija, Muskov „životni portret” također je dobio svoju verziju.

Osim portreta, Images 2.5 bolje razumije i vizualni dizajn proizvoda. U jednom testu zatražio sam od modela da generira limenku Cole napravljenu u potpunosti od mekane plišane tkanine.

U testu složene vizualne logike, pokušao sam generirati rekurzivnu sliku.
Uputa je glasila: „Narančasti mačak sjedi na uredskoj stolici i drži iPad, a na ekranu iPada prikazan je isti mačak koji drži isti iPad — i tako u nedogled.”

Ovakva rekurzivna struktura zahtijeva da model istovremeno razumije glavni subjekt, sadržaj ekrana i odnos ponavljanja. Generirani rezultat uspješno je prepoznao tu vizualnu ugniježđenost i prikazao višeslojni rekurzivni efekt.
Uz realističke slike, Images 2.5 bolje razumije i složene umjetničke stilove.

Na slici u stilu igre Black Myth, Images 2.5 postigao je vizual koji više nalikuje konceptualnoj ilustraciji za videoigru nego pukom nagomilavanju tematskih simbola.

Tu su i ilustracije u stilu strip-knjiga Romance of the Three Kingdoms.
Generirani rezultati prepoznaju karakteristike klasičnih kineskih strip-knjiga — crno-bijeli linijski crtež, lagano koloriranje i teksturu starog papira — pa cjelokupni vizual više nalikuje klasičnoj kineskoj ilustraciji nego jednostavnom dodavanju elemenata u stilu drevnih kostima.

Kao i prethodna generacija, Images 2.5 posebno se ističe u radu s kineskim pismom i tekstom.

Gledajući cjelinu, poboljšanja u Images 2.5 mogu se svesti na tri ključna područja.
Prvo, model bolje razumije složene upute i može istovremeno obraditi više stilova, subjekata i ograničenja. Drugo, bolje čuva referentne elemente — likovi, proizvodi i drugi ključni vizualni elementi ostaju dosljedniji kroz višekratne izmjene. Treće, proces uređivanja bliži je stvarnom dizajnerskom radu: korisnici mogu kontinuirano dorađivati istu sliku umjesto da iznova generiraju nove.
Prema testovima korisnika @aimlapi, Images 2.5 za Nano Banana Pro donosi primjetno izražajniji i artistički dojmljiviji rezultat.

No Images 2.5 nije bez mana — šum na slikama i dalje je ozbiljan problem koji se teško može ignorirati.

Osim toga, korisnici su primijetili da i u službenim primjerima koje je OpenAI objavio postoje određene sitne greške i nedostaci.

Uz poboljšanja samog modela, OpenAI je u ChatGPT uveo i niz novih funkcija koje olakšavaju kreativni proces.
Funkcija Sketch omogućuje korisnicima da izravno u ChatGPT-u nacrtaju skicu i koriste je kao vizualnu referencu za generiranje slike. Dovoljno je grubo skicirati raspored prostorije, obrise odjeće ili kreativnu ideju — AI će na temelju opisa generirati gotovu sliku.
Primjerice, ja sam brzom skicom uspio generirati bilježnicu i olovku.

Sketch rješava problem koji mnogi korisnici poznaju: teško je riječima precizno opisati prostorne odnose na slici, pa se upute moraju iznova i iznova prilagođavati. Ručnim crtežom taj se problem zaobilazi na intuitivan način.

Čini se da će internet uskoro preplaviti armija „umjetnika” čiji su crteži — blago rečeno — specifičnog stila.

Sketch nije ograničen samo na statične slike — može se koristiti i za izradu animiranog sadržaja poput GIF-ova.

OpenAI je uveo i funkciju predložaka koja korisnicima omogućuje da kreativni proces započnu od unaprijed definiranih dizajnerskih scenarija — poput plakata ili slika proizvoda. Umjesto da počinju od praznog polja za unos, korisnici odabiru predložak i zatim ga dopunjuju tekstom, stilom i specifičnim zahtjevima.

Uz to, korisnici sada mogu izravno na slici ostaviti komentar i označiti dio koji žele promijeniti. Moguće je i dijeliti upute korištene za generiranje slike, čime drugi korisnici mogu na temelju iste ideje stvoriti vlastitu verziju.
Za razvojne programere, OpenAI istovremeno lansira dva nova API modela za slike.
GPT Image 2.5 Flare zadani je model namijenjen većini primjena — donosi poboljšanja u kvaliteti, sposobnosti uređivanja i brzini. OpenAI navodi da u usporedbi s GPT Image 2 pruža višu kvalitetu slike uz smanjenje latencije za 50%, što ga čini pogodnim za sadržaj na društvenim mrežama, e-commerce vizuale, vizualno pretraživanje i masovno generiranje slika.

Drugi model, GPT Image 2.5 Sunburst, namijenjen je zahtjevnijim kreativnim radnim procesima — naglasak je na finijoj kontroli, a primjena uključuje izradu reklamnih materijala i dizajn visokokvalitetnih slika proizvoda.
ChatGPT Images 2.5 već je dostupan korisnicima ChatGPT-a, ChatGPT Work i Codexa — na stolnim računalima, mobilnim uređajima i u web pregledniku. Razvojni programeri mogu koristiti GPT Image 2.5 Flare i GPT Image 2.5 Sunburst putem API-ja.
ChatGPT Images 2.5 nije samo još jedna nadogradnja modela za generiranje slika. Model koji razumije vizualni sadržaj, čuva kontekstualni kontinuitet i kontinuirano se prilagođava na temelju povratnih informacija postaje važan dio načina na koji AI razumije svijet oko nas.
Svakako ga isprobajte.
Izvor: Ifanr







