OpenAI je 6. augusta 2026. objavio augustovske verzije modela GPT-5.6 Sol i Luna u ChatGPT-u. Besplatnom planu i planu Go GPT-5.6 Luna postaje podrazumijevani model i zamjenjuje GPT-5.5 Instant, a Plus i Pro dobijaju klizač za nivo rezonovanja (reasoning effort) koji ChatGPT ulaže u odgovor. Nijedan objavljeni rezultat nije izmjerila nezavisna strana.
Šta se desilo
Prelaz je tekao tokom sedmice od 6. augusta, prema OpenAI-jevoj najavi kako je prenesena u medijima. Julske verzije Sola i Lune izričito nisu zamijenjene i ostaju u Codexu i ChatGPT Work-u, pa dvije verzije rade paralelno.
Besplatni plan i Go dobijaju i neograničene tekstualne razgovore, a sedmicu poslije i dugme Think; oboje stoji samo na OpenAI-jevom blogu kako je prenesen u medijima, ne u dokumentu koji OpenAI objavljuje uz izdanje (system card). Tu je lako pogriješiti: Think daje Luni više vremena na istom modelu, ne prebacuje vas na jači model.
Klizač ide samo na Plus i Pro, na osvježenu verziju Sola. System card ga opisuje kao izbor koliko truda ChatGPT ulaže u odgovor: niže za svakodnevna pitanja, više za planiranje, istraživanje, pisanje i odluke koje traže više razmišljanja. Koliko položaja klizač ima i kako se zovu – ne znamo; nijedan dostupan izvor ne navodi imenovane nivoe ni brojčane vrijednosti.
Sigurnosni i sposobnosni brojevi ne opisuju istu postavku
Detalj koji se gotovo nigdje ne prenosi, a najkorisniji je: sve sigurnosne evaluacije OpenAI mjeri na najnižem nivou rezonovanja, onom iz instant načina rada, a evaluacije sposobnosti na maksimalnom, da dobije gornju granicu sposobnosti. Sigurnosni brojevi zato opisuju jedan kraj klizača, a brojevi o sposobnostima drugi.
Procent o greškama nije ocjena tačnosti ChatGPT-a
“68% manje grešaka” kruži kao naslov, dolazi iz OpenAI-jevog bloga prenesenog sekundarno i vrijedi za Sol na jednom skupu pitanja, ne na cijelom testu. System card je suzdržaniji. Mjeri se koliko odgovora sadrži barem jednu činjeničnu grešku na finansijskim, medicinskim i pravnim pitanjima: u odnosu na GPT-5.5 Instant, Luna tu stopu smanjuje za više od 60% na pitanjima s velikim posljedicama i za oko 30% na druga dva skupa, a Sol za oko 60% na sva tri.
Dvije ograde. Odgovore je ocjenjivao model s pristupom webu, ne ljudi – LLM-as-judge (LLM u ulozi ocjenjivača). I skupovi pitanja biraju se tako da pokažu scenarije u kojima je halucinacija (hallucination) najvjerovatnija; OpenAI izričito kaže da ne odražavaju stvarnu učestalost u upotrebi.
Prve U18 evaluacije, bez statistički značajne razlike
OpenAI prvi put objavljuje posebne U18 evaluacije, koje mjere ponašanje modela prema sigurnosnim standardima za tinejdžere – prvi put za OpenAI-jevo vlastito izvještavanje, ne za industriju. Testovi pokrivaju samopovređivanje, poremećaje hranjenja, pristup proizvodima zabranjenim mladima, grafički nasilan sadržaj i neprimjeren seksualni sadržaj. Treniranje je ciljalo i na to da model ne glumi romantičnog partnera i da se ne postavlja kao zamjena za stvarne odnose.
Rezultat nije pobjeda: ponašanje je, kako OpenAI piše, uglavnom uporedivo s ocijenjenim GPT-5.5 varijantama, bez statistički značajnih razlika. Napredak postoji samo u dvije kategorije: proizvodi zabranjeni mladima i seksualni sadržaj. Vrijedi ista ograda kao za brojeve o greškama: i ovi rezultati dolaze s namjerno teških produkcijskih testova i, kako OpenAI kaže, nisu procjena koliko se takva ponašanja često javljaju u stvarnoj upotrebi.
High capability, ali ne Critical
Prema OpenAI-jevom internom okviru za procjenu rizika (Preparedness Framework), oba modela prelaze High capability threshold – prag koji OpenAI sam postavlja i sam mjeri – za kibersigurnost i za biološke i hemijske rizike. U biološkim i hemijskim evaluacijama 3 od 4 testa po modelu prelaze indikativne pragove, ali nijedan od dva ne prelazi Critical capability, kategoriju iznad High. Za kibersigurnost je također ispod Critical. Za samostalno unapređivanje AI-ja evaluacije nisu ni provedene: OpenAI Sol smatra ispod tog praga zbog sličnosti s julskim izdanjem – zaključak, ne mjerenje.
Šta “High” znači, OpenAI-jevim riječima: za kibersigurnost, model koji uklanja postojeća uska grla za skaliranje kibernetičkih operacija; za biologiju i hemiju, značajna pomoć početniku u stvaranju poznatih ozbiljnih prijetnji. Augustovski dokument potvrđuje, ne mijenja, ono što je stajalo i u julu: modeli su efikasniji u nalaženju i ispravljanju propusta (vulnerability) nego u samostalnom izvođenju napada na dobro branjene ciljeve. Isporučeni su s istim zaštitnim mjerama (safeguards) kao prethodne verzije, a same mjere opisane su u ranijem system cardu za GPT-5.6, ne u ovom dokumentu.
Najvažnija ograda: nijednu od ovih ocjena nije proizveo nezavisni ocjenjivač. Vanjske strane doprinijele su samo podacima i referentnim vrijednostima. Sam OpenAI priznaje da su njegove evaluacije donja granica mogućih sposobnosti.
Šta to znači u praksi
Ako ChatGPT koristite besplatno, dobijate noviji podrazumijevani model, neograničene tekstualne razgovore i dugme koje modelu kupuje vrijeme, a ne bolji model. Ako plaćate Plus ili Pro, dobijate kontrolu nad količinom uloženog truda.
Brojeve o greškama čitajte kao tvrdnju o smjeru napretka na testu koji je OpenAI sam sastavio i koji je ocijenio drugi model, a ne kao dozvolu da finansijsku, medicinsku ili pravnu odluku prepustite chatbotu.