Moonshot AI je najavio Kimi K3, model sa 2.8 biliona parametara, ugrađenom podrškom za vizuelni ulaz i kontekstnim prozorom (context window) od milion tokena. Težine su obećane za javno objavljivanje do 27. jula 2026. Uz najavu je stigao i vendorov vlastiti benchmark, PerceptionBench. Za sada je gotovo sve što znamo o modelu ono što je iznio sam proizvođač – nezavisne provjere još nema.
Šta se desilo
Kimi K3 koristi mixture-of-experts (MoE) arhitekturu: od ukupno 896 eksperata aktivira njih 16 po tokenu. Ukupni broj parametara je 2.8T, ali broj aktivnih parametara Moonshot nije naveo brojčano – a upravo aktivni parametri određuju stvarni trošak inferencije po tokenu, pa je to bitan izostavljen podatak. Proizvođač tvrdi da K3 postiže oko 2.5 puta bolju efikasnost skaliranja u odnosu na prethodni Kimi K2; ta tvrdnja dolazi isključivo od vendora i nije nezavisno reproducirana.
Model podržava vizuelni ulaz direktno (u praksi ga to svrstava u VLM (vision-language model)), pa uz tekst prima i slike. Kvalitet te vizuelne obrade još nije moguće provjeriti izvan Moonshotovih demonstracija.
Dugačak kontekst je nastavak linije koju je Moonshot postavio s K2 – pozicioniranje na osnovu veličine kontekstnog prozora ostaje glavni adut proizvođača. Ovdje je prozor od milion tokena, ali ga treba čitati uz važnu ogradu: na nekim benchmarcima se na 300K tokena aktivira context compaction (sažimanje starijeg konteksta). Drugim riječima, oglašeni prozor i efektivni prozor nisu isto – za dio zadataka model ne radi nad punih milion tokena, nego context compaction sažima stariji sadržaj kada se dosegne prag. Za developere koji planiraju popuniti prozor dokumentima ili dugim agentskim tragom, to je razlika koju treba testirati, a ne pretpostaviti.
API cijene su objavljene: 0.30 dolara po milionu tokena za ulaz na pogodak u kešu (cache-hit), 3.00 dolara za ulaz bez pogotka (cache-miss) i 15.00 dolara za izlaz. Deseterostruka razlika između cache-hit i cache-miss cijene znači da se prompt caching ovdje isplati agresivno koristiti. Model je dostupan preko Kimi.com, Kimi Work, Kimi Code i Kimi API.
Šta je i dalje nepoznato
Moonshot u najavi model naziva “prvim otvorenim modelom klase 3T”. Dvije stvari tu treba razdvojiti. Prvo, “3T klasa” zaokružuje 2.8T naviše. Drugo, i važnije: blog kaže da je model “open”, ali ne imenuje nijednu konkretnu licencu. Bez imena licence status open weights nije potvrđen – ne znamo smije li se model koristiti komercijalno, uz koja ograničenja ni pod kojim uslovima redistribucije. Tome dodajte i da težine još ne postoje javno: datum objavljivanja je u budućnosti (27. jula), pa se do tada ne može ni preuzeti ni testirati.
Šta to znači u praksi
Za developere koji razmišljaju o samostalnom pokretanju: Moonshot za inferenciju preporučuje konfiguracije od 64 ili više akceleratora. To K3 stavlja izvan dosega pojedinačnih radnih stanica i manjih timova – realno je opcija za one koji već upravljaju većim GPU klasterima ili će model koristiti preko API-ja.
Na PerceptionBench-u, benchmarku koji je Moonshot sam napravio i sam pokrenuo, K3 je drugi sa 58.5%, iza GPT-5.6-Sol (59.7%) i ispred Claude-Fable-5 (57.2%). Vrijedi zadržati mjeru: nijedan model ne prelazi 60%, pa 58.5% nije “riješena” vizuelna percepcija, a rezultat dolazi s benchmarka koji je autor i vlasnik jedne od poređenih strana. Nezavisne replikacije nema ni za jedan od navedenih brojeva.
Cjenovni raspon je takođe indikativan. Uz 15.00 dolara po milionu izlaznih tokena, K3 se pozicionira kao model iz gornjeg segmenta, a ne kao jeftina alternativa – ušteda dolazi od kombinacije MoE aktivacije i agresivnog prompt cachinga na strani ulaza, ne od niske osnovne cijene.
Praktičan zaključak: K3 je zanimljiv po specifikacijama – 3T-klasa uz obećane open weights, ugrađen vizuelni ulaz i objavljene cijene rijedak su spoj. Ali odluku o uvođenju vrijedi odgoditi do dva događaja: objave težina s imenovanom licencom 27. jula i prvih nezavisnih mjerenja. Do tada su i benchmark rezultati i “open” status tvrdnje proizvođača, a ne provjerene činjenice.