Qwen je 14. augusta objavio Qwen/Qwen3.8-27B na Hugging Faceu pod nemodifikovanom Apache License 2.0. To je najprovjerljivija činjenica u izdanju: LICENSE u repozitoriju je standardni Apache 2.0 tekst iz januara 2004, 11.544 bajta, uz jedinu nestandardnu liniju Copyright 2026 Alibaba Cloud.

Šta licenca kaže

Nema NOTICE fajla, nema USE_POLICY.md, nema acceptable-use dodatka, ograničenja polja primjene, granice po broju korisnika (za razliku od Llame) ni uslova vezanog na komercijalni prihod. U manifestu od 33 fajla Qwen-specifičnog ugovora nema.

Sekcija 2 daje trajnu, globalnu, neopozivu i royalty-free (bez naknade za korištenje) licencu za reprodukciju, izvedene radove i distribuciju. Sekcija 3 dodaje patentni grant, Sekcija 4 uslovljava redistribuciju nošenjem licence, označavanjem izmjena i atribucijom. Izvedeni radovi smiju se relicencirati i zatvoriti.

Jedno se ne daje: Sekcija 6 zadržava prava na zaštitni znak. Težine su slobodne, ime Qwen nije.

Hardver: 18,7 GB prije ijednog tokena konteksta

Model je dense, 27.781.427.952 parametra, VLM (vision-language model) koji prima tekst, sliku i video, a daje samo tekst. U config.json nema ključeva za mixture-of-experts (MoE) – nema podjele na aktivne i ukupne parametre.

Sitnica koja zbuni: model_type je i dalje qwen3_5, iako se model zove 3.8 – arhitektura je prenesena iz te linije. Ako ga učitavate kroz transformers, na to ćete naletjeti.

Qwen nije objavio ni jednu kvantizaciju; sve u prometu je iz zajednice. Iz bartowski/Qwen3.8-27B-GGUF, Q4_K_M je 17,8 GB. Za slikovni ulaz treba i poseban fajl, mmproj-Qwen3.8-27B-f16.gguf, 0,93 GB, koji u toj cifri nije uračunat. Naša aritmetika: 18,7 GB VRAM-a prije nego što se alocira ijedan bajt KV cachea.

Ispravka našeg vodiča: KV cache

Naš vodič od 4. augusta kaže “plus 1–2 GB za KV cache”. Za hibridni model na dugom kontekstu to je materijalno premalo.

Iz config.json: cache drži samo 16 full-attention slojeva (full_attention_interval: 4), num_key_value_heads: 4, head_dim: 256. Dakle 16 × 2 × 4 × 256 = 32.768 vrijednosti po tokenu, odnosno 64 KiB po tokenu na FP16. Na kartici od 24 GB preostalih ~5 GB nosi nekih 76K tokena, ili ~150K ako i cache kvantizujete na Q8. Punih 262K nativnog konteksta traži ~16 GiB samo za cache i na 24 GB nije dostupno. Vodič nema pojas za 27B: ljestvica ide od 14B ≈ 9 GB na 30–32B ≈ 19–20 GB. Naših 18,7 GB je ispod tog pojasa, a kad se doda režija runtime-a stvarna potrošnja završi upravo u njemu, pa hardverski dio vodiča drži. Pravilo za KV cache ne drži.

Hibrid: šta se dobija i šta se plaća

Od 64 sloja, layer_types daje 48 linear_attention i 16 full_attention u 3:1 uzorku. Linearni slojevi (Gated DeltaNet) nose stanje fiksne veličine umjesto KV cachea koji raste – po našem izračunu ~151 MB na FP32, konstantno bez obzira na dužinu sekvence. KV cache je time 4× manji nego kod modela istog oblika kojem bi sva 64 sloja bila full attention: 64 KiB prema 256 KiB po tokenu. To je ono što 100K+ konteksta na 24 GB uopšte čini izvedivim – ali samo uz kvantizovan KV cache, jer na FP16 preostalih ~5 GB nosi oko 76K tokena.

Cijena je stvarna. Linearni mehanizam pažnje (linear attention) je O(n) po vremenu i O(1) po memoriji, ali mu je stanje ograničeno, pa gubi tačno prisjećanje na dugim rasponima – ne može pouzdano dohvatiti proizvoljan token iz daleke prošlosti kako to može klasična softmax varijanta. Ovdje cijeli teret dohvata nose ta 16 full-attention sloja, a da li to drži na 262K niko nije nezavisno izmjerio.

1M tokena je konfiguracija, ne sposobnost

Nativni kontekstni prozor (context window) je 262.144 tokena (max_position_embeddings). Milion zahtijeva YaRN RoPE skaliranje s faktorom 4.0, a isporučeni config.json nema rope_scaling blok – rope_type je "default". Uključujete ga sami, i model card upozorava da poznati open-source alati implementiraju statični YaRN, što može uticati na kvalitet na kraćim tekstovima. Objavljenog rezultata na RULER, LongBench ili needle-in-a-haystack testu nema – ni na 1M, ni na 262K, ni od koga.

Nezavisno provjereno: skoro ništa

Uz izdanje nije došao tehnički izvještaj, popis podataka za trening, podatak do kojeg datuma model ima znanje, ni izvještaj o sigurnosnom testiranju. Svi brojevi o sposobnostima su Qwenovi vlastiti, s model carda, i ni jedan nije nezavisno reproduciran – uključujući SWE-bench Pro 61,7 i Agents’ Last Exam 20,4 pass@1.

Jedini nezavisno izmjeren broj u izdanju ne govori o sposobnostima nego o kvalitetu kvantizacije. Poređenje 36 varijanti po KL divergenciji, na četiri RTX 5090, pokazuje da kvantizacije ispod 10 GB propadaju, da 3-bitne oko 13,8 GB drže 92,4% top-1 i da iznad ~25 GB izbor kvantizatora prestaje biti važan. To je jedna objava iz zajednice, ne recenzirana evaluacija, ali je jedino nezavisno mjerenje koje govori o odluci koju ćete zaista donijeti.

Metodologija je objavljena i to je više transparentnosti nego kod većine: Qwen je konkurente sam ponovo pokrenuo (Claude Code, temp=1.0, top_p=0.95, 256K konteksta) umjesto da citira njihove brojeve, i ručno ispravio pogrešne anotacije tačnih odgovora u MathVisionu i CharXivu. Ista ta transparentnost znači da tabela na model cardu pokazuje Qwenovo mjerenje Qwenovih konkurenata na benchmarku koji je Qwen ispravio. Oba dijela važe.

Šta to znači u praksi

Zvanično podržano, po model cardu: vLLM, SGLang, TokenSpeed i Transformers (uz transformers_version: 5.8.0.dev0, dakle razvojna verzija). Ollama ima zvaničan unos, qwen3.8, s oko 245K preuzimanja do 17. augusta. llama.cpp i LM Studio rade preko GGUF konverzija iz zajednice plus mmproj fajla; Simon Willison je potvrdio slikovni ulaz, s detekcijom objekata u skali koordinata 0–1000.

Video je rupa: radi kroz Qwenov vlastiti softver (Transformers, vLLM), a kroz llama.cpp, Ollamu i LM Studio nije potvrđen nigdje.

U težinama je i mtp_num_hidden_layers: 1. Willison je s llama.cpp opcijom --spec-type draft-mtp izmjerio oko 72% brže dekodiranje nego s podrazumijevanim ponašanjem LM Studija, bez zasebnog dodatnog modela. Ta razlika, međutim, obuhvata i promjenu servisnog sloja, a ne samo MTP. Njegovih 15–30 tokena u sekundi (tok/s) izmjereno je u LM Studiju, na LM Studiovom vlastitom Q4_K_M buildu od 17 GB, na 128 GB M5 Max i na DGX Sparku. Post ne kaže koja mašina daje koji broj, pa je to jedno praktično mjerenje, ne benchmark.

Licenca je jedina stvar koju možete provjeriti sami, danas, u fajlu. Sve ostalo o ovom izdanju za sada je Qwenova riječ.

Izvori