10. SEPTEMBER 2026

Modeller·16. august 2026

Qwen 3.8 27B kjører på laptopen. Standardinnstillingen ødelegger den.

Alibabas nye 27B-modell er åpen, multimodal og 17 gigabyte. Den bruker også 21 minutter på å tegne en pelikan, fordi fabrikkinnstillingen sier den skal.

Av H. S. Pettersen · 2 min lesing
Qwen 3.8 27B kjører på laptopen. Standardinnstillingen ødelegger den.
Illustrasjon: AMD

Begreper i denne artikkelen

Open source AIAI-modeller der kode og/eller vekter er offentlig tilgjengelige, slik at hvem som helst kan bruke og forbedre dem.
Context windowMengden tekst en AI-modell kan prosessere i én forespørsel. Måles i tokens.
MultimodalAI som kan forstå og generere flere typer innhold — tekst, bilder, lyd, video.
BenchmarkStandardisert test for å måle og sammenligne ytelsen til AI-modeller på bestemte oppgaver.
TokenMinste tekst-enhet en språkmodell prosesserer — omtrent 3/4 av et ord på engelsk.

Alibaba slapp Qwen 3.8 27B fredag 14. august: 27,78 milliarder parametere, Apache 2.0, tekst, bilde og video inn, 262 144 tokens kontekstvindu. Den kvantiserte Q4_K_M-fila er på 17 gigabyte. Det er en modell som kjører på en godt utstyrt bærbar maskin, uten at et eneste tegn forlater den.

De første uavhengige testene landet i helgen. De er positive, med ett stort forbehold.

Fabrikkinnstillingen er feil

Modellen har tre nivåer for resonneringsdybde: xhigh, medium og low. Standarden er xhigh. Utvikleren Simon Willison, som kjørte modellen på en MacBook Pro med 128 GB og en Nvidia DGX Spark, brukte 21 minutter og 22 276 resonneringstokens på å produsere én SVG-tegning. Samme oppgave med resonnering avslått tok to minutter. Bedt om å tegne en sirkel, begynte modellen i stedet å planlegge en «geometrisk studie» med konsentriske ringer, dempet animasjon og Bauhaus-palett.

Advarsel
Skru ned før du konkluderer
Qwen leverer modellen med xhigh som standard resonneringsnivå. På forbrukermaskinvare gir det ekstreme svartider på trivielle oppgaver. Start på low eller uten resonnering, og skru opp bare der oppgaven faktisk krever det.

Tallene er leverandørens

Qwen oppgir kraftige løft fra forgjengeren Qwen3.6-27B: Terminal-Bench 2.1 fra 63,4 til 73,0, OSWorld-Verified fra 63,9 til 84,3 og DeepSWE 1.1 fra 13,3 til 42,2. Alle tallene er selskapets egne målinger. Det uavhengige bildet er tynnere, men peker samme vei: modellen drev en fullverdig kodeagent mot en ekte kodebase og returnerte presise bounding-bokser i fotografier. Begge deler er oppgaver små modeller pleier å rote til.

Qwen 3.8 27B
Alibaba (Qwen)
Kontekst
262 144 tokens
Pris inn
Åpne vekter, Apache 2.0
Pris ut
Åpne vekter, Apache 2.0
Hastighet
15 til 30 tokens per sekund lokalt (M5 Max og DGX Spark, LM Studio Q4_K_M)
Kunnskap
Styrker
Multimodal: tekst, bilde og video innVerktøykall og agentloop lokaltObjektdeteksjon og bounding-bokser17 GB på disk i 4-bits kvantisering

Flaskehalsen er fart, ikke evne

15 til 30 tokens i sekundet på testmaskinene. Artificial Analysis måler GPT-5.6 Sol til 74 og 5.6 Luna til 184. Avstanden er stor nok til at hostede modeller vinner arbeidsdagen selv når den lokale er faglig god nok. Miljøet jobber allerede med saken: llama.cpp med Multi-Token Prediction, der en billigere mekanisme gjetter flere tokens frem og hovedmodellen verifiserer, ga rundt 72 prosent høyere gjennomstrømning enn standardbygget i LM Studio.

Fire dager etter Meta

Slippet kom fire dager etter at Meta la sin åpne 30B-modell Muse Glimmer ut under samme lisens, og en drøy måned etter at Alibaba svarte Kimi K3 med Qwen3.8-Max. Segmentet på rundt 30 milliarder parametere er i ferd med å bli der de åpne modellene faktisk konkurrerer, fordi det er den største størrelsen som får plass på maskinvare folk allerede eier. For norske virksomheter med data som ikke kan sendes ut av huset, er det et etterlevelsesargument like mye som et kostnadsargument, og valget mellom åpne og lukkede vekter er ikke lenger amerikanernes alene.

Grunnprisen for en kompetent multimodal modell er nå 17 gigabyte diskplass. Det som fortsatt koster, er tålmodighet.