Cognitions nye kodemodell er bygget på kinesisk grunnmur
SWE-2 er ettertrent fra Kimi K3, en kinesisk basismodell på 2,8 billioner parametere. Cognition oppgir selv at den er ett poeng bak Fable 5.1 til 64 prosent lavere pris.
Av H. S. Pettersen · 2 min lesing
Begreper i denne artikkelen
Cognition slapp kodemodellen SWE-2 10. september. Den er ikke trent fra bunnen. Den er ettertrent fra Kimi K3, en kinesisk basismodell på 2,8 billioner parametere som allerede hadde vært gjennom forsterkningslæring for agentisk koding. Et amerikansk selskap bygger altså sitt viktigste produkt på et kinesisk fundament.
Grunnmuren er kinesisk
Valget er ikke ideologisk, det er økonomisk. Å trene en basismodell på den størrelsen koster mer enn Cognition har. Å ettertrene en som allerede finnes, koster en brøkdel. Det er nøyaktig den dynamikken som gjør åpne vekter til en salgskanal snarere enn en gave. Forskjellen nå er hvem som eier kanalen, og at kunnskapen denne gangen går andre veien enn i Washingtons fremstilling.
Tre innsatsnivåer, én treningsrunde
SWE-2 er ifølge Cognition den første modellen i serien med valgbare innsatsnivåer: medium, høy og maks. Alle tre er trent i samme forsterkningsrunde. Metoden er en lineær kostnadsstraff per nivå, justert etter den lokale helningen på basismodellens kostnad-mot-ytelse-kurve. Selskapet oppgir at treningen la fem til seks poeng på flere referansetester og flyttet hele kurven til K3.
- FrontierCode 1.1 Main
- 50,0 prosent
- DeepSWE 1.1
- 73,0 prosent
- Terminal-Bench 2.1
- 92,8 prosent
- Terminal-Bench 4
- 27,3 prosent
- Basismodell
- Kimi K3, 2,8 billioner parametere
- Tilgjengelig i
- Devin Desktop og Devin CLI
Innsatsnivåer er ikke nytt i seg selv, flere leverandører lar deg skru på hvor lenge modellen får tenke. Det nye er at nivåene her er trent inn samtidig, ikke bundet på i etterkant. Holder det, kan brukeren handle nøyaktighet mot kostnad langs en kurve leverandøren har optimalisert, i stedet for langs en bryter som bare skrur opp antall tokens.
Tallene er selskapets egne
Det mest siterte tallet er at SWE-2 lander innenfor ett poeng av Fable 5.1 på FrontierCode 1.1 Main, til 64 prosent lavere pris. Det er Cognitions egen måling, mot en konkurrent selskapet ikke har noen interesse av å måle generøst. Ingen uavhengig part har gjentatt testen. Samme forbehold gjaldt da Tencent publiserte sine egne tall for HY4.
Modellen er tilgjengelig i Devin Desktop og Devin CLI fra lanseringsdagen, ikke gjennom et åpent API. Det begrenser etterprøvingen til dem som allerede betaler for Devin. En besparelse på 64 prosent er verdt å teste. Den er ikke verdt å tro på fordi selgeren sier det.


