11. SEPTEMBER 2026

← Alle begreper
Hva er

Multimodal

AI som kan forstå og generere flere typer innhold — tekst, bilder, lyd, video.

Hva det er

Multimodal AI refererer til modeller som kan forstå og generere flere typer data — tekst, bilder, lyd og video — i stedet for bare én modalitet. En multimodal modell kan for eksempel analysere et bilde og svare med tekst, eller generere et bilde fra en tekstbeskrivelse.

Hvordan det fungerer

Multimodale modeller bruker separate encodere for ulike datatyper som deretter kobles sammen i et felles representasjonsrom. Tekst, bilder og lyd konverteres til vektorer som modellen kan resonnere over samlet. De nyeste modellene — som GPT-5, Claude Opus 4.6 og Gemini 3 — er nativt multimodale, trent på tekst, bilder og video fra starten.

Hvorfor det er relevant i 2026

Multimodalitet har gått fra nisje til standard. Alle frontier-modeller er nå multimodale. Google Gemma 4 støtter tekst, bilde, video og lyd — selv i den minste varianten. Praktiske bruksområder har eksplodert: kodeassistenter som leser skjermbilder, design-verktøy som genererer kode fra wireframes, og analysemodeller som tolker grafer og tabeller direkte.

Relaterte begreper
Artikler som bruker dette begrepet
AI-nyheter · 8. september 2026

Forskerne testet Meta-brillene. Vanlig bruk kan bryte loven.

Modeller · 6. september 2026

WeatherNext 3 varsler hver time. Kraftmarkedet handler hvert kvarter.

Analyse · 28. august 2026

Softbank vil kjøpe norskgrunnlagte 1X. Prisen falt 40 prosent.

Analyse · 25. august 2026

Tung snudde om KI-brillene. Foreløpig er det bare et utvalg.

AI-nyheter · 19. august 2026

Unitree steg 460 prosent på én dag. Overskuddet er 41 millioner.