Veo 3 och Imagen 4 lanseras – Google lägger ljud i AI-video och förbättrar bildtext
Den 20 maj 2025 presenterade Google Veo 3 och Imagen 4 på Google I/O. Veo 3 kunde generera video med synkroniserat ljud, dialog och ljudeffekter, medan Imagen 4 förbättrade bildkvalitet, typografi och högupplöst export. Google lanserade samtidigt Flow, ett filmskaparverktyg som kombinerade modellerna med Gemini.
Marketplace sammanfattar lanseringen i efterhand. Nyheterna gjorde Googles kreativa AI till ett mer sammanhängande produktionssystem. Användaren kunde utveckla en idé med Gemini, skapa visuella komponenter med Imagen och generera rörliga scener med ljud genom Veo.
Lanseringen i korthet
| Produkt | Viktig nyhet den 20 maj 2025 |
|---|---|
| Veo 3 | Video med genererat tal, ljudeffekter och omgivningsljud |
| Imagen 4 | Bättre detalj, typografi och upplösning upp till 2K |
| Flow | AI-arbetsyta för filmsekvenser, scener och tillgångar |
| Tillgång | Först genom Google AI-abonnemang och utvalda marknader |
| Företag/API | Utrullning genom Vertex AI och andra Google-ytor |
| Märkning | SynthID i genererat bild-, video- och ljudmaterial |
Veo 3 gjorde ljudet till en del av videon
Tidigare text-till-video-modeller genererade vanligtvis en stum bildsekvens. Ljud behövde skapas separat och synkroniseras i efterhand.
Veo 3 kunde generera:
- tal och dialog
- omgivningsljud
- ljudeffekter
- musikliknande ljudmiljöer
- synkronisering mellan händelse och ljud
En prompt kunde beskriva både scen och ljud: en trafikerad gata, regn mot ett fönster eller en person som säger en replik.
Det minskade stegen till ett färdigt konceptklipp. Samtidigt ökade risken för syntetiska röster och falska uttalanden. En realistisk video med tal kan vara betydligt mer övertygande än en stum deepfake.
Dialog och läppsynk
Veo 3 kunde försöka skapa dialog som passade personens munrörelser. Detta var tekniskt svårt eftersom modellen behövde samordna:
- repliken
- röstens timing
- ansiktsuttryck
- läpparnas rörelse
- kameravinkel
- bakgrundsljud
Resultaten kunde vara imponerande men inte perfekta. Långa repliker, flera personer och ovanliga språk ökade risken för fel.
Svenska röster behövde granskas för uttal, betoning och dialekt. Ett naturligt ljud kunde ändå uttala namn eller facktermer fel.
Bättre fysik och promptföljning
Google beskrev förbättringar i Veo 3:s förståelse av fysisk rörelse och komplexa instruktioner. Modellen kunde skapa mer sammanhängande scener med kamerarörelser och visuella relationer.
AI-video hade fortfarande typiska svagheter:
- objekt ändrade form
- personer bytte utseende
- händer och text blev fel
- rörelser saknade fysisk logik
- detaljer försvann mellan bildrutorna
- scenen utvecklades annorlunda än prompten
Kreatörer behövde granska varje klipp i full upplösning och inte enbart bedöma den första sekunden.
Imagen 4 förbättrade text och detaljer
Imagen 4 blev Googles nya bildmodell med bättre detaljrikedom, fotorealism och stilvariation. Google lyfte särskilt fram typografi.
Modellen kunde användas för:
- affischer
- kort
- presentationer
- produktkoncept
- serier
- illustrationer
- logotypidéer
Typografi var en viktig förbättring eftersom äldre bildmodeller ofta skapade oläsliga bokstäver. Imagen 4 kunde producera tydligare rubriker och kort text, men professionell trycktext behövde fortfarande sättas i ett layoutprogram.
Långa svenska sammansatta ord och specialtecken kunde ge problem. Stavning och varumärkesnamn måste kontrolleras manuellt.
Upplösning upp till 2K
Google sade att Imagen 4 skulle kunna skapa bilder i flera format och upp till 2K-upplösning.
Högre upplösning hjälper vid:
- större skärmar
- presentationsmaterial
- beskärning
- tryckutkast
- produktdetaljer
Upplösning är inte samma sak som verklig detaljprecision. En högupplöst bild kan innehålla mycket skarpa men anatomiskt eller faktamässigt felaktiga element.
Snabbare Imagen 4-version
Google förhandsvisade även en snabb variant av Imagen 4 som skulle kunna generera bilder betydligt fortare än den tidigare modellen.
En snabb modell är värdefull för:
- brainstorming
- många variationer
- interaktiva designverktyg
- A/B-testning
- stora innehållsvolymer
Men massgenerering kan skapa kvalitets- och varumärkesproblem. Företag behöver begränsa vem som får publicera, inte bara vem som får generera.
Flow som AI-filmarbetsyta
Flow var Googles nya arbetsyta för filmskapande. Verktyget kombinerade Veo, Imagen och Gemini och gav användaren större kontroll över scener och återkommande tillgångar.
Funktioner omfattade bland annat:
- text-till-video
- ingredienser eller referensbilder
- scenförlängning
- kamerakontroller
- hantering av klipp och visuella tillgångar
- sammansättning av en berättelse
Flow riktades mer mot sekvensarbete än en enkel prompt-till-klipp-generator. En användare kunde utveckla en visuell värld och återanvända element mellan scener.
Karaktärskonsekvens var fortfarande en utmaning. Samma referens minskade variation, men garanterade inte att ansikte, kläder och proportioner blev identiska i varje klipp.
Whisk och andra kreativa ytor
Google byggde in sina modeller i flera produkter, bland annat Gemini, Whisk och senare utvecklarverktyg. Samma grundmodell kunde därför dyka upp i olika gränssnitt med olika begränsningar.
Användaren behövde kontrollera:
- vilken modellversion som användes
- maximal längd och upplösning
- om ljud stöddes
- vattenstämpel och metadata
- kommersiella villkor
- region och abonnemang
Ett modellnamn säger inte hela produktens funktion.
SynthID för bild, video och ljud
Google använde SynthID i genererat material. Veo 3 gjorde märkningen extra viktig eftersom både bild och ljud kunde vara syntetiskt.
En robust transparensmodell behöver flera lager:
- inbäddad teknisk signal
- metadata
- synlig märkning på plattformen
- information i publiceringens beskrivning
- rättighetsdokumentation
Ingen signal är omöjlig att ta bort. En skärminspelning eller omfattande redigering kan påverka teknisk provenance.
Läs vår genomgång av Google SynthID och EU:s kod för AI-märkning.
Deepfakes med ljud
Veo 3 ökade risknivån eftersom ett klipp kunde få en person att både se ut och låta som om den sade något.
Risker:
- falska politiska uttalanden
- vd-bedrägerier
- falska nyhetsklipp
- sexuellt material utan samtycke
- imitation av artister
- vilseledande kundreferenser
Företag bör inte använda en verklig persons ansikte eller röst utan tydlig rättslig grund och dokumenterat samtycke. Journalistiska och dokumentära format behöver särskilt tydlig märkning.
Upphovsrätt och träningsdata
Google publicerade inte en komplett lista över allt träningsmaterial. Kreatörer och rättighetshavare fortsatte därför diskutera hur generativa modeller lär sig bild, film och ljud.
Före kommersiell användning bör en organisation kontrollera:
- produktvillkoren
- uppladdade referensers rättigheter
- likhet med kända karaktärer
- logotyper och varumärken
- röst- och ansiktsrättigheter
- musik och ljud
- licens för den slutliga distributionskanalen
Att resultatet genereras från en prompt gör inte varje juridisk fråga automatiskt löst.
Användning i marknadsföring
Veo 3 och Imagen 4 kunde hjälpa företag skapa:
- kampanjkoncept
- sociala klipp
- produktvisualiseringar
- interna presentationer
- storyboard
- lokala språkversioner
- prototyper före riktig inspelning
AI-material bör inte visa en produktfunktion som inte finns eller en kundupplevelse som aldrig inträffat. Marknadsföringen måste fortfarande vara sanningsenlig.
Kostnad och produktionsflöde
AI kan minska kostnaden för ett första koncept, men professionell produktion innehåller fortsatt:
- manus
- art direction
- urval
- redigering
- ljudmix
- rättighetskontroll
- varumärkesgranskning
- tillgänglighet
Den ekonomiska vinsten bör mätas från idé till godkänd publicering, inte enbart tiden för genereringen.
Veo 3 jämfört med den första Veo
| Veo, maj 2024 | Veo 3, maj 2025 |
|---|---|
| Högupplöst text-till-video | Video med inbyggt genererat ljud |
| Filmtermer och längre klipp | Starkare fysik, promptföljning och dialog |
| VideoFX som tidig yta | Flow, Gemini och bredare produktintegration |
| SynthID för video | SynthID över fler syntetiska modaliteter |
Läs vår historiska artikel om den första Veo-lanseringen den 14 maj 2024.
Svenska kreatörer och byråer
För svenska kreatörer var modellerna intressanta för snabba utkast och små produktioner. Svenska språket krävde dock extra kontroll av:
- uttal
- läppsynk
- text i bild
- dialekt
- svenska varumärken
- lokala miljöer och skyltar
En modell kan skapa en visuellt nordisk miljö som innehåller fel vägskylt, arkitektur eller språkdetalj.
Vanliga frågor
När lanserades Veo 3 och Imagen 4?
Google presenterade modellerna den 20 maj 2025 på Google I/O.
Kunde Veo 3 skapa ljud?
Ja. Modellen kunde generera dialog, ljudeffekter och omgivningsljud tillsammans med videon.
Vad var Flow?
Ett AI-verktyg för filmskapande som kombinerade Veo, Imagen och Gemini i en arbetsyta för scener och tillgångar.
Hur hög upplösning stödde Imagen 4?
Google aviserade bildgenerering upp till 2K i produktens utrullning.
Märktes materialet?
Google använde SynthID för att bädda in signaler i genererat bild-, video- och ljudmaterial.
Kunde modellerna användas kommersiellt?
Det berodde på produktens aktuella villkor, abonnemang, referensmaterial och tredje parts rättigheter.
Sammanfattning
Veo 3 och Imagen 4 presenterades den 20 maj 2025 och gjorde Googles kreativa AI betydligt mer produktionsnära. Veo 3 lade till genererat ljud och dialog, medan Imagen 4 förbättrade text, detalj och upplösning. Flow samlade modellerna i ett filmskaparflöde.
Tekniken kunde korta vägen från idé till visuellt utkast, men gjorde också deepfakes mer övertygande. Rättigheter, SynthID, synlig märkning och mänsklig kvalitetskontroll behövde därför följa med varje professionell publicering.
Faktaunderlag: Google, lanseringarna av Veo 3, Imagen 4 och Flow på Google I/O den 20 maj 2025. Artikeln är en historisk sammanfattning publicerad i efterhand.
Utvalda vägar vidare
Jämför och välj med bättre underlag
Tydligt märkta partnererbjudanden, placerade nära rätt beslut.
Räkna på banklån innan du ansöker
Se ungefärlig månadskostnad, löptid och villkor på ett ställe.
Marketplace kan få ersättning om du går vidare.
Casino bonus 2026 – jämför villkor
Se svensk licens, omsättningskrav och aktuell bonusstatus.
18+ · Spela ansvarsfullt · Annonslänk · Villkor gäller.



Kommentarer
Diskutera artikeln i tråden nedan.