Marketplace
MarketplaceMobil mega-meny för innehåll, tjänster och konto.

Huvudspår

Köp & säljAnnonserBoendeBostadObjektObjektBe om prisOffertFöretagsregisterFöretagLånBanklånLokaltHittaKarriärJobbDestinationerResorCoinsKryptoDiskussionForumKunskapWiki
AI-nyheter

Veo 3 och Imagen 4 lanseras – Google lägger ljud i AI-video och förbättrar bildtext

Veo 3 och Imagen 4 lanseras – Google lägger ljud i AI-video och förbättrar bildtext

Den 20 maj 2025 presenterade Google Veo 3 och Imagen 4 på Google I/O. Veo 3 kunde generera video med synkroniserat ljud, dialog och ljudeffekter, medan Imagen 4 förbättrade bildkvalitet, typografi och högupplöst export. Google lanserade samtidigt Flow, ett filmskaparverktyg som kombinerade modellerna med Gemini.

Marketplace sammanfattar lanseringen i efterhand. Nyheterna gjorde Googles kreativa AI till ett mer sammanhängande produktionssystem. Användaren kunde utveckla en idé med Gemini, skapa visuella komponenter med Imagen och generera rörliga scener med ljud genom Veo.

Lanseringen i korthet

| Produkt | Viktig nyhet den 20 maj 2025 |
|---|---|
| Veo 3 | Video med genererat tal, ljudeffekter och omgivningsljud |
| Imagen 4 | Bättre detalj, typografi och upplösning upp till 2K |
| Flow | AI-arbetsyta för filmsekvenser, scener och tillgångar |
| Tillgång | Först genom Google AI-abonnemang och utvalda marknader |
| Företag/API | Utrullning genom Vertex AI och andra Google-ytor |
| Märkning | SynthID i genererat bild-, video- och ljudmaterial |

Veo 3 gjorde ljudet till en del av videon

Tidigare text-till-video-modeller genererade vanligtvis en stum bildsekvens. Ljud behövde skapas separat och synkroniseras i efterhand.

Veo 3 kunde generera:

  • tal och dialog
  • omgivningsljud
  • ljudeffekter
  • musikliknande ljudmiljöer
  • synkronisering mellan händelse och ljud

En prompt kunde beskriva både scen och ljud: en trafikerad gata, regn mot ett fönster eller en person som säger en replik.

Det minskade stegen till ett färdigt konceptklipp. Samtidigt ökade risken för syntetiska röster och falska uttalanden. En realistisk video med tal kan vara betydligt mer övertygande än en stum deepfake.

Dialog och läppsynk

Veo 3 kunde försöka skapa dialog som passade personens munrörelser. Detta var tekniskt svårt eftersom modellen behövde samordna:

  1. repliken
  2. röstens timing
  3. ansiktsuttryck
  4. läpparnas rörelse
  5. kameravinkel
  6. bakgrundsljud

Resultaten kunde vara imponerande men inte perfekta. Långa repliker, flera personer och ovanliga språk ökade risken för fel.

Svenska röster behövde granskas för uttal, betoning och dialekt. Ett naturligt ljud kunde ändå uttala namn eller facktermer fel.

Bättre fysik och promptföljning

Google beskrev förbättringar i Veo 3:s förståelse av fysisk rörelse och komplexa instruktioner. Modellen kunde skapa mer sammanhängande scener med kamerarörelser och visuella relationer.

AI-video hade fortfarande typiska svagheter:

  • objekt ändrade form
  • personer bytte utseende
  • händer och text blev fel
  • rörelser saknade fysisk logik
  • detaljer försvann mellan bildrutorna
  • scenen utvecklades annorlunda än prompten

Kreatörer behövde granska varje klipp i full upplösning och inte enbart bedöma den första sekunden.

Imagen 4 förbättrade text och detaljer

Imagen 4 blev Googles nya bildmodell med bättre detaljrikedom, fotorealism och stilvariation. Google lyfte särskilt fram typografi.

Modellen kunde användas för:

  • affischer
  • kort
  • presentationer
  • produktkoncept
  • serier
  • illustrationer
  • logotypidéer

Typografi var en viktig förbättring eftersom äldre bildmodeller ofta skapade oläsliga bokstäver. Imagen 4 kunde producera tydligare rubriker och kort text, men professionell trycktext behövde fortfarande sättas i ett layoutprogram.

Långa svenska sammansatta ord och specialtecken kunde ge problem. Stavning och varumärkesnamn måste kontrolleras manuellt.

Upplösning upp till 2K

Google sade att Imagen 4 skulle kunna skapa bilder i flera format och upp till 2K-upplösning.

Högre upplösning hjälper vid:

  • större skärmar
  • presentationsmaterial
  • beskärning
  • tryckutkast
  • produktdetaljer

Upplösning är inte samma sak som verklig detaljprecision. En högupplöst bild kan innehålla mycket skarpa men anatomiskt eller faktamässigt felaktiga element.

Snabbare Imagen 4-version

Google förhandsvisade även en snabb variant av Imagen 4 som skulle kunna generera bilder betydligt fortare än den tidigare modellen.

En snabb modell är värdefull för:

  • brainstorming
  • många variationer
  • interaktiva designverktyg
  • A/B-testning
  • stora innehållsvolymer

Men massgenerering kan skapa kvalitets- och varumärkesproblem. Företag behöver begränsa vem som får publicera, inte bara vem som får generera.

Flow som AI-filmarbetsyta

Flow var Googles nya arbetsyta för filmskapande. Verktyget kombinerade Veo, Imagen och Gemini och gav användaren större kontroll över scener och återkommande tillgångar.

Funktioner omfattade bland annat:

  • text-till-video
  • ingredienser eller referensbilder
  • scenförlängning
  • kamerakontroller
  • hantering av klipp och visuella tillgångar
  • sammansättning av en berättelse

Flow riktades mer mot sekvensarbete än en enkel prompt-till-klipp-generator. En användare kunde utveckla en visuell värld och återanvända element mellan scener.

Karaktärskonsekvens var fortfarande en utmaning. Samma referens minskade variation, men garanterade inte att ansikte, kläder och proportioner blev identiska i varje klipp.

Whisk och andra kreativa ytor

Google byggde in sina modeller i flera produkter, bland annat Gemini, Whisk och senare utvecklarverktyg. Samma grundmodell kunde därför dyka upp i olika gränssnitt med olika begränsningar.

Användaren behövde kontrollera:

  • vilken modellversion som användes
  • maximal längd och upplösning
  • om ljud stöddes
  • vattenstämpel och metadata
  • kommersiella villkor
  • region och abonnemang

Ett modellnamn säger inte hela produktens funktion.

SynthID för bild, video och ljud

Google använde SynthID i genererat material. Veo 3 gjorde märkningen extra viktig eftersom både bild och ljud kunde vara syntetiskt.

En robust transparensmodell behöver flera lager:

  1. inbäddad teknisk signal
  2. metadata
  3. synlig märkning på plattformen
  4. information i publiceringens beskrivning
  5. rättighetsdokumentation

Ingen signal är omöjlig att ta bort. En skärminspelning eller omfattande redigering kan påverka teknisk provenance.

Läs vår genomgång av Google SynthID och EU:s kod för AI-märkning.

Deepfakes med ljud

Veo 3 ökade risknivån eftersom ett klipp kunde få en person att både se ut och låta som om den sade något.

Risker:

  • falska politiska uttalanden
  • vd-bedrägerier
  • falska nyhetsklipp
  • sexuellt material utan samtycke
  • imitation av artister
  • vilseledande kundreferenser

Företag bör inte använda en verklig persons ansikte eller röst utan tydlig rättslig grund och dokumenterat samtycke. Journalistiska och dokumentära format behöver särskilt tydlig märkning.

Upphovsrätt och träningsdata

Google publicerade inte en komplett lista över allt träningsmaterial. Kreatörer och rättighetshavare fortsatte därför diskutera hur generativa modeller lär sig bild, film och ljud.

Före kommersiell användning bör en organisation kontrollera:

  • produktvillkoren
  • uppladdade referensers rättigheter
  • likhet med kända karaktärer
  • logotyper och varumärken
  • röst- och ansiktsrättigheter
  • musik och ljud
  • licens för den slutliga distributionskanalen

Att resultatet genereras från en prompt gör inte varje juridisk fråga automatiskt löst.

Användning i marknadsföring

Veo 3 och Imagen 4 kunde hjälpa företag skapa:

  • kampanjkoncept
  • sociala klipp
  • produktvisualiseringar
  • interna presentationer
  • storyboard
  • lokala språkversioner
  • prototyper före riktig inspelning

AI-material bör inte visa en produktfunktion som inte finns eller en kundupplevelse som aldrig inträffat. Marknadsföringen måste fortfarande vara sanningsenlig.

Kostnad och produktionsflöde

AI kan minska kostnaden för ett första koncept, men professionell produktion innehåller fortsatt:

  • manus
  • art direction
  • urval
  • redigering
  • ljudmix
  • rättighetskontroll
  • varumärkesgranskning
  • tillgänglighet

Den ekonomiska vinsten bör mätas från idé till godkänd publicering, inte enbart tiden för genereringen.

Veo 3 jämfört med den första Veo

| Veo, maj 2024 | Veo 3, maj 2025 |
|---|---|
| Högupplöst text-till-video | Video med inbyggt genererat ljud |
| Filmtermer och längre klipp | Starkare fysik, promptföljning och dialog |
| VideoFX som tidig yta | Flow, Gemini och bredare produktintegration |
| SynthID för video | SynthID över fler syntetiska modaliteter |

Läs vår historiska artikel om den första Veo-lanseringen den 14 maj 2024.

Svenska kreatörer och byråer

För svenska kreatörer var modellerna intressanta för snabba utkast och små produktioner. Svenska språket krävde dock extra kontroll av:

  • uttal
  • läppsynk
  • text i bild
  • dialekt
  • svenska varumärken
  • lokala miljöer och skyltar

En modell kan skapa en visuellt nordisk miljö som innehåller fel vägskylt, arkitektur eller språkdetalj.

Vanliga frågor

När lanserades Veo 3 och Imagen 4?

Google presenterade modellerna den 20 maj 2025 på Google I/O.

Kunde Veo 3 skapa ljud?

Ja. Modellen kunde generera dialog, ljudeffekter och omgivningsljud tillsammans med videon.

Vad var Flow?

Ett AI-verktyg för filmskapande som kombinerade Veo, Imagen och Gemini i en arbetsyta för scener och tillgångar.

Hur hög upplösning stödde Imagen 4?

Google aviserade bildgenerering upp till 2K i produktens utrullning.

Märktes materialet?

Google använde SynthID för att bädda in signaler i genererat bild-, video- och ljudmaterial.

Kunde modellerna användas kommersiellt?

Det berodde på produktens aktuella villkor, abonnemang, referensmaterial och tredje parts rättigheter.

Sammanfattning

Veo 3 och Imagen 4 presenterades den 20 maj 2025 och gjorde Googles kreativa AI betydligt mer produktionsnära. Veo 3 lade till genererat ljud och dialog, medan Imagen 4 förbättrade text, detalj och upplösning. Flow samlade modellerna i ett filmskaparflöde.

Tekniken kunde korta vägen från idé till visuellt utkast, men gjorde också deepfakes mer övertygande. Rättigheter, SynthID, synlig märkning och mänsklig kvalitetskontroll behövde därför följa med varje professionell publicering.

Faktaunderlag: Google, lanseringarna av Veo 3, Imagen 4 och Flow på Google I/O den 20 maj 2025. Artikeln är en historisk sammanfattning publicerad i efterhand.

Utvalda vägar vidare

Jämför och välj med bättre underlag

Tydligt märkta partnererbjudanden, placerade nära rätt beslut.

Partnererbjudande · Banklån

Räkna på banklån innan du ansöker

Se ungefärlig månadskostnad, löptid och villkor på ett ställe.

Räkna på lån

Marketplace kan få ersättning om du går vidare.

Partnererbjudande · Casino · 18+

Casino bonus 2026 – jämför villkor

Se svensk licens, omsättningskrav och aktuell bonusstatus.

Öppna jämförelsen

18+ · Spela ansvarsfullt · Annonslänk · Villkor gäller.

Kommentarer

Kommentarer

Diskutera artikeln i tråden nedan.

Inga omdömen ännu0 omdömen
Fortsätt diskussionen i ForumEn gemensam tråd skapas för artikeln. Har du redan konto kan du logga in och fortsätta direkt.
Diskutera i Forum
Lägg till kommentar

Kommentaren granskas innan den publiceras.

Ditt omdöme