Marketplace
MarketplaceMobil mega-meny för innehåll, tjänster och konto.

Huvudspår

Köp & säljAnnonserBoendeBostadObjektObjektBe om prisOffertFöretagsregisterFöretagLånBanklånLokaltHittaKarriärJobbDestinationerResorCoinsKryptoDiskussionForumKunskapWiki
AI-nyheter

GPT-4o lanseras – ChatGPT får röst, bild och text i realtid

Person använder en telefon med röstassistent och digitala molnverktyg, som illustration till GPT-4o:s multimodala lansering
Bildkälla:stocksbuddy | Magnific | Magnific premiumMagnific premium

GPT-4o lanseras – ChatGPT får röst, bild och text i realtid

Den 13 maj 2024 presenterade OpenAI GPT-4o, en ny flaggskeppsmodell som kunde resonera över text, bild och ljud i samma system. Bokstaven ”o” stod för omni och signalerade att modellen var byggd för flera typer av information i stället för att låta separata komponenter sköta tal, syn och text.

Marketplace sammanfattar lanseringen i efterhand. GPT-4o gjorde ChatGPT snabbare och gav gratisanvändare tillgång till fler avancerade verktyg, men den mest uppmärksammade realtidsrösten rullades ut stegvis efter ytterligare säkerhetstester.

GPT-4o i korthet

| Punkt | Uppgift vid lanseringen |
|---|---|
| Lanseringsdatum | 13 maj 2024 |
| Företag | OpenAI |
| Namnets betydelse | ”o” står för omni |
| Modaliteter | Text, bild och ljud |
| Svarstid för ljud | Som snabbast omkring 232 millisekunder enligt OpenAI |
| ChatGPT | Började rullas ut till gratis- och betalande användare |
| API | Text och bild först, ljud och video successivt |
| Viktig förändring | En gemensam modell i stället för flera sammankopplade system |

Varför var GPT-4o annorlunda?

Den äldre röstfunktionen i ChatGPT använde i praktiken en kedja av modeller. Tal omvandlades till text, en språkmodell skapade svaret och en separat tjänst läste upp texten. Varje steg kunde tappa information om tonfall, pauser och känsloläge.

GPT-4o tränades i stället som en gemensam multimodal modell. Det gjorde det möjligt att behandla ljud direkt och svara med större känsla för hur användaren talade.

Modellen kunde i demonstrationer:

  • avbrytas mitt i ett svar
  • uppfatta tempo och delar av tonfallet
  • svara med olika uttryck och röster
  • diskutera vad kameran visade
  • översätta ett samtal mer direkt
  • arbeta med skärmbilder, diagram och dokument

Det gjorde samtalet mer likt ett naturligt utbyte än tidigare röstassistenter.

Snabbare röstsamtal

OpenAI uppgav att GPT-4o kunde reagera på ljud på i genomsnitt omkring 320 millisekunder och som snabbast omkring 232 millisekunder. Det låg närmare mänsklig samtalstakt än den tidigare pipeline som ofta tog flera sekunder.

Låg svarstid är viktig av flera skäl. När pausen blir för lång börjar användaren och assistenten lätt prata i mun på varandra. Snabb återkoppling gör även språkträning, kundsupport och praktisk vägledning mer användbara.

Men en snabb modell kan också göra ett fel mer övertygande. Användaren får mindre tid att reflektera när ett svar levereras naturligt med röst och känslouttryck.

Bildförståelsen förbättrades

GPT-4o blev bättre på att förstå bilder än tidigare allmänt tillgängliga ChatGPT-modeller. OpenAI visade exempel där användaren kunde fotografera en meny och diskutera översättning, maträtter och kulturell bakgrund.

Andra möjliga användningsområden var:

  • förklara en graf
  • läsa en skylt eller skärmbild
  • ge återkoppling på en design
  • tolka handskrivna anteckningar
  • hjälpa till med matematik utan att direkt ge hela lösningen
  • beskriva föremål för personer med synnedsättning

Bildanalys behövde fortfarande kontrolleras. Små texter, medicinska bilder, exakta mått och otydliga detaljer kunde misstolkas.

Fler funktioner blev gratis

En stor produktnyhet var att OpenAI började göra GPT-4o tillgängligt även för gratisanvändare, med lägre användningsgränser än för betalande planer.

Gratisanvändare fick successivt tillgång till funktioner som tidigare främst funnits i betalversionen:

  • GPT-4-nivå på många uppgifter
  • webbinformation
  • filuppladdning
  • dataanalys och diagram
  • bildförståelse
  • GPT Store och anpassade GPT:er
  • minnesfunktioner

När gränsen nåddes växlade ChatGPT vid den tiden tillbaka till en enklare modell. Plus-, Team- och Enterprise-användare fick högre kapacitet.

Den avancerade rösten försenades

Även om GPT-4o presenterades med imponerande röstdemonstrationer blev hela röstupplevelsen inte tillgänglig för alla samma dag. OpenAI ville genomföra ytterligare tester kring missbruk, imitation och säkerhet.

Riskerna omfattade bland annat:

  • imitation av verkliga personers röster
  • känslomässig påverkan
  • bedrägerier och falska telefonsamtal
  • felaktiga medicinska eller akuta råd
  • oönskad identifiering av personer
  • röstinnehåll som bröt mot säkerhetsregler

Advanced Voice Mode började senare rullas ut till användare och fick en bredare lansering den 24 september 2024.

Betydelsen för tillgänglighet

Multimodal AI kunde ge stor nytta för personer som hade svårt att skriva, läsa eller se en skärm. En användare kunde tala naturligt, visa ett föremål och få ett muntligt svar.

Tekniken kunde exempelvis hjälpa med:

  1. uppläsning och beskrivning av dokument
  2. språköversättning
  3. förklaring av visuella miljöer
  4. diktering och textbearbetning
  5. stegvis hjälp i praktiska uppgifter

Tillgänglighet krävde dock stabilitet. Ett felaktigt svar om medicin, trafik eller säkerhet kunde få större konsekvenser än ett vanligt skrivfel.

GPT-4o för utvecklare

I API:t blev GPT-4o snabbare och billigare än GPT-4 Turbo för många text- och bilduppgifter. OpenAI uppgav vid lanseringen att modellen var ungefär dubbelt så snabb, kostade hälften så mycket och hade högre kapacitetsgränser jämfört med GPT-4 Turbo i API:t.

Det gjorde modellen intressant för:

  • kundtjänst
  • dokumentanalys
  • flerspråkiga appar
  • bildbaserade arbetsflöden
  • realtidsassistenter
  • utbildningsverktyg

Utvecklare behövde fortfarande mäta faktisk kvalitet och kostnad i sina egna arbetsflöden. En lägre tokenkostnad gav ingen vinst om modellen behövde köras om eller om människor måste rätta många svar.

Svenska företag och GDPR

När en assistent kan lyssna, se kameran och läsa filer behandlar den potentiellt betydligt känsligare data än en vanlig textchatt.

Företag behövde därför bestämma:

  • vilka möten och dokument som fick analyseras
  • om ljud eller bilder sparades
  • vem som hade åtkomst till historiken
  • vilka personuppgifter som kunde skickas
  • hur externa underleverantörer hanterades
  • hur data raderades

En medarbetare borde inte rikta kameran mot kundregister, whiteboards eller andra personer utan tydligt stöd och samtycke.

Från GPT-4o till dagens multimodala AI

GPT-4o gjorde multimodalitet till en standardförväntan. Användare började räkna med att en AI-assistent skulle kunna läsa, lyssna, se och tala i samma konversation.

Senare modeller har byggt vidare med längre kontext, mer avancerade resonemang och agentfunktioner. Men de centrala säkerhetsfrågorna består: modellen kan missförstå sin omgivning, låta självsäker och få för bred åtkomst.

Läs även vår historiska genomgång av GPT-4 och den första multimodala ChatGPT-generationen.

Vanliga frågor

När lanserades GPT-4o?

OpenAI presenterade GPT-4o den 13 maj 2024.

Vad betyder bokstaven o?

Den står för omni och syftar på modellens förmåga att arbeta med flera modaliteter.

Blev GPT-4o gratis?

OpenAI började rulla ut modellen till gratisanvändare med begränsade användningsnivåer. Betalande planer fick högre gränser.

Fanns den nya rösten direkt?

Nej. Den avancerade realtidsrösten testades vidare och rullades ut stegvis efter presentationen.

Kunde GPT-4o se livevideo?

OpenAI demonstrerade realtidsliknande kamera- och videofunktioner, men full tillgång kom stegvis och varierade mellan produkter och planer.

Var GPT-4o alltid korrekt?

Nej. Modellen kunde fortfarande hallucinera, misstolka bilder och ge felaktiga svar.

Sammanfattning

GPT-4o lanserades den 13 maj 2024 och förenade text, syn och ljud i en snabbare multimodal modell. Den gav ChatGPT naturligare samtal, bättre bildförståelse och fler avancerade verktyg för gratisanvändare.

Lanseringen gjorde samtidigt dataskydd och röst­säkerhet viktigare. När en AI kan lyssna, se och agera i realtid måste användaren förstå vad som delas, vilka begränsningar modellen har och när ett mänskligt beslut fortfarande krävs.

Faktaunderlag: OpenAI, ”Hello GPT-4o” och ”Introducing GPT-4o and more tools to ChatGPT free users”, publicerade 13 maj 2024. Artikeln är en historisk sammanfattning publicerad i efterhand.

Utvalda vägar vidare

Jämför och välj med bättre underlag

Tydligt märkta partnererbjudanden, placerade nära rätt beslut.

Partnererbjudande · Banklån

Räkna på banklån innan du ansöker

Se ungefärlig månadskostnad, löptid och villkor på ett ställe.

Räkna på lån

Marketplace kan få ersättning om du går vidare.

Partnererbjudande · Casino · 18+

Casino bonus 2026 – jämför villkor

Se svensk licens, omsättningskrav och aktuell bonusstatus.

Öppna jämförelsen

18+ · Spela ansvarsfullt · Annonslänk · Villkor gäller.

Kommentarer

Kommentarer

Diskutera artikeln i tråden nedan.

Inga omdömen ännu0 omdömen
Fortsätt diskussionen i ForumEn gemensam tråd skapas för artikeln. Har du redan konto kan du logga in och fortsätta direkt.
Diskutera i Forum
Lägg till kommentar

Kommentaren granskas innan den publiceras.

Ditt omdöme