Marketplace
MarketplaceMobil mega-meny för innehåll, tjänster och konto.

Huvudspår

Köp & säljAnnonserBoendeBostadObjektObjektBe om prisOffertFöretagsregisterFöretagLånBanklånLokaltHittaKarriärJobbDestinationerResorCoinsKryptoDiskussionForumKunskapWiki
AI-nyheter

Google presenterar Gemini – Ultra, Pro och Nano blir en ny multimodal AI-familj

Google presenterar Gemini – Ultra, Pro och Nano blir en ny multimodal AI-familj

Den 6 december 2023 presenterade Google och Google DeepMind Gemini 1.0, en ny AI-modellfamilj i tre storlekar: Ultra, Pro och Nano. Gemini byggdes från grunden för att arbeta med text, kod, bilder, ljud och video och blev grunden för Googles nästa generation av konsument-, företags- och mobil-AI.

Marketplace sammanfattar lanseringen i efterhand. Gemini Pro började samma dag driva Bard på engelska, Nano flyttade AI-funktioner direkt till Pixel 8 Pro och Ultra förbereddes för en bredare lansering efter ytterligare säkerhetstester. I februari 2024 samlade Google även konsumenttjänsten under namnet Gemini.

Gemini 1.0 i korthet

| Modell | Inriktning vid lanseringen |
|---|---|
| Gemini Ultra | Den största modellen för mycket komplexa uppgifter |
| Gemini Pro | Balanserad modell för ett brett utbud av uppgifter |
| Gemini Nano | Effektiv modell för AI direkt på enheter |

| Punkt | Uppgift |
|---|---|
| Lanseringsdatum | 6 december 2023 |
| Utvecklare | Google och Google DeepMind |
| Modaliteter | Text, kod, bild, ljud och video |
| Första konsumentintegration | Gemini Pro i Bard på engelska |
| Första mobilintegration | Gemini Nano i Pixel 8 Pro |
| Företag och utvecklare | Google AI Studio, Vertex AI och Google Cloud |
| Viktig kodprodukt | AlphaCode 2 byggde på en specialiserad Gemini-version |

Varför Google byggde en modellfamilj

AI-arbetsuppgifter skiljer sig kraftigt i komplexitet och kostnad. En modell som ska köras direkt på en telefon behöver vara liten och energieffektiv. En modell som analyserar mycket stora dokument eller avancerad kod kan använda betydligt mer beräkningskapacitet.

Google delade därför upp Gemini i tre huvudsakliga storlekar.

Gemini Ultra

Ultra var den största och mest kapabla versionen. Den riktades mot svåra uppgifter som avancerat resonemang, multimodal analys och professionellt arbete där kvalitet var viktigare än lägsta kostnad.

Google väntade med den breda tillgången för att genomföra fler säkerhets- och tillförlitlighetstester. Modellen lanserades senare för konsumenter genom Gemini Advanced.

Gemini Pro

Pro var den balanserade modellen för en bred uppsättning uppgifter. Den byggdes in i Bard och gjordes tillgänglig för utvecklare genom Googles AI- och molnplattformar.

Tanken var att Pro skulle ge tillräckligt hög kvalitet för många konsument- och företagsappar utan Ultras högsta resursbehov.

Gemini Nano

Nano var utformad för att köras direkt på enheter. Det kunde ge lägre svarstid och bättre integritet eftersom vissa uppgifter inte behövde skickas till ett datacenter.

Pixel 8 Pro använde Nano för funktioner som sammanfattning i Recorder och Smart Reply i vissa appar.

Multimodal från grunden

Google beskrev Gemini som nativt multimodal. Modellen tränades för att förstå flera typer av information tillsammans i stället för att en språkmodell kompletterades med separata bild- eller ljudkomponenter i efterhand.

Det gjorde det möjligt att analysera kombinationer som:

  • en rapport med text, tabeller och diagram
  • en videosekvens med tal och visuella händelser
  • en handskriven matematisk lösning
  • kod tillsammans med en skärmbild av felet
  • ljud och bild från en teknisk situation

Multimodalitet betydde inte att modellen hade mänsklig förståelse av världen. Den kunde fortfarande misstolka en bild, missa en ljuddetalj eller dra fel slutsats när modaliteterna motsade varandra.

Gemini Pro byggdes in i Bard

Samma dag uppgraderade Google Bard på engelska med Gemini Pro. Företaget beskrev det som Bards största kvalitetsuppdatering dittills.

Integrationen förbättrade bland annat:

  • resonemang
  • planering
  • förståelse
  • kodning
  • sammanfattning
  • mer komplexa följdfrågor

Bard-namnet fanns fortfarande kvar. Det var först den 8 februari 2024 som konsumentprodukten döptes om till Gemini.

Läs även vår historiska genomgång av Google Bards första lansering den 21 mars 2023.

Gemini Nano flyttade AI till telefonen

Pixel 8 Pro blev den första telefonen som marknadsfördes som byggd för Gemini Nano. Lokal AI hade flera möjliga fördelar:

  • snabbare svar
  • möjlighet att fungera utan konstant uppkoppling
  • lägre molnkostnad
  • mindre behov att skicka rådata från enheten
  • funktioner som kan köras kontinuerligt

Det lokala formatet innebar samtidigt begränsningar. Nano hade lägre maximal kapacitet än molnmodellerna och behövde anpassas till telefonens minne, batteri och värmeutveckling.

Lokal körning är inte automatiskt privat. Appens behörigheter, loggning, molnsynkronisering och hur resultatet används avgör fortfarande den faktiska integriteten.

Gemini Ultra och MMLU-resultatet

Google lyfte fram att Gemini Ultra nådde 90,0 procent på MMLU, en benchmark med frågor från många akademiska områden. Företaget sade att modellen var den första som överträffade mänsklig expertprestanda på den särskilda testuppsättningen.

Benchmarkresultatet fick stor uppmärksamhet, men behövde tolkas med försiktighet.

Ett standardiserat test visar inte automatiskt att modellen:

  • kan utöva ett yrke
  • förstår lokala regler
  • tar ansvar för ett beslut
  • kan hantera ofullständig information
  • är pålitlig i varje verkligt användningsfall

Resultatet visade stark kunskap och problemlösning i ett kontrollerat format. Det var inte ett bevis på generell mänsklig expertis.

AlphaCode 2 för programmering

Google presenterade även AlphaCode 2, ett system för tävlingsprogrammering som byggde på en specialiserad Gemini-version.

AlphaCode 2 kunde:

  1. skapa många möjliga lösningar
  2. filtrera bort svaga eller felaktiga förslag
  3. rangordna kandidater
  4. testa strategier mot problemets krav
  5. välja ett mindre antal starka lösningar

Google rapporterade att systemet presterade bättre än 85 procent av deltagarna i vissa Codeforces-utvärderingar.

Tävlingsprogrammering är en viktig men avgränsad färdighet. Verklig mjukvaruutveckling kräver även kravhantering, säkerhet, underhåll, arkitektur och samarbete över tid.

Utvecklaråtkomst genom AI Studio och Vertex AI

Gemini Pro blev tillgänglig för utvecklare genom Google AI Studio och Vertex AI. Företag kunde därmed bygga egna appar och arbetsflöden på modellfamiljen.

Google AI Studio riktades mot snabb prototypning, medan Vertex AI gav fler företagsfunktioner för styrning, data och drift.

Ett företag behövde bedöma:

  • vilken modellstorlek som passade uppgiften
  • vilka data som fick skickas
  • vilken region som användes
  • kostnad per anrop
  • hur resultat testades
  • hur modelluppdateringar hanterades
  • om ett lokalt eller molnbaserat alternativ var bäst

Säkerhetstestning före Ultra-lanseringen

Google genomförde interna och externa utvärderingar inom bland annat bias, toxicitet, cyberrisk och biologiska risker. Ultra fick en längre testperiod innan bred lansering.

Det var särskilt viktigt eftersom en större multimodal modell kan kombinera information från flera källor och hjälpa till med mer komplex planering.

Säkerhet behöver byggas i flera lager:

  • modellträning och policyer
  • produktfilter
  • begränsade verktygsbehörigheter
  • loggning
  • mänskligt godkännande
  • incidenthantering
  • oberoende testning

En modell som avvisar en riskfylld textfråga kan fortfarande skapa problem om den får bred åtkomst till filer, kamera eller externa system.

Debatten om den redigerade demonstrationsvideon

En video som visade Gemini interagera med en människa och föremål i realtid skapade stor uppmärksamhet. Google förtydligade senare att demonstrationen hade skapats från stillbilder och textinstruktioner och att videon var redigerad för tempo.

Händelsen blev en viktig påminnelse om hur AI-demonstrationer bör bedömas. En presentationsvideo kan visa modellens möjliga förmågor utan att representera den exakta användarupplevelsen.

När företag granskar en AI-produkt bör de fråga:

  1. skedde demonstrationen i realtid?
  2. hur många försök krävdes?
  3. användes särskilda instruktioner?
  4. vilka misslyckade exempel visas inte?
  5. är funktionen faktiskt tillgänglig i produkten?

Vad Gemini betydde för Google

Gemini var mer än ett modellsläpp. Google började använda namnet som gemensam grund för AI i:

  • Search
  • Bard och senare Gemini-appen
  • Workspace
  • Android och Pixel
  • Google Cloud
  • programmering
  • forskning
  • robotik och fysisk AI

Det gav företaget möjlighet att sprida samma modellfamilj genom produkter med miljarder användare.

Samtidigt ökade ansvaret. Ett fel eller en bias i en central modell kunde påverka många tjänster samtidigt.

Svenska företags perspektiv

Svenska företag fick en ny stor modellplattform att jämföra med OpenAI, Microsoft, Anthropic och öppna modeller.

Viktiga frågor var:

  • fungerar modellen väl på svenska?
  • finns dataregion och avtalsvillkor som uppfyller kraven?
  • passar integrationen med Google Workspace?
  • kan känsliga arbetsflöden köras lokalt eller privat?
  • hur enkelt är det att byta modellleverantör?
  • vilka funktioner är stabila och vilka är förhandsversioner?

Den bästa modellen i en benchmark behöver inte vara den bästa lösningen för en svensk verksamhet. Integration, kostnad, dataskydd och verklig kvalitet är lika viktiga.

Vägen till Gemini 1.5

Bara två månader efter konsumentlanseringen av Ultra presenterade Google Gemini 1.5 med ett betydligt längre kontextfönster och en ny mixture-of-experts-arkitektur.

Det snabba tempot visade hur kort livslängden för en modellgeneration kunde vara. Företag behövde därför bygga utvärderingar och arkitektur som tålde täta modellbyten.

Vanliga frågor

När lanserades Gemini 1.0?

Google presenterade modellfamiljen den 6 december 2023.

Vilka tre modeller ingick?

Gemini Ultra, Gemini Pro och Gemini Nano.

Var Gemini multimodal?

Ja. Google beskrev modellen som byggd från grunden för text, kod, bild, ljud och video.

Vilken modell användes i Bard?

Gemini Pro började driva den engelskspråkiga Bard-versionen vid lanseringen.

Var kunde Gemini Nano köras?

Nano utformades för lokal användning på enheter och lanserades bland annat på Pixel 8 Pro.

Var Gemini Ultra tillgänglig direkt?

Nej. Ultra genomgick ytterligare tester och lanserades senare för konsumenter genom Gemini Advanced.

Sammanfattning

Gemini 1.0 presenterades den 6 december 2023 som en multimodal modellfamilj i tre storlekar. Ultra riktades mot de svåraste uppgifterna, Pro mot breda konsument- och företagsbehov och Nano mot lokal AI på enheter.

Lanseringen gav Google en gemensam AI-grund för Bard, Pixel, Cloud och många framtida produkter. Den visade samtidigt varför benchmarkresultat, demonstrationsvideor och produktåtkomst måste skiljas åt. En stark modell blir verkligt värdefull först när den kan användas säkert, ekonomiskt och transparent i ett konkret arbetsflöde.

Faktaunderlag: Google och Google DeepMind, ”Introducing Gemini: our largest and most capable AI model”, publicerad 6 december 2023. Artikeln är en historisk sammanfattning publicerad i efterhand.

Utvalda vägar vidare

Jämför och välj med bättre underlag

Tydligt märkta partnererbjudanden, placerade nära rätt beslut.

Partnererbjudande · Banklån

Räkna på banklån innan du ansöker

Se ungefärlig månadskostnad, löptid och villkor på ett ställe.

Räkna på lån

Marketplace kan få ersättning om du går vidare.

Partnererbjudande · Casino · 18+

Casino bonus 2026 – jämför villkor

Se svensk licens, omsättningskrav och aktuell bonusstatus.

Öppna jämförelsen

18+ · Spela ansvarsfullt · Annonslänk · Villkor gäller.

Kommentarer

Kommentarer

Diskutera artikeln i tråden nedan.

Inga omdömen ännu0 omdömen
Fortsätt diskussionen i ForumEn gemensam tråd skapas för artikeln. Har du redan konto kan du logga in och fortsätta direkt.
Diskutera i Forum
Lägg till kommentar

Kommentaren granskas innan den publiceras.

Ditt omdöme