Google udgav Gemini 3.8 Live og Gemini 3.8 Live Extended Thinking den 15. september og kaldte dem deres mest avancerede lydmodeller til dato.
De to modeller kan tale, udlede og løse opgaver. Men hvordan klarer de sig blandt uafhængige analytikere? Extended Thinking-versionen toppede Artificial Analysis’ Speech-to-Speech Index med 82,6 og overgik både GPT-Live-1 og Grok Voice.
Følg os på X for de nyeste nyheder, mens de sker
Sådan placerer målingerne Googles nyeste samtale AI-model
Artificial Analysis’ Index udregner gennemsnittet for taleudledning, agent-performance, præference i arena og succesrate for opgaver.
Gemini 3.8 Live Extended Thinking, testet med høj udledning, debuterede på førstepladsen. GPT-Live-1 Astra fulgte efter med 81,5, mens Grok Voice Think Fast 2.0 High kom ind på 81,3.
Standardudgaven af Gemini 3.8 Live blev nummer fem med en score på 76,0. Begge versioner overgik Gemini 3.1 Flash Live High, der fik 71,5 point.
Forskellen er større på agent-ydelse. Extended Thinking nåede 68,6 % på Tau Voice-målingen, mens tidligere generation klarede 37,7 %.
På målingen for taleudledning scorede Extended Thinking 97,7 % og lå lige foran Grok Voice med 97,2 %. Men den blev slået af Qwen Audio 3.0 Realtime Plus, der scorede 99,2 %.
Menneskelige testere vælger stadig den ældre Gemini-model
Kursen er, hvor forskellen virkelig ses. Standardmodellen koster $0,84 pr. time input-lyd. Det er næsten halvdelen af forgængerens $1,75 og laveste kurs blandt alle på listen.
Extended Thinking koster $3,50 pr. time, hvilket er lavere end GPT-Live-1 Sol til $4,47 og Grok Voice Think Fast 2.0 High til $4,80.
Ventetiden er også faldet. Gennemsnitstid til første lyd er nu 1,18 sekunder mod 2,99 sekunder for den ældre Gemini-model.
Lytterne er men dog stadig ikke helt overbeviste. Gemini 3.1 Flash Live er fortsat mest foretrukne i blinde Speech Agent Arena-samtaler med en Elo på 1096.
Gemini 3.8 Live indtager andenpladsen med 1083. Extended Thinking-versionen ligger sidst med 990, selvom den løste 89,1 % af sine opgaver.
Voice AI vurderes nu efter to skalaer, der peger i hver sin retning. Målinger belønner den model, der udleder bedst, mens præference giver bonus til den, der lyder bedst. Google fører i øjeblikket på begge fronter, men med forskellige modeller.
Abonner på vores YouTube-kanal og få indblik fra ledere og journalister









