Skip to content
VibekollenBETAVibekollen

Källa

Google DeepMind

13 referat i flödet. Sammanfattningarna är skrivna av Vibekollen — innehållet tillhör Google DeepMind.

BloggGoogle DeepMind

Gemini Omni 1.1 Flash lets you build with more control

Google DeepMind presenterar Gemini Omni 1.1 Flash, ett uppdaterad system för att generera video med bättre kontroll för utvecklare. Systemet kan nu analysera upp till 10 sekunder av tidigare kontext — långt mer än tidigare versioner som bara såg den sista sekunden — vilket ger bättre visuell konsistens när man förlänger videor. Nya funktioner inkluderar möjligheten att skapa övergångar mellan keyframes, generera snabba förhandsvisningar i låg upplösning för prototyping, producera polerad 4K-video, och använda videorefenser för att behålla karaktärernas utseende. Allt detta gör det möjligt att bygga generativa videoarbetsflöden och medieredigeringsprogram som är snabbare och billigare att iterera på.

27 aug. deepmind.google

BloggGoogle DeepMind

Piloting the world's first double-blind AI evaluations

Google DeepMind introducerar världens första "dubbelblind" utvärdering av AI-modeller — en metod där utvärderare och modellskapare använder kryptografisk teknik för att testa modeller utan att någon part kan se den andras känsliga data. Problemet de löser är att AI-modeller kan ha tränat på samma testfrågor som används för att bedöma dem, vilket gör resultaten opålitliga. Genom att använda Googles Confidential Computing kan utvärderare testa Gemini Flash Lite-modellen utan att Google ser testfrågorna och utan att modellen kan optimera sig baserat på dem i förväg.

27 aug. deepmind.google

BloggGoogle DeepMind

Intelligent transcription with Gemini 3.5 Transcribe

Google DeepMind presenterar Gemini 3.5 Transcribe, en ny tal-till-text-modell som omvandlar röst direkt till formaterad och korrigerad text. Modellen klarar bakgrundsbrus, komplext fackspråk och tar bort ifyllnadsord som "ums" och "ahs". Den finns i två versioner: en för direktströmmande tal med under en sekunds fördröjning, och en för inspelat material där den kan identifiera och särskilja upp till tre talare. Utvecklare kan använda den via Gemini API och Google AI Studio för att bygga röstapplikationer, realtidstextning eller samtalanalys. Modellen stöder över 85 språk och kan anpassas till eget fackspråk och stavningar.

26 aug. deepmind.google

BloggGoogle DeepMind

Introducing Gemini 3.7 Flash

Google DeepMind presenterar Gemini 3.7 Flash, en uppdaterad AI-modell som är särskilt utformad för kodning och automatiserade agenter. Modellen visar betydande förbättringar jämfört med den tidigare versionen 3.6 Flash — bland annat når den 43,6 procent rätt på första försöket vid kodgenering (mot tidigare 34,4 procent) och presterar bättre inom webbutveckling, juridik och finans. Priset är halverat jämfört med 3.6 Flash, och modellen är redan tillgänglig via Google Gemini Spark och utvecklarplattformar.

13 aug. deepmind.google

BloggGoogle DeepMind

Putting sign language AI into users’ hands

Google DeepMind har utvecklat SL2T, en AI-modell som översätter teckenspråk till text. Modellen är tränad på över 100 000 timmar data från mer än 50 teckenspråk och fungerar nu i Gboard och Live Transcribe på Pixel 11-telefoner, med start för amerikansk teckenspråk (ASL). Till skillnad från tidigare försök förstår SL2T teckenspråk som helt egna språk med egen grammatik, inte bara engelska på händerna. Systemet spårar kroppens rörelser genom en on-device-modell och skickar bara koordinater till servern för att skydda användarnas integritet.

12 aug. deepmind.google

BloggGoogle DeepMind

Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration

Google DeepMind har lanserat Gemini Robotics ER 2, en uppdaterad AI-modell som fungerar som en hjärna för robotar. Modellen kan se genom videokameror, förstå vad som händer i den fysiska världen, och planera flerastegade uppgifter. Den kan också samarbeta med andra robotar och vet när uppgifter är klara genom att analysera videoströmmar. Enligt Google presterar modellen bättre än tidigare versioner — den når 57,4 procent träffsäkerhet när den följer framsteg mot färdig uppgift, och 91,3 procent när den ska hitta exakta tidpunkter för att byta mellan steg.

30 juli deepmind.google

BloggGoogle DeepMind

Accelerating the frontiers of scientific discovery: Google’s $40M commitment to the Genesis Mission

Google åtar sig att ge amerikanska forskare 40 miljoner dollar i AI-tjänster och molnkrediter för Genesis Mission — en nationell satsning på att fördubbla takten för vetenskaplig upptäckt med hjälp av AI. Bidragen inkluderar tillgång till Googles AI-verktyg som AlphaFold 3 (för att förutsäga proteinstrukturer), AlphaEvolve (en kodningsagent), och Gemini for Government för tiotusentals forskare vid energidepartementets nationella laboratorier. Redan nu använder forskare dessa verktyg för att snabba upp upptäckter — exempelvis har en forskargrupp minskat kalibreringen av ett mikroskop från 90 minuter till 13 minuter.

22 juli deepmind.google