NYTT
OpenAI släpper ny textning för ljud och samtal
GPT Transcribe gör inspelat tal till text, medan GPT Live Transcribe skriver ut talet löpande. Båda modellerna är släppta via OpenAI API, men de är inte nya knappar för vanliga ChatGPT-användare.
Publicerad 29 juli 2026, 08.09

OpenAI, företaget bakom ChatGPT, har släppt två modeller som gör tal till text. GPT Transcribe arbetar med färdiga ljudfiler och avslutade delar av ett Realtime-samtal. GPT Live Transcribe skriver i stället ut text löpande medan ljudet kommer in.
Skillnaden märks i användningen. En redaktion kan skicka in en färdig intervju till GPT Transcribe och få ett första textutkast. En mötes- eller kundtjänstapp kan använda GPT Live Transcribe för att visa text medan deltagarna fortfarande talar.
Båda modellerna kan få fri bakgrundsinformation, viktiga nyckelord och flera förväntade språk. Det kan hjälpa systemet när ljudet innehåller namn, fackord eller språkbyten. OpenAI publicerar däremot inget oberoende svenskt kvalitetstest i lanseringsunderlaget.
GPT Transcribe kostar 0,0045 dollar per ljudminut. GPT Live Transcribe kostar 0,017 dollar per minut. Priserna gäller användning via OpenAI API, alltså den tekniska anslutning som utvecklare och företag använder för att bygga in modeller i egna tjänster.
Det här är inte en ny knapp i ChatGPT för alla användare. En verksamhet behöver bygga eller använda en tjänst som är kopplad till OpenAI API. Den behöver också bestämma hur ljudet skickas, lagras och tas bort.
En transkribering är ett arbetsunderlag, inte ett säkert protokoll. Namn, siffror, citat och ord som hörs dåligt kan bli fel. Ljud från möten, intervjuer eller vård kan dessutom innehålla personuppgifter och annan känslig information.
AI Kollen har inte kunnat köra ett eget test eftersom projektets publiceringsmiljö saknar API-åtkomst till de nya modellerna. Artikeln beskriver därför det bekräftade släppet, funktionerna och priserna i OpenAI:s dokumentation, inte ett eget resultat för svenska.
Varför det spelar roll
Tal-till-text kan minska tiden som går åt till ett första utkast av en intervju, föreläsning eller ett möte. Löpande textning kan också göra ett samtal lättare att följa. Nyttan beror på hur väl modellen klarar det verkliga ljudet och på att någon kontrollerar texten innan den används som citat, protokoll eller beslutsunderlag.
Gör så här
- Välj färdig transkribering när hela ljudfilen kan behandlas efteråt. Välj löpande transkribering när texten behöver visas under samtalet.
- Testa med egna svenska namn, fackord, dialekter och bakgrundsljud innan tjänsten används skarpt.
- Bestäm vem som får spela in, hur deltagarna informeras och när ljud och text ska raderas.
- Kontrollera namn, siffror och citat mot originalinspelningen innan texten publiceras eller styr ett beslut.