2026-07-29 · 4 min čtení
OpenAI přidalo do svého API dva nové modely pro rozpoznávání řeči — GPT Transcribe a GPT Live Transcribe. Oproti předchůdci Whisper jsou přesnější, jenže ElevenLabs, Google ani Mistral zatím nepřekonaly.
OpenAI zpřístupnilo dva nové modely pro přepis mluveného slova — GPT Transcribe a GPT Live Transcribe — přímo přes své API. Oba modely navazují na starší Whisper a podle měření chybovosti (tzv. Word Error Rate, zkráceně WER) skutečně dělají méně chyb. Jenže srovnání s konkurencí dopadlo pro OpenAI nepříznivě: ElevenLabs, Google i Mistral mají v testech nižší chybovost.
GPT Transcribe je určen pro standardní přepis nahrávek — například záznamu z meetingu nebo podcastu. GPT Live Transcribe pak míří na přepis v reálném čase, tedy situace, kdy mluvíte a chcete vidět text okamžitě (živé titulky, hlasové poznámky).
Oba modely jsou dostupné prostřednictvím OpenAI API od července 2026. Přesná cena za milion tokenů nebo za minutu přepisu nebyla v době vydání tohoto článku oficiálně zveřejněna pro evropský trh — OpenAI zatím uvedlo ceny pouze v USD, ale konkrétní čísla na stránce s ceníkem ještě nebyla potvrzena.
Klíčový ukazatel kvality u přepisu je Word Error Rate — procento slov, která model přepíše špatně. Čím nižší číslo, tím lépe. GPT Transcribe dosahuje nižší WER než původní Whisper, ale podle testů serveru The Decoder ho překonávají modely od ElevenLabs, Google a Mistral.
GPT Transcribe je dostupný přes OpenAI API. Potřebujete aktivní API klíč (dostanete ho na platform.openai.com po registraci a přidání platební metody). Základní volání vypadá takto:
curl https://api.openai.com/v1/audio/transcriptions \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -F model="gpt-transcribe" \ -F file="@nahravka.mp3"
Pro živý přepis použijete model `gpt-live-transcribe` ve streamovacím režimu přes WebSocket — ten je vhodný spíše pro vývojáře, kteří staví vlastní aplikace.
Pokud nechcete psát kód, zatím neexistuje hotový nástroj v ChatGPT rozhraní, který by tyto modely přímo využíval. Musíte použít API nebo počkat, až někdo postaví nadstavbu.
GPT Transcribe není ideální volbou, pokud potřebujete co nejnižší chybovost za každou cenu — v tom případě jsou na tom lépe ElevenLabs nebo Google Speech-to-Text. Rozdíl se projeví zejména u:
GPT Live Transcribe je určen pro real-time scénáře, ale latence a přesnost se teprve ověřují v produkčním provozu — nasazení do kritické aplikace (například lékařské dokumentace) bez vlastního testování nedoporučujeme.
Rovněž pokud potřebujete přepis češtiny a dalších středoevropských jazyků, je dobré výsledky ověřit — modely trénované primárně na angličtině mívají horší výkon v ostatních jazycích.
Pro běžného uživatele to zatím znamená jednu věc: přímý přístup k těmto modelům vyžaduje technické znalosti (práci s API). Pokud přepisujete nahrávky pro osobní potřebu, pohodlnější alternativou je například Otter AI nebo nástroj Fathom pro schůzky, které mají uživatelské rozhraní bez nutnosti psát kód.
Pro vývojáře a firmy, které už OpenAI API používají, je GPT Transcribe zajímavá možnost — nemusí přidávat dalšího poskytovatele a mohou mít přepis i generování textu pod jednou střechou. Ale pokud je přesnost přepisu klíčová a chybovost hraje roli (třeba u automatického generování titulků pro video), vyplatí se porovnat výsledky i s nabídkou ElevenLabs nebo Google.
Modely jsou dostupné pod názvy `gpt-transcribe` a `gpt-live-transcribe` v OpenAI API endpointu `/v1/audio/transcriptions`. GPT Live Transcribe podporuje streamování přes WebSocket pro nízkou latenci. Oficiální ceny za minutu přepisu zatím nebyly zveřejněny — OpenAI je obvykle uvádí na stránce platform.openai.com/docs/pricing, kde je třeba sledovat aktualizace.
Zdroj informací: The Decoder (https://the-decoder.com/gpt-transcribe-improves-on-its-predecessor-but-cant-catch-elevenlabs-google-or-mistral-on-error-rates/)