Google kiadta a Gemini 3.5 Transcribe-ot: intelligens beszédfelismerés szövegoptimalizálással
A Google új mesterséges intelligencia modellje, a Gemini 3.5 Transcribe forradalmi fejlesztéseket hoz a beszédfelismerésbe: automatikusan eltávolítja a töltelékszavakat, korrigálja a versprecher és formázza a szöveget valós időben.
A Google kiadta a Gemini 3.5 Transcribe-ot, amely a beszédfelismerés terén jelentős előrelépést jelent. Az új modell nem csupán szöveggé alakítja az audio fájlokat, hanem intelligens feldolgozást végez: automatikusan szűri az »äh« vagy »ähm« típusú töltelékszavakat, korrigálja a beszédhibákat és önálló szövegformázást végez.
A modell rendkívül pontos eredményeket nyújt még zajos környezetben és összetett szakterminológia esetén is. Valós idejű streameléskor 4,0 százalékos szóhibaarány, rögzített audioanyagoknál pedig 2,6 százalékos szóhibaarány érhető el. Az új Gemini 3.5 Transcribe több mint 85 nyelvet támogat regionális akcentusokkal együtt, és képes három különböző beszélő megkülönböztetésére pontos időbélyegzéssel.
A modell nem pusztán szövegírásra képes, hanem megérti a felhasználó szándékát és képes feladatokat delegálni más Gemini-modelleknek, például fájlelemzéseket vagy képgenerálásokat. Az új AI-modell mostantól elérhető fejlesztők számára a Google AI Studio és a Gemini Enterprise Agent Platform segítségével két verzióban: a Live API valós idejű alkalmazásokhoz (egy másodperc alatti késleltetéssel) és az Interactions API már rögzített audiofájlokhoz.
Forrás: GoogleWatchBlog — „Gemini: Google revolutioniert Spracheingabe - neues KI-Modell optimiert diktierte Texte vollständig (Video) - GoogleWatchBlog”
Ez az összefoglaló a fenti forrás alapján, mesterséges intelligenciával készült. Szerkesztőségi ellenőrzésen nem esett át; a részletekért olvasd el az eredeti cikket.