NoézisAI-hírek magyarul
Modellek · The Decoder

Google új AI-hangmodelleket mutat be

A Google bejelentette a Gemini 3.8 Flash TTS és Flash-Lite TTS modelleket, amelyek szöveges leírás alapján képesek új hangokat generálni. Az eszközök több mint 100 nyelven működnek és különféle kreatív és gazdaságos felhasználási területekre optimalizáltak.

szept. 24.

A Google két új szöveg-beszéd modellt vezetett be, amelyek eltérő felhasználási célokra készültek. A Gemini 3.8 Flash TTS kreatív alkalmazásokhoz, például játékkarakterekhez, hangoskönyvekhez és podcastokhoz tervezték, míg a Flash-Lite TTS a költséghatékony nagyszabású hangszintézisre összpontosít, például szinkronizáció, audioanyagok és hangügynökök számára. A Flash TTS modell lehetővé teszi a felhasználók számára, hogy szöveges utasítások segítségével teljesen új hangokat hozzanak létre, megadva a szerepet, akcentust és hangjellemzőket. A Google emellett több mint 2000 előre elkészített hangot kínál, beleértve regionális variánsokat, valamint egy hangreplikációs funkciót, amely 30 másodperces audiómintából hozhat létre hangprofilt.

A Google biztonsági intézkedéseket is bevezetett: a hangreplikációhoz szóbeli hozzájárulás szükséges, és minden generált audioclip egy hallhatatlan SynthID vízjelet kap az AI-generált beszéd azonosítása érdekében. Mindkét modell részletes vezérlést biztosít a hangkimeneten, lehetővé téve a felhasználók számára, hogy soronként egyéni rendezői utasításokat írjanak, vagy automatikus szkriptértelmezést használjanak. A modellek támogatják az órákig tartó hosszú formátumú generálást minimális hangkarakterisztika-eltolódással, valamint kéthangu dialógmódot egyetlen szkriptből.

A modellek a Gemini API és Google AI Studio segítségével érhetők el, a Flash TTS a Gemini Notebookban, a Flash-Lite TTS pedig a Google Vids-ben. A díjszabás az Egyesült Államok dollárjában kerül meghatározásra, millió szöveg-token vagy audio-token alapján. 2026 végéig egy óra audioanyag 0,81 dollárba kerül a Flash TTS-nél és 0,54 dollárba a Flash-Lite TTS-nél, 2027. január 1-től pedig 1,62, illetve 1,08 dollárra emelkedik.

Forrás: The Decoder — „Gemini 3.8 Flash TTS: Google will mit KI-Stimmen Hörbücher, Spiele und Podcasts verändern - The Decoder”

Ez az összefoglaló a fenti forrás alapján, mesterséges intelligenciával készült. Szerkesztőségi ellenőrzésen nem esett át; a részletekért olvasd el az eredeti cikket.

Még a modellek rovatból

Továbbiak →