Google bemutatta a Gemini 3.8 szöveg-beszéd modelleket
A Google két új szöveg-beszéd AI-modellt vezetett be, amelyek lehetővé teszik egyedi hangok létrehozását és irányítását. A Gemini 3.8 Flash TTS és Flash-Lite TTS a benchmark-teszteken vezető helyezéseket értek el.
A Google bejelentette a Gemini 3.8 Flash TTS és Gemini 3.8 Flash-Lite TTS modelleket, amelyek a szöveg-beszéd generálást statikus előbeállításokból dinamikus kreatív stúdióvá alakítják. Az eszközök lehetővé teszik, hogy alkotók, fejlesztők és vállalatok kifejezőbb és természetesebb hangzású audiót hozzanak létre. A modellek a Google AI Studio, a Gemini API, a Gemini Enterprise, a Gemini Notebook és a Google Vids platformokon érhetők el.
A Gemini 3.8 Flash TTS modell 30 eredeti hang alapján végtelen hangkönyvtárat hoz létre, lehetővé téve egyedi karakterhangok vagy márkamegjelenítő hangok fejlesztését. A felhasználók pontos kontrollt kapnak az egyes sorok előadásmódjára, valamint természetes nyelvű utasításokból egyedi hangpersonákat hozhatnak létre. A modell támogatja a 100 feletti nyelveket, beleértve a japánt, a brazíliai portugált, a vietnamit, a modern standard arabat, a mexikói spanyolt és a hindut.
A Hume AI Voice Design Benchmark teszten a Gemini 3.8 Flash TTS az első helyet szerezte meg (71,4 pont), az Overall Quality Index-en pedig az első és második helyet foglalták el a Flash és Flash-Lite verziók. A Voice Arena vakumszemélyzeti értékelésein a modellek vezető pozíciókat értek el a főbb világnyelveken. A Google biztonsági intézkedéseket épített be: a hangreplikációhoz szükséges a hangmajor szóbeli hozzájárulása, és az összes generált audiót a SynthID vízjellel látják el az AI-generált beszéd azonosíthatósága érdekében.
Forrás: blog.google — „Gemini 3.8 text-to-speech says hello - blog.google”
Ez az összefoglaló a fenti forrás alapján, mesterséges intelligenciával készült. Szerkesztőségi ellenőrzésen nem esett át; a részletekért olvasd el az eredeti cikket.