Google rendszerszintű AI-beszédfelismerést hozott a Mac-re
A Google kiterjesztette Gemini-alkalmazását macOS-re egy új rendszerszintű beszédfelismerési funkcióval, amely az Fn-billentyű hosszú lenyomásával aktiválható és bármely alkalmazásban használható.
A Google Gemini Mac-alkalmazása új mesterséges intelligencia-alapú diktálási funkcióval bővült, amely az operációs rendszer szintjén működik. A felhasználók az Fn-billentyű hosszú lenyomásával aktiválhatják a beszédfelismerést, amely a kurzor aktuális pozíciójában szúrja be a szöveget – nem csak a Gemini-alkalmazásban, hanem az e-mailben, üzenetkezelőben, szövegszerkesztőkben és más Mac-programokban is.
A Google megoldása az Apple beépített diktálási funkcióját fejleszti tovább. Míg az Apple-verzió szószerinti átírást nyújt, a Gemini intelligensen feldolgozza a beszédet: eltávolítja a kitöltőszavakat (például az »äh«-t), felismeri a mondaton belüli javításokat, és megfelelően formázza a végeredményt. Így a felhasználók már tisztított, használható szöveget kapnak, amely nem igényel utólagos szerkesztést.
A beállításoknál aktiválható a Gemini-modell által végzett feldolgozás, amely figyelembe veszi a látható képernyőtartalmat és a kijelölt elemeket. A felhasználók például szöveget választhatnak ki és hangutasítással kérhetnek rövidebb, barátságosabb vagy formálisabb verzióját. Helyi dokumentumok, képek és egyéb fájlok is jelölhetők, majd összefoglalhatók vagy új tartalommá alakíthatók.
A funkció világszerte elérhető lesz a Gemini Mac-alkalmazás összes felhasználója számára, azonban jelenleg csak angol nyelvű támogatással. A Google nem közölt időpontot a további nyelvek, köztük a német nyelvű támogatás bevezetésére. Az alkalmazás macOS 15 vagy újabb verziót igényel, és a beszédfelismerés, képernyőtartalom és fájlok feldolgozása céljából a Google szervereihez kerülnek továbbítva.