Jak propojit Gemini s aplikacemi a řídit práci v chatu
Návod krok za krokem, jak propojit Gemini s aplikacemi jako Airtable, Linear nebo Adobe přes Connected Apps a @ zmínky a řídit práci přímo v chatu.
Představ si, že jednou větou popíšeš hlas — „klidný mužský hlas s jemným přízvukem, který mluví pomalu jako dokumentární režisér" — a za pár sekund si ho poslechneš. Vlastní AI hlas už není futurismus z keynote, ale funkce, kterou si můžeš hned teď vyzkoušet v Google AI Studiu. Nebo nahráš třicet sekund svého hlasu a model z toho vytvoří digitální kopii, která přečte cokoli.
Google 23. září 2026 vydal dva nové modely pro syntézu řeči, Gemini 3.8 Flash TTS a Gemini 3.8 Flash-Lite TTS, a posouvá je na špičku žebříčků expresivity. Vytvořit si vlastní hlas přitom nebylo nikdy jednodušší: nepotřebuješ drahý nástroj na klonování ani zvukaře se studiem, stačí ti Google účet a představa, jak má tvůj hlas znít.
V tomto návodu ti ukážu, jak vytvořit vlastní AI hlas v Google AI Studiu krok za krokem, jak si nechat zreplikovat svůj hlas z třicetisekundového vzorku a kde takový hlas v praxi nejvíc vydělá.

Text-to-speech znáš nejspíš jako robotický hlas z navigace nebo z automatizované linky. Google tvrdí, že jeho nové modely jsou nejvýraznější audio modely, jaké kdy vyrobil, a čísla mu dávají za pravdu: na benchmarku Hume AI Voice Design Benchmark vede Gemini 3.8 Flash TTS s 71,4 body, v modelování přízvuků vede rovněž (60,8 bodů) a v indexu celkové kvality obsadil první dvě místa (oficiální oznámení, 23. 9. 2026).
Klíčový posun je v tom, jak se hlas tvoří. Dosud jsi vybíral z katalogu předpřipravených hlasů a doufal, že některý nebude znít jako stroj. Gemini 3.8 TTS přináší generativní voice design — hlas nenajdeš, ale popíšeš ho přirozeným jazykem. Řekneš modelu roli, přízvuk a charakteristiku a on hlas vygeneruje na míru.
K tomu dostaneš:
Modely jsou dostupné ve Google AI Studiu a přes Gemini API pro vývojáře; v Gemini Notebook je najdeš také a nový Google Vids pro voiceovery používá Flash-Lite TTS. Nemusíš nic instalovat ani zadávat platební kartu, aby sis výsledek poslechl.
Otevři audio playground v AI Studiu. Přihlas se běžným Google účtem na ai.studio.google.com a vyber generování audia s modelem Gemini 3.8 Flash TTS. Pokud už Gemini v práci používáš třeba přes propojení s aplikacemi, budeš se cítit jako doma — jde o stejný ekosystém, jen s audio výstupem.
Popiš hlas, který chceš. Napiš přirozeným jazykem roli, přízvuk a charakteristiku. Například: „rádiový moderátor ve věku čtyřiceti let, teplý hlas, energické tempo, občas se zasměje, mluví česky bez regionálního přízvuku". Čím konkrétnější popis, tím méně iterací budeš potřebovat.
Zrežíruj text po řádcích. Nejsilnější funkcí modelu je režie po jednotlivých větách. U každého řádku můžeš zadat herecký pokyn — zrychlit, zpomalit, změnit emotivní náboj nebo přízvuk uprostřed scény. Do textu zapisuješ i neverbální značky jako <laughs>, <sigh> či <gasp> a zpětné signály typu „|mhm|" nebo „|yeah|", jimiž druhý mluvčí potvrzuje, že poslouchá.
Postav scénu se dvěma hlasy. Editor v AI Studiu umí nativně dvoumluvné scénování, takže vytvoříš dialog bez slepování dvou samostatných generování. Pro vysvětlující videa nebo podcastové ukázky je to zásadní úspora času.
Ulož si hlas jako šablonu. Hlas, se kterým jsi spokojený, si uložíš a používáš dál — přestaneš tak pokaždé znovu ladit tentýž popis. Uložené hlasy se chovají jako tvoje osobní zvuková identita napříč projekty.
Druhá cesta, jak vytvořit vlastní AI hlas, je replikace toho, který už máš. Google spustil replikaci hlasu ze vzorku kolem 30 sekund — nahraješ krátký čistý zvukový záznam a model z něj postaví hlas, který přečte libovolný text.
Zásadní je, jak to Google pojal bezpečnostně:
Pokud řešíš klonování hlasu pro firmu, je tohle rozdíl mezi regulérním nástrojem a grey-zone aplikacemi, které ti hlas naklonují bez jediné pojistky. A chystá se další funkce — voice remixing, tedy míchání vlastních hlasů do nových variant.
Google vydal dva modely vedle sebe a vybírat bys měl podle úlohy, ne podle čísla v názvu:
| Model | Na co ho použít |
|---|---|
| Gemini 3.8 Flash TTS | Kreativní režie, charakterová tvorba hlasu, dlouhé narativní formy — cokoli, kde záleží na výrazu |
| Gemini 3.8 Flash-Lite TTS | Dabing, hromadná audio produkce, hlasoví agenti a boti — všude tam, kde hraje roli cena a objem |
Flash TTS je model na nápady: vyzkoušíš na něm hlas, který se má chovat jako postava. Flash-Lite je model na provoz: když potřebuješ nadabovat stovky videí měsíčně nebo obsluhovat hlasového agenta nonstop, jeho nižší cena dává smysl. Detailní parametry a ukázky najdeš v dokumentaci Gemini API pro speech generation (aktualizováno v září 2026).
Technologie je hezká, ale zajímá tě, kde ti reálně ušetří čas a vydělá peníze. Tady jsou čtyři workflow, které dnes dávají nejvíc smysl:
Voiceovery k videím. Nejrychlejší návratnost má tvorba obsahu, kde jsi dosud používal svůj hlas nebo platil moderátora. Pokud točíš pro YouTube, kombinace vlastního AI hlasu a AI nástrojů ve YouTube Studiu zkrátí postprodukcii videa o hodiny. Podobně to funguje v produkčním workflow pro tvůrce obsahu, kde je voiceover jedním z nejvíc zdržujících úkonů.
Dabing a lokalizace. Flash-Lite TTS je stavěný na vysoké objemy, takže dabování školicích videí do více jazyků přestává být projekt na týdny. Google už oznámil integrace s Figmou, HeyGen, Linguana, Wondercraftem, Ollangem a dalšími platformami, které dabing a překlad obsahu řeší komplexně.
Audio verze článků a podcasty. Model zvládá dlouhé formy s minimálním rozpadem hlasu, takže z blogpostu uděláš epizodu bez nahrávacího studia. Pokud sdílíš obsah e-mailem nebo na firemním intranetu, audio verze dosahuje měřitelně vyšší míry dokončení než text u publika, které poslouchá na cestách.
Hlasoví agenti a automatizace. Vývojáři dostali modely přímo v Gemini API a Google na ně navázal partnerstvím s Agorou, LiveKit, Pipecatem a Vercelem — tedy přímo s platformami pro realtime komunikaci. Pokud stavíš hlasového asistenta do zákaznické podpory, je to poprvé, kdy máš špičkový hlas k dispozici jako základní stavební kámen. Jak se Gemini obecně zavádí do firemních procesů, jsme rozebrali v návodě na integraci Gemini ve Workspace.
Abych to nezabalil jen jako reklamu: pár věcí ber v potazu, než vlastní AI hlas nasadíš do produkce.
Souhlas je tvrdá podmínka. Replikace hlasu vyžaduje ověřený souhlas vlastníka — to je správně, ale znamená to i to, že proces není okamžitý. Počítej s časem na verifikaci, pokud plánuješ klonovat hlas kolegy nebo externího moderátora.
Vodoznaky jsou součástí výstupu. SynthID a C2PA metadata nejdou „vypnout" — a u transparentnosti vůči publiku ber jako výhodu, ne omezení. V Česku se navíc diskuse o označování AI obsahu vyostřuje a prokazatelný původ zvuku se ti jednou může hodit jako důkaz poctivosti.
Kvalita závisí na režii. Model je expresivní, ale sám od sebe dobrý herecký výkon neudělá. Bez pokynů po řádcích dostaneš průměrný výsledek — rozdíl mezi „poslechnutelné" a „zní to jako člověk" dělá právě krok 3 výše.
Gemini 3.8 TTS posouvá tvorbu vlastního AI hlasu z domény specializovaných studií do prohlížeče. Popíšeš hlas textem, zrežíruješ ho po větách, případně naklonuješ ten svůj z třicetisekundového vzorku — a výsledek použiješ na voiceovery, dabing, podcasty i hlasové agenty.
Nejjednodušší start: otevři si dnes večer AI Studio, popiš hlas, který bys chtěl mít k dispozici, a nech ho přečíst první odstavec svého posledního článku. Až uslyšíš výsledek, bude jasné, které z těch čtyř workflow si jako první projde tvou produkční linkou.
Modely si můžeš ve Google AI Studiu vyzkoušet s běžným Google účtem bez platební karty. Pro komerční nasazení přes Gemini API platíš podle spotřeby — tam se pak vyplatí zvážit Flash-Lite TTS, který je optimalizovaný na cenu při vysokých objemech.
Ano. Modely podporují přes 100 jazyků a dialektů a čeština je mezi nimi. Hlas popisuješ přirozeným jazykem a český text model přečte se správnou výslovností, včetně zohlednění české diakritiky.
Flash TTS je určený na kreativní režii a charakterovou tvorbu hlasu, Flash-Lite TTS na vysoké objemy za nižší cenu — dabing, audio obsah a hlasové agenty. Pro návrh vlastního hlasu začni s Flashem, pro provoz nasazení přepni na Flash-Lite.
Naklonovat můžeš vlastní hlas nebo hlas, k jehož replikaci máš ověřený souhlas — Google u replikace souhlas explicitně kontroluje a výstup opatřuje vodoznakem SynthID. Klonování cizího hlasu bez souhlasu je v rozporu s podmínkami služby i českým právem, zejména právem na ochranu osobnosti.
Gemini přináší knihovnu přes 2 000 produkčně připravených hlasů napříč jazyky a dialekty, ze kterých můžeš vycházet. Vlastní hlas pomocí generativního voice designu si pak vytvoříš, až když budeš potřebovat něco, co v katalogu chybí — třeba konkrétní tón pro tvou značku.
Zdroje: Google — Gemini 3.8 text-to-speech says hello (23. 9. 2026), Dokumentace Gemini API — speech generation (září 2026).
Návod krok za krokem, jak propojit Gemini s aplikacemi jako Airtable, Linear nebo Adobe přes Connected Apps a @ zmínky a řídit práci přímo v chatu.
Praktický návod na Gemini 3.6 Flash – kde ho nasadit místo 3.5 Flash, co znamená nový Gemini 3.8 Flash a jak přepočítat rozpočet na agenty.
Gemini v Google Workspace umí nově číst data z Asany, Salesforcu i HubSpotu přímo v Docs a Sheets. Návod, jak integrace zapnout a použít v praxi.
Gemini 3.1 Pro od Googlu, nebo Grok 4.3 s novým Grok Botem od xAI? Aktuální srovnání cen, kontextových oken, výkonu, integrace do Workspace i X a doporučení pro vaši práci.
Google Pics návod: generuj a upravuj obrázky AI přímo v Docs a Slides. Krok za krokem od promptu po hotový firemní vizuál.
Google přinesl do Chatu asistenta, který vidí tvé maily, soubory i kalendář. Návod, jak ho použít pro ranní briefing, hledání souborů, plánování schůzek nebo úkoly v Jira a Asaně.
Navštivte zacinamsai.cz — průvodce světem AI pro úplné začátečníky.
Přejít na Začínáme s AI →Potřebujete pomoct s AI automatizací?
Domluvte si nezávaznou konzultaci →Týdenní AI tipy přímo do mailu
Žádný spam. Odhlášení jedním klikem.