Menu
Přihlásit
Domů / Obsah / Gemini / Gemma 4 lokálně: Spusťte si Go...
Gemini 05.04.2026 Tutorial

Gemma 4 lokálně: Spusťte si Google open-source AI na vlastním PC

Gemma 4 je open-source AI od Google (5 velikostí, E2B–31B). Návod, jak ji spustit lokálně přes Ollama a LM Studio – od hardwaru po produkci.

Kompletní návod

Pravděpodobně už jste slyšeli, že Google v dubnu 2026 vydal Gemma 4 – nejnovější generaci svých open-weight modelů, které vznikly ze stejného výzkumu jako Gemini 3. Důležité ale je, že na rozdíl od placeného Gemini si Gemma 4 můžete stáhnout a spustit na vlastním hardwaru. Žádné API poplatky, žádné posílání dat na cizí servery, plná kontrola nad soukromím.

V tomto návodu vám ukážu, jak rozběhat Gemma 4 lokálně krok za krokem. Projdeme si jednotlivé velikosti modelu, hardwarové požadavky a tři nejběžnější způsoby spuštění – od nejjednoduššího až po pokročilé produkční nasazení. Ať už chcete model jen vyzkoušet na notebooku, nebo stavíte interní AI nástroj pro firmu, najdete tu postup, který vám sedí.

Co je Gemma 4 a proč ji spouštět lokálně

Gemma 4 je rodina otevřených modelů od Google DeepMind vydaná 2. dubna 2026 pod pro obchod přátelskou licencí (použitelnou komerčně). Na rozdíl od dřívějších generací je nativně multimodální – zpracovává text, obrázky i audio a odpovídá textem. Modely se dodávají v pěti velikostech, takže si vyberete podle toho, co zvládne váš hardware:

  • E2B (efektivních ~2B parametrů) – běží i na běžném notebooku, ideální pro rychlé úkoly a testování.
  • E4B (~4B) – kompromis mezi rychlostí a kvalitou, pohodlně na moderních integrovaných grafikách.
  • 12B – pravděpodobně nejlepší poměr výkonu a nároků; přidáno jako „12B Unified" v červnu 2026.
  • 26B A4B (Mixture-of-Experts s ~4B aktivními parametry) – vysoká kvalita při rozumní spotřebě díky řídké aktivaci.
  • 31B – vlajková loď pro nejnáročnější reasoning a agentic úlohy.

Proč jít cestou lokálního spuštění místo API? Tři hlavní důvody, které dávají smysl hlavně v firemním prostředí:

  1. Soukromí a compliance – citlivé dokumenty, smlouvy nebo data klientů nikdy neopustí vaši infrastrukturu. To je klíčové pro GDPR a interní bezpečnostní politiky.
  2. Předvídatelné náklady – žádné tokenové poplatky. Jednorázová investice do GPU se vrátí u jakéhokoliv většího objemu dotazů.
  3. Nulová latence sítě a offline provoz – model reaguje okamžitě a funguje i bez připojení k internetu.

Hardwarové požadavky podle velikosti

Než začneme, pojďme si ujasnit, co budete potřebovat. Diazovat lze modely do formátů GGUF (4-bit, 8-bit), což dramaticky snižuje paměťové nároky. orientační potřeba RAM/VRAM pro plynulý běj:

Velikost Kvantizace 4-bit Doporučeno pro
E2B ~2 GB notebook, CPU, rychlé demo
E4B ~3 GB běžný laptop, lehké produkční úlohy
12B ~7–8 GB GPU 8 GB VRAM (RTX 3060/4060 a vyšší)
26B A4B ~14 GB GPU 16 GB VRAM (RTX 4080, A10)
31B ~18 GB GPU 24 GB VRAM (RTX 3090/4090, A5000)

Praktický tip: pokud máte Mac s Apple Silicon (M1–M4), využijete unifikovanou paměť, takže model sdílí RAM s GPU. 32GB Mac tak zvládne i 26B A4B variantu, což u klasických PC vyžaduje drahou grafiku.

Metoda 1: Ollama (nejjednodušší, doporučeno)

Ollama je nejrychlejší cesta k lokálnímu modelu. Nainstalujete jedním příkazem a zbytek řeší za vás – stahování, kvantizaci i inference engine.

# Instalace na Linux/macOS
curl -fsSL https://ollama.com/install.sh | sh

# Stažení a spuštění Gemma 4 (12B je nejlepší výchozí volba)
ollama run gemma4:12b

Tím se stáhne kvantizovaný model a otevře interaktivní chat. Pro menší stroj zvolte gemma4:e2b nebo gemma4:e4b. Ollama nabízí i automatické REST API na http://localhost:11434, které je kompatibilní s OpenAI formátem – takže model snadno napojíte na vlastní aplikaci, Cursor, Continue.dev nebo jiný klient.

# Volání přes API (OpenAI-kompatibilní)
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"gemma4:12b","messages":[{"role":"user","content":"Shrň mi třístránkovou smlouvu."}]}'

Metoda 2: LM Studio (grafické rozhraní)

Pokud nechcete pracovat v terminálu, LM Studio nabízí přehledné GUI pro Windows, macOS i Linux. Postup:

  1. Stáhněte LM Studio z lmstudio.ai a nainstalujte.
  2. Vyhledejte „gemma 4" a vyberte kvantizaci odpovídající vaší paměti (hlídejte indikátor „Will it fit").
  3. Načtěte model v záložce Chat a začněte konverzovat.
  4. Pro napojení na aplikaci zapněte lokální server (Local Server) – opět dostanete OpenAI-kompatibilní endpoint.

LM Studio se hodí zejména tehdy, když si chcete rychle porovnat několik modelů vedle sebe nebo potřebujete odeslat obrázek k analýze (multimodální vstupy jsou v GUI nejpohodlnější).

Metoda 3: llama.cpp a vLLM (pokročilé / produkční)

Pro vlastní inference pipeline nebo vyšší propustnost sáhněte po llama.cpp (maximální kontrola, běží téměř kdekoli) případně vLLM (vysoká propustnost na serverových GPU).

# llama.cpp – sestavení s CUDA podporou
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make GGML_CUDA=1

# Stažení GGUF z Hugging Face (např. gemma-4-12b-it-Q4_K_M.gguf)
# Spuštění serveru s OpenAI-kompatibilním API
./llama-server -m gemma-4-12b-it-Q4_K_M.gguf -c 8192 --port 8080

Pro produkční nasazení souběžných požadavků je vLLM lepší volba – podporuje batching a funguje jako drop-in náhrada OpenAI API:

pip install vllm
vllm serve google/gemma-4-12b-it --tensor-parallel-size 1

Multimodální schopnosti v praxi

Jedna z největších změn oproti předchozím generacím Gemma je nativní podpora obrázků a audia. To otevírá pracovní scénáře, které dříve vyžadovaly specializované modely:

  • Analýza dokumentů – nahrajete scan faktury, screenshot dashboardu nebo PDF tabulku a necháte model vytáhnout strukturovaná data.
  • Zpracování hlasových poznámek – přepis a shrnutí schůzky z audio nahrávky bez nahrávání dat do cloudu.
  • Popis obrázků pro přístupnost – automatické alt texty pro e-shop nebo web.

Příklad volání s obrázkem přes Ollama API:

curl http://localhost:11434/api/chat -d '{
  "model": "gemma4:12b",
  "messages": [{"role":"user","content":"Co vidíš na tomto grafu?","images":["<base64_obrazku>"]}]
}'

Rychlost a optimalizace

Aby lokalní inference byla skutečně použitelná, dejte si pozor na několik věcí:

  • Zvolte správnou kvantizaci – Q4_K_M je obvykle nejlepší kompromis mezi kvalitou a pamětí. Q8 je přesnější, ale zhruba dvakrát náročnější.
  • Context window – Gemma 4 podporuje dlouhý kontext, ale každý token stojí paměť. Pro chat nastavte rozumný limit (např. 8192), pro analýzu dlouhých dokumentů více.
  • Offloading na GPU – v Ollama i llama.cpp se vrstvy automaticky umístí na GPU, pokud tam je místo. Na CPU model poběží, ale výrazně pomaleji.
  • Caching napříč dotazy – vLLM a pokročilejší servery kešují prefix, takže systémový prompt u opakovaných dotazů nezabere čas znovu.

Porovnání s alternativami

Gemma 4 samozřejmě není jediný open-weight model na trhu. Jak si stojí vedle konkurence, kterou si také můžete stáhnout a spustit doma?

  • Llama (Meta) – skvělý ekosystém a podpora komunity, silné zejména v anglickém textu a kódu. Gemma 4 často vede v multimodálních úlohách a v češtině díky lepímu vícejazyčnému tréninku.
  • Mistral – velmi efektivní evropské modely s komerčně jasnou licencí. Výborná volba, pokud vám jde čistě o text a rychlost. Pro obrázky a audio ale potřebujete něco jiného.
  • Qwen (Alibaba) – extrémně silné v kódu a matematice, velmi agresivně se vyvíjí. Licence u některých verzí je ale restriktivnější než u Gemma 4.

Praktický verdikt: pokud potřebujete jeden model na všechno (text, obrázek, audio) se slabou licenčními podmínkami a solidní češtinou, Gemma 4 je dnes jednou z nejlepších voleb. Pro čistý kód zvažte Qwen, pro maximální komunitní podporu Llama.

Řešení běžných problémů

Během nasazování narazíte pravděpodobně na několik typických překážek. Tady je rychlý řešitel:

  • Model běží pomalu (CPU-only) – ověřte, že inference engine GPU skutečně využívá. V Ollama spusťte ollama ps a hlídejte sloupec PROCESSOR. Pokud svítí „100% CPU", model se nevešel do VRAM a llama.cpp nespadne jen díky offloadingu – zvolte menší velikost nebo kvantizaci.
  • Out of memory / segfault při načítání – model je příliš velký pro vaši paměť. Sjeďte o velikost dolů (31B → 26B A4B → 12B) nebo použijte agresivnější kvantizaci (Q4_K_S).
  • Čeština vypadá rozbitě nebo je odpověď anglicky – přidejte do systémového promptu jasnou instrukci: „Odpovídej vždy v češtině." Gemma 4 češtinu zvládá dobře, ale občas potřebuje explicitní nasměrování.
  • Context se při delších dokumentech zasekává – snižte context window nebo dokument rozdělte. Na analýzu vícestanových PDF používejte chunking přes framework jako LangChain nebo LlamaIndex.

Konkrétní pracovní scénáře

Ať už pracujete ve firmě nebo jako freelancer, lokální Gemma 4 pokryje překvapivě mnoho každodenních úkolů. Tady jsou reálné příklady, které stojí za to automatizovat:

  • Asistent pro analýzu smluv – nahrajete PDF smlouvy a model vypíše rizikové klauzule, termíny a finanční závazky. Citlivá data klientů přitom nikdy neopustí váš stroj.
  • Tvorba obsahu pro e-shop – popisky produktů z parametrů, alt texty k obrázkům, lokalizace do slovenštiny nebo němčiny přímo z jedné instalace.
  • Interní znalostní báze (RAG) – pomocí vector databáze (Chroma, Qdrant) napojené na lokální Gemma 4 postavíte chatbota nad firemními dokumenty, na který se mohou ptát zaměstnanci.
  • Přepis a shrnutí schůzek – audio nahrávka z porad se převede na strukturované shrnutí s úkoly a rozhodnutími, a vše zůstane v rámci firmy.

Kdy se lokální Gemma 4 vyplatí

Lokální nasazení dává smysl především pokud: pracujete s citlivými daty, máte stabilní objem dotazů (třeba interní AI asistent pro tým), potřebujete garantovat dostupnost bez závislosti na externím API, nebo chcete provozní náklady udžet pod kontrolou. Naopak pro občasné použití nebo extrémně náročné úlohy nad 31B může být kombinace s cloudovým API ekonomičtější.

Shrnutí

Gemma 4 posouvá hranici toho, co je reálně spustitelné na vlastním hardwaru. Pět velikostí od E2B do 31B pokryje spektrum od notebooku po serverovou GPU a díky multimodálním schopnostem nahradí i specializované modely pro obrázky a audio. Pro většinu z vás bude nejrychlejší cestou Ollama s 12B variantou – instalace trvá minutu a hned máte OpenAI-kompatibilní endpoint, který napojíte kamkoliv. Kdo potřebuje plnou kontrolu nebo vyšší propustnost, sáhne po llama.cpp respektive vLLM.

Klíčové rozhodnutí je čistě ekonomické a bezpečnostní: jakmile váš měsíční API účet za komerční model převýší cenu GPU, lokální provoz se začne vyplácet – a k tomu připočtěte soukromí, které v cloudu prostě nekoupíte. Vyzkoušejte nejdřív 12B variantu, změřte si reálnou rychlost na vašem hardwaru a teprve pak rozhodněte, zda investovat do větší grafiky.

Začínáte s AI?

Navštivte zacinamsai.cz — průvodce světem AI pro úplné začátečníky.

Přejít na Začínáme s AI →

// Další články, které by tě mohly zajímat

Potřebujete pomoct s AI automatizací?

Domluvte si nezávaznou konzultaci →