Gemini vs Grok: Souboj AI vyzyvatelů v 2026
Gemini 3.1 Pro od Googlu, nebo Grok 4.3 s novým Grok Botem od xAI? Aktuální srovnání cen, kontextových oken, výkonu, integrace do Workspace i X a doporučení pro vaši práci.
Pravděpodobně už jste slyšeli, že Google v dubnu 2026 vydal Gemma 4 – nejnovější generaci svých open-weight modelů, které vznikly ze stejného výzkumu jako Gemini 3. Důležité ale je, že na rozdíl od placeného Gemini si Gemma 4 můžete stáhnout a spustit na vlastním hardwaru. Žádné API poplatky, žádné posílání dat na cizí servery, plná kontrola nad soukromím.
V tomto návodu vám ukážu, jak rozběhat Gemma 4 lokálně krok za krokem. Projdeme si jednotlivé velikosti modelu, hardwarové požadavky a tři nejběžnější způsoby spuštění – od nejjednoduššího až po pokročilé produkční nasazení. Ať už chcete model jen vyzkoušet na notebooku, nebo stavíte interní AI nástroj pro firmu, najdete tu postup, který vám sedí.
Gemma 4 je rodina otevřených modelů od Google DeepMind vydaná 2. dubna 2026 pod pro obchod přátelskou licencí (použitelnou komerčně). Na rozdíl od dřívějších generací je nativně multimodální – zpracovává text, obrázky i audio a odpovídá textem. Modely se dodávají v pěti velikostech, takže si vyberete podle toho, co zvládne váš hardware:
Proč jít cestou lokálního spuštění místo API? Tři hlavní důvody, které dávají smysl hlavně v firemním prostředí:
Než začneme, pojďme si ujasnit, co budete potřebovat. Diazovat lze modely do formátů GGUF (4-bit, 8-bit), což dramaticky snižuje paměťové nároky. orientační potřeba RAM/VRAM pro plynulý běj:
| Velikost | Kvantizace 4-bit | Doporučeno pro |
|---|---|---|
| E2B | ~2 GB | notebook, CPU, rychlé demo |
| E4B | ~3 GB | běžný laptop, lehké produkční úlohy |
| 12B | ~7–8 GB | GPU 8 GB VRAM (RTX 3060/4060 a vyšší) |
| 26B A4B | ~14 GB | GPU 16 GB VRAM (RTX 4080, A10) |
| 31B | ~18 GB | GPU 24 GB VRAM (RTX 3090/4090, A5000) |
Praktický tip: pokud máte Mac s Apple Silicon (M1–M4), využijete unifikovanou paměť, takže model sdílí RAM s GPU. 32GB Mac tak zvládne i 26B A4B variantu, což u klasických PC vyžaduje drahou grafiku.
Ollama je nejrychlejší cesta k lokálnímu modelu. Nainstalujete jedním příkazem a zbytek řeší za vás – stahování, kvantizaci i inference engine.
# Instalace na Linux/macOS
curl -fsSL https://ollama.com/install.sh | sh
# Stažení a spuštění Gemma 4 (12B je nejlepší výchozí volba)
ollama run gemma4:12b
Tím se stáhne kvantizovaný model a otevře interaktivní chat. Pro menší stroj zvolte gemma4:e2b nebo gemma4:e4b. Ollama nabízí i automatické REST API na http://localhost:11434, které je kompatibilní s OpenAI formátem – takže model snadno napojíte na vlastní aplikaci, Cursor, Continue.dev nebo jiný klient.
# Volání přes API (OpenAI-kompatibilní)
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"gemma4:12b","messages":[{"role":"user","content":"Shrň mi třístránkovou smlouvu."}]}'
Pokud nechcete pracovat v terminálu, LM Studio nabízí přehledné GUI pro Windows, macOS i Linux. Postup:
LM Studio se hodí zejména tehdy, když si chcete rychle porovnat několik modelů vedle sebe nebo potřebujete odeslat obrázek k analýze (multimodální vstupy jsou v GUI nejpohodlnější).
Pro vlastní inference pipeline nebo vyšší propustnost sáhněte po llama.cpp (maximální kontrola, běží téměř kdekoli) případně vLLM (vysoká propustnost na serverových GPU).
# llama.cpp – sestavení s CUDA podporou
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make GGML_CUDA=1
# Stažení GGUF z Hugging Face (např. gemma-4-12b-it-Q4_K_M.gguf)
# Spuštění serveru s OpenAI-kompatibilním API
./llama-server -m gemma-4-12b-it-Q4_K_M.gguf -c 8192 --port 8080
Pro produkční nasazení souběžných požadavků je vLLM lepší volba – podporuje batching a funguje jako drop-in náhrada OpenAI API:
pip install vllm
vllm serve google/gemma-4-12b-it --tensor-parallel-size 1
Jedna z největších změn oproti předchozím generacím Gemma je nativní podpora obrázků a audia. To otevírá pracovní scénáře, které dříve vyžadovaly specializované modely:
Příklad volání s obrázkem přes Ollama API:
curl http://localhost:11434/api/chat -d '{
"model": "gemma4:12b",
"messages": [{"role":"user","content":"Co vidíš na tomto grafu?","images":["<base64_obrazku>"]}]
}'
Aby lokalní inference byla skutečně použitelná, dejte si pozor na několik věcí:
Gemma 4 samozřejmě není jediný open-weight model na trhu. Jak si stojí vedle konkurence, kterou si také můžete stáhnout a spustit doma?
Praktický verdikt: pokud potřebujete jeden model na všechno (text, obrázek, audio) se slabou licenčními podmínkami a solidní češtinou, Gemma 4 je dnes jednou z nejlepších voleb. Pro čistý kód zvažte Qwen, pro maximální komunitní podporu Llama.
Během nasazování narazíte pravděpodobně na několik typických překážek. Tady je rychlý řešitel:
ollama ps a hlídejte sloupec PROCESSOR. Pokud svítí „100% CPU", model se nevešel do VRAM a llama.cpp nespadne jen díky offloadingu – zvolte menší velikost nebo kvantizaci.Ať už pracujete ve firmě nebo jako freelancer, lokální Gemma 4 pokryje překvapivě mnoho každodenních úkolů. Tady jsou reálné příklady, které stojí za to automatizovat:
Lokální nasazení dává smysl především pokud: pracujete s citlivými daty, máte stabilní objem dotazů (třeba interní AI asistent pro tým), potřebujete garantovat dostupnost bez závislosti na externím API, nebo chcete provozní náklady udžet pod kontrolou. Naopak pro občasné použití nebo extrémně náročné úlohy nad 31B může být kombinace s cloudovým API ekonomičtější.
Gemma 4 posouvá hranici toho, co je reálně spustitelné na vlastním hardwaru. Pět velikostí od E2B do 31B pokryje spektrum od notebooku po serverovou GPU a díky multimodálním schopnostem nahradí i specializované modely pro obrázky a audio. Pro většinu z vás bude nejrychlejší cestou Ollama s 12B variantou – instalace trvá minutu a hned máte OpenAI-kompatibilní endpoint, který napojíte kamkoliv. Kdo potřebuje plnou kontrolu nebo vyšší propustnost, sáhne po llama.cpp respektive vLLM.
Klíčové rozhodnutí je čistě ekonomické a bezpečnostní: jakmile váš měsíční API účet za komerční model převýší cenu GPU, lokální provoz se začne vyplácet – a k tomu připočtěte soukromí, které v cloudu prostě nekoupíte. Vyzkoušejte nejdřív 12B variantu, změřte si reálnou rychlost na vašem hardwaru a teprve pak rozhodněte, zda investovat do větší grafiky.
Navštivte zacinamsai.cz — průvodce světem AI pro úplné začátečníky.
Přejít na Začínáme s AI →
Gemini 3.1 Pro od Googlu, nebo Grok 4.3 s novým Grok Botem od xAI? Aktuální srovnání cen, kontextových oken, výkonu, integrace do Workspace i X a doporučení pro vaši práci.
Google Pics návod: generuj a upravuj obrázky AI přímo v Docs a Slides. Krok za krokem od promptu po hotový firemní vizuál.
Google přinesl do Chatu asistenta, který vidí tvé maily, soubory i kalendář. Návod, jak ho použít pro ranní briefing, hledání souborů, plánování schůzek nebo úkoly v Jira a Asaně.
Google Sheets vzorce s AI: nech Gemini napsat vzorec za pár sekund. Tři cesty, 5 hotových promptů a české prompty od července 2026. Návod krok za krokem.
Nano Banana 2 a Pro od Google generují profesionální AI obrázky zdarma. Návod jak používat, nejlepší prompty, ceny API a srovnání s Midjourney.
Gemini v Google Sheets umí analyzovat data bez vzorců. Návod krok za krokem: panel, AI vzorce, limity a kdy raději sáhnout po klasickém vzorci.
Potřebujete pomoct s AI automatizací?
Domluvte si nezávaznou konzultaci →Týdenní AI tipy přímo do mailu
Žádný spam. Odhlášení jedním klikem.