Google vydal Gemini 3.6 Flash 21. července 2026 a na první pohled vypadá jako rutinní iterace. Není. Jde o první model z rodiny Flash, který výrazně řeší dvě věci, které tě nejvíc bolí, když stavíš AI agenty ve výrobě: cenu za výstupní tokeny a počet kroků, které agent potřebuje k dokončení úkolu.
Podle Artificial Analysis Index spotřebovává 3.6 Flash o 17 % méně výstupních tokenů než 3.5 Flash při stejných úkolech. V některých agentických benchmarcích (DeepSWE od Datacurve) je to až 65 %. A to vše při nižší ceně za token než měl předchůdce.
V tomto článku ti ukážu, kde dává smysl 3.6 Flash nasadit, kde naopak zůstat u 3.5 Flash-Lite nebo Claude, jak nastavit computer use jako nativní nástroj a jak přepočítat rozpočet, aby ses nepřipravil o úspory kvůli špatnému routingu.
Co se reálně změnilo oproti 3.5 Flash
Tři věci, které mají přímý dopad na tvou fakturu a spolehlivost agentů:
1. Tokenová efektivita. Model generuje stručnější výstupy. Na OSWorld-Verified (reálné úkoly v GUI) spotřebuje méně reasoning kroků a méně tool callů. To znamená, že jeden „agentic task" nestojí jen méně na token — končí dřív, což snižuje i latenci a počet iterací, ve kterých se agent může zacyklit.
2. Nižší cena při vyšší kvalitě. 3.6 Flash stojí $1.50 / 1M vstupních tokenů a $7.50 / 1M výstupních tokenů. To je méně než 3.5 Flash. Když k tomu připočítáš 17% snížení verbosity, reálný cost per task klesá zhruba o 25–30 %.
3. Computer use jako nativní nástroj. Ovládání myši/klávesnice (computer use) už není hack přes externí wrapper — je to built-in client-side tool dostupný přes Gemini API a Gemini Enterprise. Pro agenty, kteří řídí prohlížeč nebo desktopové aplikace, to znamená méně integration kódu a spolehlivější event handling.
Kvantitativně to vypadá takhle (vše vs. 3.5 Flash, zdroj Google):
| Benchmark | 3.5 Flash | 3.6 Flash | Rozdíl |
|---|---|---|---|
| DeepSWE (Datacurve) | 37 % | 49 % | +12 pp |
| MLE Bench (ML research) | 49.7 % | 63.9 % | +14.2 pp |
| OSWorld-Verified (computer use) | 78.4 % | 83.0 % | +4.6 pp |
| GDPval-AA v2 (knowledge work) | 1349 | 1421 | +5.3 % |
| Výstupní tokeny | baseline | −17 % | úspora |
Kde 3.6 Flash nasadit (a kde ne)
Největší chyba, kterou teď vývojáři dělají, je plošně přepnout všechny agenty na 3.6 Flash. Správný přístup je routovat podle charakteru úkolu.
Nasad, kde máš multi-step agentické workflow. Tady se ty úspory tokenů násobí — každá iterace, každý tool call, každý reasoning krok je levnější. Typicky: kódové migrace, parsování finančních dokumentů, report drafting nad daty, SWE úkoly. Zákazníci jako Hebbia a Harvey hlásí konkrétní zlepšení u multimodálních úloh — analýza grafů, zpracování dokumentů, syntéza reportů.
Nasad computer use agenty. Pokud stavíš agenta, který řídí webové aplikace (vyplňování formulářů, scrapování, testování UI), nativní computer use ti ušetří stovky řádků integrace a zlepší spolehlivost.
Nenasazuj na high-throughput, low-latency úlohy. Pokud potřebuješ maximální propustnost (agentic search nad miliony dotazů, zpracování milionů účtenek), použij 3.5 Flash-Lite. Ten běží 350 výstupních tokenů/s a stojí jen $0.30 / 1M vstupních a $2.50 / 1M výstupních tokenů. 3.6 Flash je „workhorse" — vyvažuje kvalitu a cenu, ale není to nejrychlejší.
Nenasazuj na frontier reasoning, kde potřebuješ absolutní maximum. Tam stále platí větší modely (Claude Opus 5, Gemini 3.5 Pro až vyjde). 3.6 Flash je optimalizovaný na cost/quality sweet spot, ne na špičku.
Konkrétní routing: 3.6 Flash vs 3.5 Flash-Lite vs Claude
Praktické rozhodovací schéma, které používám pro agentic pipeline:
- Úkol = kódování, refactoring, SWE → 3.6 Flash. Nižší počet iterací a 17 % méně tokenů tě zoběhne.
- Úkol = hromadné zpracování, klasifikace, extrakce → 3.5 Flash-Lite. 350 tok/s a desetina ceny.
- Úkol = ovládání GUI, testování webu → 3.6 Flash s nativním computer use.
- Úkol = komplexní reasoning, plánování, architektura → Claude Opus 5 / Sonnet 5. Flash modely tu zaostávají.
- Úkol = dlouhý kontext (nad 500k tokenů) → zkontroluj aktuální context window obou Flash modelů; Flash-Lite na GDM-MRCR v2 dosahuje 72.2 %.
Pokud už máš router (typicky LiteLLM nebo vlastní LLM gateway), stačí přidat 3.6 Flash jako nový backend a přesměrovat kódové a multimodální úkoly. Přepnutí modelového ID je jednorázová změna.
Jak přepnout z 3.5 Flash: checklist
- Změň model ID v API voláních —
gemini-3.5-flash→gemini-3.6-flash. Žádné breaking changes v API signatures, parametry zůstávají. - Zkontroluj system prompty. Protože 3.6 Flash generuje stručnější výstupy, může se stát, že tvé prompty obsahují instrukce typu „buď vyčerpávající" nebo „vypiš všechny kroky". Ty teď mohou vést k nadměrné verbositě, která efektivitu modelu vrací zpět. Zvaž je zrušit a nechat model produkovat přirozeně kratší odpovědi.
- Přepočítej token budget. Pokud máš nastavený
max_output_tokensjako zábranu proti flip-flop loopům, můžeš ho snížit zhruba o 15–20 %, protože model přirozeně produkuje méně. To tě staví na ještě větší úspory. - Testuj computer use nativně. Pokud jsi měl vlastní browser-use wrapper, porovnej latenci a úspěšnost s built-in computer use. Většina týmů hlásí zjednodušení kódu.
- Sleduj cost per completed task, ne cost per token. Jelikož agent udělá méně kroků, průměrný počet API callů na úkol klesne. To je největší hidden win.
Kolik tě to bude stát: reálný příklad
Představ si agenta, který zpracovává 10 000 dokumentů měsíčně. Průměrný dokument = 4000 vstupních tokenů, odpověď = 1500 výstupních tokenů u 3.5 Flash.
3.5 Flash (odhad dle trhu): cca $2 / 1M vstup, $8 / 1M výstup.
- Vstupy: 10 000 × 4000 = 40M tokenů → $80
- Výstupy: 10 000 × 1500 = 15M tokenů → $120
- Celkem: $200 / měsíc
3.6 Flash: $1.50 / 1M vstup, $7.50 / 1M výstup, −17 % výstupních tokenů.
- Vstupy: 40M tokenů → $60
- Výstupy: 15M × 0.83 = 12.45M tokenů → $93.40
- Celkem: $153.40 / měsíc → úspora ~23 %
A to nepočítá snížení počtu iterací u multi-step agentů, kde se úspora může zdvojnásobit.
Co se nevyplatí očekávat
Není to frontier model. Pokud tvůj úkol vyžaduje špičkový reasoning (komplexní matematika, hluboké plánování), zůstaň u větších modelů. 3.6 Flash v MLE Bench sice skočil z 49.7 % na 63.9 %, ale to je stále základní úroveň ML research schopností.
3.5 Flash Cyber není pro tebe. Verze Cyber (optimalizovaná na bezpečnostní hledání a patchování zranitelností) je dostupná pouze vládám a ověřeným partnerům přes CodeMender. Jako běžný vývojář ji nezískáš.
3.5 Pro ještě není venku. Pokud čekáš na silnější Pro verzi z rodiny 3.5, Google ji testuje s partnery a široce ji vydá „až bude hotová". Mezitím Gemini 4 je v nejambicióznějším pre-training runu.
Kde model získáš
- Vývojáři: Gemini API přes Google AI Studio a Android Studio. 3.6 Flash je i v Google Antigravity.
- Enterprise: Gemini Enterprise Agent Platform a Gemini Enterprise app.
- Běžní uživatelé: Gemini app.
Developer Guide je na oficiálním webu Google. Žádné waitlisty — model je dostupný okamžitě.
Závěr: stojí to za migraci?
Ano, pokud stavíš agenty ve výrobě a tvoje pipeline běží na 3.5 Flash. Úspora ~25 % na cost per task není marginálie — při škálování to dělá rozdíl mezi zelenou a červenou jednotkou (unit economics). Nativní computer use navíc eliminuje celou vrstvu integrace.
Ne, pokud jedeš výhradně na high-throughput batch joby — tam zůstaň u 3.5 Flash-Lite, který je na propustnost optimalizovaný lépe.
A ne, pokud tvé úkoly vyžadují frontier reasoning. Tam model nevyřeší, co potřebuješ, a nižší cena tě nepotěší, když agent úkol vůbec nedokončí.
Praktický krok pro dnešek: vezmi jeden produkční agenta, u kterého máš měřený cost per task, přepni ho na 3.6 Flash a sleduj metriky týden. Většina týmů uvidí úsporu v prvních dnech.