Menu
Přihlásit
Domů / Obsah / Claude / Lokální AI agent bez cloudu: j...
Claude 15.08.2026 Article

Lokální AI agent bez cloudu: jak ho rozjet na notebooku a kdy se to vyplatí

Praktický návod, jak si nasadit AI agenta, který běží kompletně na tvém hardwaru — žádný cloud, žádné API účty, žádné úniky dat. Kdy to dává smysl a kde jsou limity.

Lokální AI agent bez cloudu: jak ho rozjet na notebooku a kdy se to vyplatí - ilustrační obrázek

Lokální AI agent bez cloudu: jak ho rozjet na notebooku a kdy se to vyplatí

Poslední rok se AI agenti stali běžnou součástí pracovního toolkitu. Píšou kód, zpracovávají emaily, analytuj data. Jenže téměř všichni běží v cloudu — a to znamená, že tvá data opustí firmu, každý požadavek stojí peníze a bez internetu agent nejede.

Začátkem srpna 2026 vydala společnost Liquid AI model LFM2.5-2.6B, který je trénovaný přímo pro agentní úlohy a běží kompletně na lokálním hardwaru. Nejen na výkonných serverech — zvládne ho i notebook, dokonce i Raspberry Pi. To je zajímavý zlomový moment: poprvé máš open-weight model, který není "malý chatbot", ale nástroj stvořený pro práci s nástroji (tool calling), plánování a dlouhé běhy.

V tomto článku ti ukážu, jak si takového agenta rozjet, a hlavně — kdy se to v praxi vyplatí a kdy radši zůstat u cloudu.

Proč vůbec běžet lokálně

Tři důvody, které ve firemním prostředí reálně rozhodují:

1. Citlivá data. Pokud zpracováváš zákaznické smlouvy, finanční výkazy, personální data nebo cokoliv pod GDPR, posílání do API třetí strany je vždy riziko a často komplikace se souhlasy. Lokální model data nikam nepošle. Doslova — inference běží na tvém disku.

2. Předvídatelné náklady. Agent, který dělá tisíce kroku za den, spálí API kredity rychleji, než čekáš. U vysokofrekvenčních agentních úloh (zpracování emailů, klasifikace ticketů, monitoring) jsou náklady na tokeny hlavní položkou. Lokální model má nulovou marginální cenu za požadavek. Jednou zaplatíš hardware, který stejně máš.

3. Rychlost odezvy. LFM2.5-2.6B generuje na běžném notebooku přes 100 tokenů za sekundu a vejde se do 2,5 GB paměti. Žádné latence sítě, žádné rate limity, žádné fronty. Pro úlohy typu "klasifikuj 5 000 dokumentů" je to zásadní rozdíl.

Co budeš potřebovat

Dobrá zpráva: hardware požadavky jsou minimální. Model má 2,6 miliardy parametrů a potřebuje míň než 2,5 GB RAM. Zvládne ho:

  • jakýkoli MacBook z posledních let,
  • běžný pracovní notebook s 16 GB RAM,
  • NVIDIA GPU, pokud máš, ale není povinné,
  • experimentálně i Raspberry Pi.

Naopak nečekej, že lokální model nahradí Claude nebo GPT na složitém kódování. To není jeho úděl. Je to specialista na vysokofrekvenční, opakované agentní úlohy.

Krok 1: Rozjeď model lokálně

Nejjednodušší cesta je přes Ollama nebo llama.cpp. S Ollama je to otázka jednoho příkazu:

ollama run hf.co/LiquidAI/LFM2.5-2.6B

Pokud preferuješ llama.cpp, stáhni si váhy z Hugging Face a spusť server:

llama-server -m LFM2.5-2.6B-Q4_K_M.gguf --port 8080

Klíčové je, že server vystavuje OpenAI-kompatibilní endpoint. To znamená, že pro veškerý okolní svět — tvůj kód, tvůj agent framework, tvé integrace — vypadá lokální model jako jakékoli jiné API. Můžeš tedy swapnout cloudového providera za lokální model změnou jedné URL adresy.

Krok 2: Připoj agentní harness

Model samotný je jen mozek. Agent potřebuje tělo — smyčku, která plánuje, volá nástroje a vyhodnocuje výsledky. Tady je situace příjemná: díky OpenAI-kompatibilnímu endpointu funguje lokální model s běžnými harnessy out of the box,Liquid AI přímo dokumentuje napojení na Hermes Agent, OpenClaw a Pi.

Prakticky to vypadá takto: nasměruješ harness na http://localhost:8080/v1, nastavíš model name a přejeď. Agent dostane stejné nástroje jako v cloudu — přístup k souborům, spouštění příkazů, volání HTTP — jen inference běží u tebe.

Drobné upozornění: agentní harnessy jsou často navlečené na specifické formáty tool callingu velkých providerů. S open-weight modelem si ověříš, že tool calling funguje konzistentně, dřív než postavíš na tom celý workflow. Zvlášť u 2,6B modelu platí: jednoduché, dobře definované nástroje fungují spolehlivěji než dvacet volání najednou.

Krok 3: Dej mu reálnou práci

Kde lokální agent skutečně svítí ve firemním provozu:

Třídění a klasifikace. Příchozí emaily, support tickety, faktury do kategorií. Malý model to zvládne s vysokou úspěšností a ušetří ti spotřebu tokenů z velkého modelu na triviální úlohy.

Extrakce dat. Vytáhnout z PDF smlouvy datumy, částky a strany, z emailu objednávku, z reportu klíčová čísla. Opakované, strukturované, ideální pro malý model.

Hlídání a monitoring. Agent, který každou hodinu projde logy, RSS kanály nebo interní databázi a nahlásí anomálie. Běží nonstop, nestojí nic navíc.

Preprocessing pro velké modely. Elegantní pattern: lokální model vyfiltruje, vyčistí a zredukuje data — a do cloudu posle jen to, co opravdu potřebuje velký model. Ušetříš 80 % nákladů a minimalizuješ únik dat.

Kde jsou limity

Abych byl férový, lokální agent není všelék:

  • Složité uvažování. Úlohy vyžadující hlubokou analýzu, dlouhý kontext nebo kreativitu doslova vyžadují větší model. Nepiš lokálním agentem architekturu systému.
  • Multimodalita. Tento konkrétní model je text-only. Pro obrázky a audio existují samostatné varianty rodiny, ale ne v jednom checkpointu.
  • Provoz a údržba. Model si aktualizuješ sám, monitoring a zálohy jsou tvoje starost. U cloudu o to nestojíš.
  • Kvalita tool callingu. Malý model potřebuje disciplinovanější prompt design. Nástroje popiš přesně, úlohy rozděl na menší kroky.

Praktický verdikt

Začni hybridně. Nasadit lokální model dnes trvá deset minut a nic tě nestojí. Konkrétní postup:

  1. Rozjeď model přes Ollama nebo llama.cpp (jeden příkaz).
  2. Připoj svůj oblíbený agentní harness přes OpenAI-kompatibilní endpoint.
  3. Vyber jednu opakovanou úlohu — ideálně klasifikaci nebo extrakci — a pusť na ní A/B test proti tvému současnému cloudovému řešení.
  4. Porovnej kvalitu výstupů a náklady. Přepni lokálně, pokud kvalita stačí.

Firmy s citlivými daty a vysokým objemem rutinních agentních úloh ušetří nejvíc. Pro jednotlivce je to bezplatná laboratoř, kde si můžeš vyzkoušet agentní workflow bez strachu z faktury.

Hranice mezi "cloudový model nutně" a "lokálně stačí" se letos posunula výrazně ve prospěch lokála. Nebude to dlouho trvat a lokální agent bude standardní součástí firemního toolkitu stejně samozřejmě jako dnes VPN.

Vyzkoušej to. Ten notebook na tvém stole teď umí víc, než si myslíš.

Začínáte s AI?

Navštivte zacinamsai.cz — průvodce světem AI pro úplné začátečníky.

Přejít na Začínáme s AI →

// Další články, které by tě mohly zajímat

Potřebujete pomoct s AI automatizací?

Domluvte si nezávaznou konzultaci →