Menu
Přihlásit
Domů / Obsah / N8N / N8N web scraping: data z webu ...
N8N 23.08.2026 Tutorial

N8N web scraping: data z webu do automatizace bez kódu

N8N web scraping v praxi: postav crawler, který sám projde web, vytáhne data pomocí AI a uloží je do Sheets. Návod krok za krokem bez Pythonu.

Kompletní návod

Každá automatizace potřebuje vstupní data. A velká část těch nejcennějších dat — konkurenční ceny, nabídky práce, novinky od dodavatelů, kontakty potenciálních klientů — visí na webech, které pro ně nemají API. N8N web scraping je dnes nejjednodušší cesta, jak ta data pravidelně stáhnout, nechat AI roztřídit a poslat dál do workflow. V tomto návodu ti ukážu konkrétní postavu crawleru, který projde web, vytáhne z něj strukturovaná data a výsledek uloží — všechno bez Pythonu. Pokud chceš rychlý cloudový start bez vlastního hostingu, mrkni i na Zapier.

Klasický scraping byl vždy stejný příběh: napíšeš skript, nastavíš CSS selektory, za tři týdny konkurence převede web na nový design a celý skript jde do koše. AI extrakce tohle řeší jinak — místo selektorů popíšeš, co chceš, obyčejnou větou a model si s HTML poradí sám, i když se layout změní.

Proč je n8n ideální platforma pro web scraping

N8N má dvě věci, které pro scraping rozhodují: HTTP Request uzel, který umí volat jakoukoli scrapovací API, a Code uzel, kde si data přefiltruješ. K tomu Schedule Trigger, díky kterému celý běh opakuješ denně nebo hodinově, aniž bys na to musel myslet.

Druhý důvod je ekosystém. N8N šablon má pro scraping a sumarizaci webů hotové (oficiální šablona "Scrape and summarize webpages with AI", aktualizovaná 2026), takže nemusíš začínat od nuly — importuješ šablonu, vyměníš URL a jde se. A pokud už teď něco automatizuješ v Zapieru nebo Make, stejný princip tam postavíš také, jen s menší kontrolou nad chybovými stavy. Detailní rozdíly mezi platformami pak najdeš i ve srovnání n8n, Make a Zapieru.

Třetí důvod: self-hosting. Když scraper pustíš nad větším objemem stránek, rychle zjistíš, že cloudové execution kredity nejsou zadarmo. N8N si hostuješ sám — jak na to, jsem popisoval v návodu na n8n v produkci.

Tři způsoby, jak v n8n data z webu získat

Než začneš stavět, vyber si podle náročnosti cíle jednu ze tří cest. Komunita n8n je popisuje jako čtyři metody — v praxi se dá vše zredukovat na tři úrovně.

1. RSS a API, kde existují

Nejlevnější data jsou ta, která nemusíš scrapovat. Má web RSS feed? Pull RSS uzel, hotovo. Nabízí majitel veřejné API (e-shopy, zpravodajské servery, veřejné rejstříky)? HTTP Request na API endpoint je vždy stabilnější než parsování HTML. Tuhle variantu berte jako první volbu — scraping až tehdy, když nic jiného neexistuje.

2. HTTP Request + AI extrakce pro statické weby

Pro běžný web stačí HTTP Request uzel, který stáhne HTML, a AI model, kterému řekneš, co z něj vytáhnout. Žádné CSS selektory, žádný XPath. Popíšeš požadovaná pole, dostaneš čistý JSON.

3. Specializovaná scrapovací API pro chráněné weby

Narazíš-li na Cloudflare, Datadome nebo jinou anti-bot ochranu (a u českých e-shopů se to stává často), postav se na scrapovací API jako ScrapingBee, Firecrawl nebo Apify. Servery, proxy a JavaScript rendering má na starosti služba, ty platíš za volání. ScrapingBee k tomu přímo nabízí AI extrakci s parametrem ai_query (publikováno 14. 1. 2026), kde výsledek dostaneš rovnou jako strukturovaný JSON.

Praktický návod: crawler, který sám projde celý web

Postavíme workflow ze čtyř uzlů, které se chovají jako mini-crawler: stáhne výpisovou stránku (třeba blog konkurence nebo kategorie e-shopu), nechá AI najít odkazy na jednotlivé stránky, a každou z nich pak samostatně stáhne a zpracuje. Tuhle stavbu přebírám z výše uvedeného ScrapingBee návodu a z oficiálních n8n šablon.

Krok 1: Schedule nebo Manual Trigger

Začni Manual Triggerem, dokud workflow ladíš — spouštíš tlačítkem a vidíš přesně, co se děje. Až bude hotový, vyměň ho za Schedule Trigger (např. každé ráno v 6:00) a automatizace běží sama.

Krok 2: HTTP Request — první stažení

Přidej HTTP Request uzel s metodou GET. Pro nechráněné weby stačí cílové URL přímo. Pro chráněné weby míří volání na scrapovací API a v query parametrech pošleš:

  • api_key — tvůj klíč ke službě
  • url — stránka, kterou chceš stáhnout
  • ai_query — prostý text: „Vytáhni hlavní nadpis H1 a najdi odkazy na jednotlivé články"
  • ai_extract_rules — JSON schéma výstupu, např. {"h1_heading": {"type": "string"}, "blog_post_links": {"type": "list"}}

Právě ai_extract_rules je kámen úhelný: definuješ tím, jak má vypadat výstup, a API ti vrátí rovnou strukturovaná data místo syrového HTML.

Krok 3: Code uzel — vyfiltruj odkazy

Za HTTP Request přidej Code uzel, který z odpovědi vytáhne seznam URL a očistí ho:

const response = $input.first().json;
const links = response.blog_post_links || [];

const linksToScrape = links
  .filter(link => link.includes('/blog/') && !link.includes('#'))
  .slice(0, 5); // při ladění vždy malé číslo

return linksToScrape.map(link => ({
  url: link.startsWith('http') ? link : `https://priklad.cz${link}`,
  type: 'blog_post'
}));

Tenhle kus kódu je jediný, který v celém workflow napíšeš. Filtruje relativní odkazy na absolutní URL, zahazuje kotvy a omezuje počet stránek — při prvním spuštění vždy scrapuj pět stránek, ne padesát.

Krok 4: Druhý HTTP Request — spider

Teď přichází ta elegantní část. Druhý HTTP Request uzel je nastavený stejně jako první, jen s jedním rozdílem: parametr url není napevno, ale výraz {{ $json.url }}. N8N tím dostane seznam položek z Code uzlu a spustí se jednou pro každou URL — to je celé tajemství spiderování. Do ai_query tentokrát napíšeš třeba „Vytáhni hlavní nadpis a datum publikace".

Po spuštění uvidíš v druhém HTTP uzlu pět samostatných výsledků, každý s vytěženými daty z jedné stránky.

Krok 5: Ulož a pošli dál

Na konec připoj, co potřebuješ: Google Sheets uzel pro uložení (jak Sheets propojit s AI popisuji v návodě na automatizaci Google Sheets), Slack nebo e-mail pro notifikaci při zajímavé změně, nebo další AI uzel, který data shrne. Kompletní e-mailové workflow pak navážeš podle automatizace e-mailů pomocí AI.

Co s vytěženými daty: tři reálné use casy

Sledování konkurenčních cen. Schedule Trigger jednou denně stáhne kategorii e-shopu, AI vytáhne název produktu a cenu, Code uzel porovná s minulou hodnotou v Sheets a při změně nad X % pošle upozornění na Slack. Nákupčí tak ví o cenové válce dřív než zákazníci.

Monitoring nabídek a témat. Stejná stavba nad kariérními weby nebo zpravodajství: crawler pravidelně stáhne výpis, AI vytáhne titulky a data, druhý AI uzel shrne, co je nového oproti minule. Ranní digest do schránky, aniž bys cokoli otevíral.

Obohacování leadů. Máš seznam firem bez kontaktních údajů? HTTP Request s AI extrakcí projde web každé firmy a doplní e-mail, telefon a pozici. Výstup jde rovnou do CRM workflow. Podobným směrem míří i AI agenti ovládající prohlížeč, když potřebuje složitější interakci než jen čtení.

Etika a limity: co scrapovat smíš

Web scraping v ČR nenajdeš v žádném zákoně pod tímto názvem, ale pár pravidel platí vždy:

  • Respektuj robots.txt a podmínky užití. Má provozovatel scrapování výslovně zakázané, koukej po API nebo RSS.
  • Osobní údaje nepatří do scraperu. GDPR se netýká jen velkých firem — týká se i tvého workflow. Dostat data o firmách z veřejného rejstříku je OK, profilů lidí z LinkedIn už ne.
  • Nezahlcuj cizí server. Rate limit mezi požadavky (v n8n nastavíš v uzlu HTTP Request options) a scraping mimo špičku. Denní cron nad pěti stránkami je slušnost; stovka požadavků za sekundu je útok.
  • Zkontroluj si zdroje dat. Tohle je pořád cizí obsah — pokud z něj děláš agregátor, cituj zdroj.

Časté otázky

Je n8n web scraping legální?

Samotné stahování veřejně dostupných stránek v ČR zakázané není. Nelegální se stává okrajově: při ignorování podmínek služby, při shromažďování osobních údajů v rozporu s GDPR, nebo při zahlcování cizího serveru. Drž se robots.txt, personalizovaných dat se vyhýbej a frekvenci drž na rozumné úrovni.

Potřebuju na web scraping s n8n umět programovat?

Na základní workflow ne. Jediný kód, který napíšeš, je krátký filtr odkazů v Code uzlu — ten zkopíruješ z návodu. Všechno ostatní klikáš: HTTP Request, výrazy v {{ }} závorkách a hotové uzly pro Sheets nebo Slack. Základní průvodce n8n automatizací ti stačí na to, abys pochopil principy uzlů.

Kdy použít scrapovací API a kdy stačí obyčejný HTTP Request?

Obyčejný HTTP Request v n8n stačí pro statické weby bez ochrany. Směřuj na scrapovací API (ScrapingBee, Firecrawl, Apify) ve chvíli, kdy dostáváš chyby 403, stránka se renderuje JavaScriptem, nebo potřebuješ rotovat proxy při větším objemu. Plať za volání jen tehdy, kdy je to skutečně potřeba.

Kolik stojí provoz takového scrapovacího workflow?

N8N samotné je open source — self-hosted instance tě stojí jen server, od 4 € měsíčně. Většina nákladů bývá v AI extrakci a scrapovací API: běžné využití se pohybuje v řádech stovek Kč měsíčně. Pro srovnání nákladů jednotlivých platforem mám rozbor cen n8n vs Make vs Zapier.

Jak často se má scraper spouštět?

Podle toho, jak rychle se data mění. Konkurenční ceny stačí jednou denně, nabídky práce dvakrát denně, monitoring zpráv po hodině. Vždy mezi běhy kontroluj, jestli se cílový web nezměnil — AI extrakce je odolná vůči změnám layoutu, ale ne vůči přesunu obsahu na jinou URL.

Shrnutí: data jsou vstup, ne projekt

Web scraping vypadá jako samostatná disciplína, ale v n8n je to jen další vstupní uzel — stejně jako RSS, e-mail nebo webhook. Čtyři uzly, jeden krátký skript a popis v přirozeném jazyce nahradí týdny práce s Pythonem a údržbou selektorů.

Začni s malým: jedna kategorie e-shopu, pět stránek, denní cron. Až workflow půjde bez dozoru, rozšiřuj. A pokud chceš nejdřív pochopit, jak n8n vůbec funguje, vrať se k základnímu průvodci automatizace — scraping je pak jen cvičení na kombinaci uzlů, které už znáš.

Začínáte s AI?

Navštivte zacinamsai.cz — průvodce světem AI pro úplné začátečníky.

Přejít na Začínáme s AI →

// Další články, které by tě mohly zajímat

Potřebujete pomoct s AI automatizací?

Domluvte si nezávaznou konzultaci →