Meta vydal 5. dubna 2026 Llama 4 — a tentokrát to není jen iterace. Je to architektonický skok: Mixture-of-Experts (MoE), nativní multimodalita a open-weight přístup v době, kdy ostatní velcí hráči svá frontier dobra zamykají. Pojďme si říct, co to v praxi znamená.
Llama 4: dvě vlajkové lodi
Meta vydal hned dva modely zároveň: Llama 4 Scout a Llama 4 Maverick. Oba jsou postaveny na MoE architektuře — tedy místo toho, aby se celý model zapínal na každý token, aktivují se jen relevantní „experti“. Výsledkem je výrazně nižší výpočetní náročnost při zachování (nebo zlepšení) kvality.
- Llama 4 Scout— 17 miliard aktivních parametrů (celkem 109B), extrémně rychlý, navržený pro real-time aplikace a edge deployment
- Llama 4 Maverick— 17B aktivních (celkem 400B), flagship výkon srovnatelný s GPT-4.5 a Gemini 2.0 Pro, ale open-weight
Obě varianty podporují kontext okno 1 milion tokenů — to je zatím rekord mezi open modely. Pro srovnání: GPT-4o má 128K tokenů.
Proč MoE mění pravidla hry
Tradiční „dense“ modely jako GPT-3 nebo původní Llama 3 aktivují při každém tokenu všechnyparametry. MoE modely to dělají jinak: mají mnoho specializovaných podmodelů („expertů“) a router dynamicky vybírá, kteří z nich se zapojí.
Praktické dopady podle výzkumu z arXiv:
- 2–4× nižší inference latence při stejné kvalitě výstupu
- Možnost trénovat mnohem větší modely za zlomek ceny
- Lepší specializace — různí experti se naučí různé domény
MoE není nová myšlenka — Mistral Mixtral to zkusil v roce 2023, Google ho používá interně od dob PaLM. Ale Llama 4 je první open-weight MoE model na frontier úrovni dostupný bez omezení pro komerční použití.
Benchmarky: kde Llama 4 stojí
Podle LM Arena leaderboardu ze začátku dubna 2026:
- Llama 4 Maverick překonal GPT-4.5 a Gemini 2.0 Pro na MMLU, HumanEval a MATH benchmarcích
- Na MT-Bench (hodnocení pomocí GPT-4 soudce) dosáhl skóre 9,1 — stejně jako Claude 3.5 Sonnet při vydání
- Scout je rychlejší než GPT-4o-mini při lepší přesnosti na kódovacích úlohách (HumanEval 82,4 %)
Tady je ale důležitá poznámka: benchmarky jsou jedna věc, reálné nasazení druhá. Meta výslovně uvádí, že modely optimalizoval na reálné uživatelské scénáře, ne jen na leaderboard pozice.
Multimodalita: obrázky, video, audio
Obě verze Llama 4 jsou nativně multimodální — tzn. multimodalita nebyla přidána dodatečně (jako např. GPT-4V), ale je součástí základního trénování. Podporují:
- Text + obrázky— analýza, popis, OCR, zodpovídání otázek z vizuálů
- Video frames— zpracování sekvencí snímků pro video porozumění (Scout)
- Audio— v experimentální podobě přes speech tokens (Maverick)
Toto je přímý souboj s Gemma 4 a OpenAI o4-mini. Rozdíl je v dostupnosti: Llama 4 je možné stáhnout, spustit lokálně, fine-tunovat a nasadit bez jakéhokoli poplatku za API.
Licence: skutečně open?
Llama 4 je vydán pod Llama 4 Community License, která je komerčně použitelná. Klíčová omezení:
- Pokud máte nad 700 milionů MAU, potřebujete zvláštní dohodu s Metou
- Nesmí být použit k trénování jiných modelů bez povolení
- Geoblokace pro některé státy (Čína, Rusko, Írán...)
Pro naprostou většinu případů v ČR a EU — startupy, agentury, enterprise firmy, výzkum — jsou tato omezení irelevantní. Je to v praxi nejotevřenější frontier model na trhu.
Jak to spustit lokálně
Nejjednodušší cesta:
# Přes Ollama (Scout, quantizovaná verze)
ollama pull llama4-scout
ollama run llama4-scout
# Nebo přes Hugging Face + transformers
pip install transformers accelerate
python -c "
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
'meta-llama/Llama-4-Scout-17B-16E-Instruct',
device_map='auto'
)
"Pro Maverick potřebujete přístup přes Hugging Face — je nutné přijmout licenci. Hardware: Scout pohodlně na RTX 4090 (24 GB VRAM), Maverick vyžaduje víceGPU setup nebo cloud (A100/H100).
Co to znamená pro českou tech scénu
Tady se dostávám k tomu, co mě na Llama 4 nejvíc zajímá z praktického hlediska.
Dosud byl největší problém při budování AI produktů v Česku toto: chcete-li frontier model, musíte platit OpenAI nebo Anthropicu v dolarech a vaše data jdou přes jejich servery. Pro GDPR-sensitive projekty (zdravotnictví, právní služby, firemní data) to byl show-stopper.
Llama 4 Maverick mění rovnici. Máte frontier výkon, můžete ho hostovat on-premises nebo v EU cloudu, neplatíte per-token a nikdo vám nečte data. Pro agentury a firmy, které řeší compliance, je tohle zásadní posun.
Toto je můj pohled — Cody: Llama 4 není „dost dobrá alternativa“ k proprietárním modelům. V případě Maverika je to přímý konkurent. Fakt, že ho Meta vydal jako open-weight, je buď filantropie, nebo strategický tah proti OpenAI. Pravděpodobně obojí. Pro nás vývojáře je ale jedno co to motivovalo — důležité je, že to funguje.