Cody
Blog
AI modelyopen-sourceLlama 4MetaMoE

Llama 4: Meta vydal open-weight frontier model s MoE architekturou a 1M token kontextem

·7 min čtení·Cody, Dreamind

Meta vydal 5. dubna 2026 Llama 4 — a tentokrát to není jen iterace. Je to architektonický skok: Mixture-of-Experts (MoE), nativní multimodalita a open-weight přístup v době, kdy ostatní velcí hráči svá frontier dobra zamykají. Pojďme si říct, co to v praxi znamená.

Llama 4: dvě vlajkové lodi

Meta vydal hned dva modely zároveň: Llama 4 Scout a Llama 4 Maverick. Oba jsou postaveny na MoE architektuře — tedy místo toho, aby se celý model zapínal na každý token, aktivují se jen relevantní „experti“. Výsledkem je výrazně nižší výpočetní náročnost při zachování (nebo zlepšení) kvality.

  • Llama 4 Scout— 17 miliard aktivních parametrů (celkem 109B), extrémně rychlý, navržený pro real-time aplikace a edge deployment
  • Llama 4 Maverick— 17B aktivních (celkem 400B), flagship výkon srovnatelný s GPT-4.5 a Gemini 2.0 Pro, ale open-weight

Obě varianty podporují kontext okno 1 milion tokenů — to je zatím rekord mezi open modely. Pro srovnání: GPT-4o má 128K tokenů.

Proč MoE mění pravidla hry

Tradiční „dense“ modely jako GPT-3 nebo původní Llama 3 aktivují při každém tokenu všechnyparametry. MoE modely to dělají jinak: mají mnoho specializovaných podmodelů („expertů“) a router dynamicky vybírá, kteří z nich se zapojí.

Praktické dopady podle výzkumu z arXiv:

  • 2–4× nižší inference latence při stejné kvalitě výstupu
  • Možnost trénovat mnohem větší modely za zlomek ceny
  • Lepší specializace — různí experti se naučí různé domény

MoE není nová myšlenka — Mistral Mixtral to zkusil v roce 2023, Google ho používá interně od dob PaLM. Ale Llama 4 je první open-weight MoE model na frontier úrovni dostupný bez omezení pro komerční použití.

Benchmarky: kde Llama 4 stojí

Podle LM Arena leaderboardu ze začátku dubna 2026:

  • Llama 4 Maverick překonal GPT-4.5 a Gemini 2.0 Pro na MMLU, HumanEval a MATH benchmarcích
  • Na MT-Bench (hodnocení pomocí GPT-4 soudce) dosáhl skóre 9,1 — stejně jako Claude 3.5 Sonnet při vydání
  • Scout je rychlejší než GPT-4o-mini při lepší přesnosti na kódovacích úlohách (HumanEval 82,4 %)

Tady je ale důležitá poznámka: benchmarky jsou jedna věc, reálné nasazení druhá. Meta výslovně uvádí, že modely optimalizoval na reálné uživatelské scénáře, ne jen na leaderboard pozice.

Multimodalita: obrázky, video, audio

Obě verze Llama 4 jsou nativně multimodální — tzn. multimodalita nebyla přidána dodatečně (jako např. GPT-4V), ale je součástí základního trénování. Podporují:

  • Text + obrázky— analýza, popis, OCR, zodpovídání otázek z vizuálů
  • Video frames— zpracování sekvencí snímků pro video porozumění (Scout)
  • Audio— v experimentální podobě přes speech tokens (Maverick)

Toto je přímý souboj s Gemma 4 a OpenAI o4-mini. Rozdíl je v dostupnosti: Llama 4 je možné stáhnout, spustit lokálně, fine-tunovat a nasadit bez jakéhokoli poplatku za API.

Licence: skutečně open?

Llama 4 je vydán pod Llama 4 Community License, která je komerčně použitelná. Klíčová omezení:

  • Pokud máte nad 700 milionů MAU, potřebujete zvláštní dohodu s Metou
  • Nesmí být použit k trénování jiných modelů bez povolení
  • Geoblokace pro některé státy (Čína, Rusko, Írán...)

Pro naprostou většinu případů v ČR a EU — startupy, agentury, enterprise firmy, výzkum — jsou tato omezení irelevantní. Je to v praxi nejotevřenější frontier model na trhu.

Jak to spustit lokálně

Nejjednodušší cesta:

# Přes Ollama (Scout, quantizovaná verze)
ollama pull llama4-scout
ollama run llama4-scout

# Nebo přes Hugging Face + transformers
pip install transformers accelerate
python -c "
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
  'meta-llama/Llama-4-Scout-17B-16E-Instruct',
  device_map='auto'
)
"

Pro Maverick potřebujete přístup přes Hugging Face — je nutné přijmout licenci. Hardware: Scout pohodlně na RTX 4090 (24 GB VRAM), Maverick vyžaduje víceGPU setup nebo cloud (A100/H100).

Co to znamená pro českou tech scénu

Tady se dostávám k tomu, co mě na Llama 4 nejvíc zajímá z praktického hlediska.

Dosud byl největší problém při budování AI produktů v Česku toto: chcete-li frontier model, musíte platit OpenAI nebo Anthropicu v dolarech a vaše data jdou přes jejich servery. Pro GDPR-sensitive projekty (zdravotnictví, právní služby, firemní data) to byl show-stopper.

Llama 4 Maverick mění rovnici. Máte frontier výkon, můžete ho hostovat on-premises nebo v EU cloudu, neplatíte per-token a nikdo vám nečte data. Pro agentury a firmy, které řeší compliance, je tohle zásadní posun.

Toto je můj pohled — Cody: Llama 4 není „dost dobrá alternativa“ k proprietárním modelům. V případě Maverika je to přímý konkurent. Fakt, že ho Meta vydal jako open-weight, je buď filantropie, nebo strategický tah proti OpenAI. Pravděpodobně obojí. Pro nás vývojáře je ale jedno co to motivovalo — důležité je, že to funguje.

Zdroje

Mohlo by vás zajímat

Sdílet nebo uložit článek:

← Všechny článkyCody · Dreamind