OpenAI vydal o3 a o4-mini 16. dubna 2025 a tím zahájil novou éru: modely, které před odpovědí skutečně přemýšlejí. Rok po vydání jsou reasoning modely v produkci u tisíců firem — ale většina z nich je buď podceňuje, nebo (dražší chyba) přeceňuje a platí desetinásobek za úkoly, kde by stačil levnější model.
Tento článek je praktický průvodce: co reasoning modely jsou, kde dávají smysl, kde jsou overkill, a jak vybrat správný model pro váš use case.
Co je reasoning model a jak se liší od klasického LLM
Standardní jazykový model generuje odpověď přímo — token po tokenu, bez „zastávky na přemýšlení“. Reasoning model před finální odpovědí prochází interním chain-of-thought procesem: generuje tisíce tokenů vlastního uvažování, testuje hypotézy, vrací se zpět kde se zmýlil, a teprve pak vydá výsledek.
Klíčové je, že tenhle interní monolog nevidíte (nebo vidíte jen částečně — záleží na modelu). Ale účtuje se jako výstupní tokeny. Krátká viditelná odpověď „výsledek je 42“ může za sebou skrývat 10 000 reasoning tokenů, které vás stojí reálné peníze.
Důležité upozornění: podle Sebastiana Raschky chain-of-thought funguje dobře pouze u dostatečně velkých modelů. U malých modelů (pod přibližně 100B parametrů) CoT přesnost paradoxně zhoršuje— model začne přemýšlet ve smyčkách a zmatí sám sebe.
OpenAI o3 a o4-mini: co umí a co stojí
O3 a o4-mini přinesly dvě zásadní novinky oproti předchůdcům: plný tool use a nativní multimodalitu. Předchozí reasoning modely (o1, o1-mini) uměly jen text. O4-mini je první „mini“ reasoning model, který vidí obrázky, volá nástroje a provádí webový výzkum — a přitom je výrazně levnější než o3.
Benchmarky
Na standardních testech jsou výsledky ohromující: o3 drží SOTA na SWE-bench (reálné GitHub issues), AIME 2025 (olympiádní matematika) i MMMU (multimodální porozumění). O4-mini dosáhl na HCAST autonomních úkolů 1,5× delší „time horizon“ než Claude 3.7 Sonnet — tedy zvládne delší sekvence kroků bez chyby.
Ceny (aktuálně)
Původní ceny z dubna 2025 byly strmé ($10/$40 za 1M tokenů input/output u o3), ale OpenAI ceny od té doby snížil — v dubnu 2026 se o3 pohybuje kolem $2/$8. O4-mini začínal na $1,10/$4,40 a ceny klesly podobně. Reasoning tokeny (interní uvažování) se účtují jako output — to je kritické pro kalkulaci nákladů.
Claude 3.7 Sonnet a Gemini 2.0 Flash Thinking: konkurence
OpenAI není jediný hráč. Anthropic vydal Claude 3.7 Sonnet(24. února 2025) jako první hybridní reasoning model: přepínáte mezi standardním a „extended thinking“ módem v rámci jednoho API volání. Na MATH-500 dosahuje 96,2 % přesnosti, GPQA (doktorátní věda) 84,8 %. Context window 200K tokenů je výrazně větší než u OpenAI modelů.
Google přišel s Gemini 2.0 Flash Thinking(21. ledna 2025) — rychlejší a levnější, ale přesností za Claudem 3.7 zaostává (GPQA 74,2 %). Hodí se jako levný první stupeň filtrace před dražším reasoning modelem.
Kde reasoning modely skutečně pomáhají
Reasoning modely nejsou všelék. Jsou skvělé v konkrétních typech úkolů:
- Matematika a věda na graduátní úrovni— multistavové problémy kde jedno špatné rozhodnutí kazí celý výsledek
- Složitý debugging a code review— o3 drží SOTA na SWE-bench pro reálné GitHub issues, bez custom scaffoldu
- Multi-step plánování— úkoly kde chyba v kroku 2 ruinuje kroky 3–10 (agentic workflows, právní analýzy, finanční modely)
- Vizuální reasoning— analýza komplexních grafů, technických diagramů, tabulek z obrázků (o3/o4-mini mají plnou multimodalitu)
- Výzkum a porovnávání hypotéz— model sám testuje více přístupů a vybírá nejlepší
Kdy reasoning modely NEPOUŽÍVAT (a ušetřit 90 % nákladů)
Tady je nejdůležitější část tohoto článku — a ta, kterou většina implementací přeskočí.
Konkrétní příklad z praxe: jeden tým nasadil o3 místo GPT-4o na support triage. Přesnost se zlepšila o pouhá 2 %. Náklady vzrostly o 900 %. Latence skočila z 400 ms na 12 sekund. Projekt vrátili zpět.
Reasoning modely jsou overkill (a pomalé) pro:
- Jednoduché fact lookup— „jaký je hlavní město Francie?“ nepotřebuje chain-of-thought
- Real-time chatboty— 5–15 vteřin latence = frustrovaný uživatel
- Kreativní psaní— reasoning modely jsou analytické a „Spock-like“; GPT-4o nebo Claude 3.5 Sonnet píší přirozeněji
- Produkční dotazy ve vysokém objemu— pokud voláte LLM statisíckrát denně, rozdíl v ceně je existenciální
- Jednorázové klasifikační úkoly— sentiment analýza, základní extrakce dat, jednoduché překlady
Doporučená architektura: víceúrovňový routing
Nejlepší produkční implementace, které vidíme v 2026, nepoužívají jeden model na všechno. Používají model routing:
- Stupeň 1 — rule-based filtr: Regex, jednoduché klasifikátory. Odfiltruje triviální dotazy zcela bez LLM.
- Stupeň 2 — rychlý LLM (GPT-4o mini, Gemini Flash):Zpracuje 85–90 % dotazů. Levné, rychlé, dobré.
- Stupeň 3 — reasoning model (o3, Claude 3.7 ET):Pouze pro eskalované, komplexní případy kde záleží na přesnosti. 5–10 % objemu, ale tam kde je potřeba.
Tento přístup může snížit náklady o 70–90 % oproti nasazení reasoning modelu na všechno — při zachování nebo zlepšení kvality na těžkých případech.
Jak začít: praktický checklist
- Definujte si jaký typ úkolů skutečně řešíte: jsou to problémy s více kroky kde záleží na každém rozhodnutí? Nebo rychlé odpovědi ve velkém objemu?
- Otestujte oba přístupy na vzorku reálných dat— ne na syntetických benchmarcích. Benchmarky a produkce se liší.
- Měřte nejen přesnost, ale i latenci a náklady. Přesnost +2 % za cenu +900 % není byznysový případ.
- Zvažte víceúrovňový model routing od začátku — jednodušší ho navrhnout předem než refaktorovat po 6 měsících.
- Pro agentic workflows (multi-krokové autonomní úkoly) zvažte o3 nebo Claude 3.7 Sonnet s extended thinking — tady reasoning modely opravdu svítí.
Codyho komentář: Reasoning modely jsou jako hire nejlepšího konzultanta — geniální, ale drahý a pomalý. Nechte ho řešit skutečně těžké problémy. Na emaily nepotřebujete McKinsey.
Shrnutí
Reasoning modely jako o3, o4-mini a Claude 3.7 Sonnet s extended thinking jsou reálný průlom pro specifické typy úkolů: komplexní vícestavové problémy, matematiku, programování, autonomní agenty. Ale nejsou náhradou za standardní LLM — jsou specializovaným nástrojem v toolboxu.
Klíčová otázka před nasazením není „je reasoning model lepší?“ ale „je tento konkrétní úkol dostatečně složitý, aby reasoning model ospravedlnil 10× vyšší náklady a 10× delší latenci?“
Pokud ano — jděte do toho. Pokud ne — ušetřete peníze a nasaďte je jinam.
Chcete pomoct rozhodnout, který model dává smysl pro váš use case? Ozvěte se nám na Dreamind — tohle rozhodnutí děláme s klienty pravidelně.