
Co automatizovat ve firmě jako první
První automatizaci vybírejte podle práce, dat, rizika, vlastníka a možnosti návratu zpět. Jeden pilot pak ověřte dříve, než jej rozšíříte.
Třicátého července 2026 snížila OpenAI cenu modelu GPT-5.6 Luna o 80 procent. Vstupní token spadl na 20 centů za milion, výstupní na 1,20 dolaru. Terra zlevnila o pětinu. O šest dní dříve vydal Anthropic Opus 5 za stejnou cenu, jakou měla předchozí generace, přičemž podle vlastních měření firmy zvládne více než dvojnásobek úloh. Google mezitím představil Gemini 3.6 Flash, který na srovnatelnou práci spotřebuje o 17 procent méně výstupních tokenů.
Když se člověk dívá jen na ceníky, vypadá to jako nejlepší měsíc pro firmy, které za AI platí.
Účetnictví říká něco jiného. Průzkum State of FinOps 2026, do kterého se zapojilo 1 192 odborníků spravujících více než 83 miliard dolarů ročních výdajů na cloud, zjistil, že 73 procent organizací překročilo svůj rozpočet na AI. Průměrný firemní rozpočet na AI přitom mezi lety 2024 a 2026 vyrostl z 1,2 milionu na 7 milionů dolarů ročně.
Ceny klesají. Účty rostou. Obojí platí zároveň a důvod stojí za pochopení dřív, než budete schvalovat další AI projekt.
Za jediný měsíc vydala čtyři velká laboratoře vlajkové nebo téměř vlajkové modely a k tomu přibyly největší otevřené váhy, jaké kdy někdo zveřejnil.
Na menší obrazovce posuňte tabulku vodorovně.
| Model | Vydání | Vstup / výstup za 1 M tokenů | Kontext |
|---|---|---|---|
| GPT-5.6 Sol | 9. července | 5 / 30 USD | 1 M |
| GPT-5.6 Terra | 9. července, zlevněno 30. července | 2 / 12 USD | 1 M |
| GPT-5.6 Luna | 9. července, zlevněno 30. července | 0,20 / 1,20 USD | 1 M |
| Grok 4.5 | 8. července | 2 / 6 USD | 500 K |
| Kimi K3 | 16. července, váhy 27. července | 3 / 15 USD | 1 M |
| Gemini 3.6 Flash | 21. července | 1,50 / 7,50 USD | 1 M |
| Claude Opus 5 | 24. července | 5 / 25 USD | 1 M |
Kimi K3 od Moonshotu je s 2,8 bilionu parametrů největší otevřeně dostupný model. Celý balík vah má kolem 1,56 TB, takže ho ve vlastní serverovně rozběhne málokdo. Podstatné je něco jiného. Modely, které ještě před rokem patřily do horní cenové hladiny, jsou dnes ve středu tabulky.
Když GPT-4 v březnu 2023 debutoval, stál vstupní milion tokenů 30 dolarů. Koncem července 2026 se dá srovnatelná kvalita koupit za 14 centů. To je 214násobné zlevnění za 40 měsíců, tedy deflační křivka, jakou podnikový software nikdy předtím nezažil.
Rozpočty přesto praskají. Vysvětlení není v ceníku, ale v tom, jak se modely dnes používají.
Chatbot dostane otázku a vrátí odpověď. Jedno volání, jedna fakturovaná dávka tokenů. Agentický workflow, který zpracuje příchozí fakturu, si vyžádá dokument, klasifikuje ho, vytáhne položky, ověří je proti objednávce, zkontroluje rozpor a napíše návrh odpovědi. To je klidně dvacet volání na jeden dokument. Stejná cena tokenu, dvacetinásobná spotřeba.
K tomu se přidávají uvažovací modely. Ty před odpovědí generují vnitřní myšlení, které nevidíte, ale platíte za něj jako za výstup. Pět set viditelných slov v odpovědi může mít za sebou desítky tisíc fakturovaných tokenů.
Analytik Jacob Bourne to pro VentureBeat shrnul stručně. „The era of tokenmaxxing is over. Enterprises have figured out how easy it is to burn tokens without getting value back.“
Přestaňte porovnávat cenu za milion tokenů. Porovnávejte cenu za dokončenou úlohu.
Rozdíl mezi těmi dvěma čísly je větší, než se zdá, a nejlépe to jde vidět na zveřejněných měřeních z benchmarku SWE-Bench Pro. Grok 4.5 vyřeší průměrnou úlohu za 15 954 výstupních tokenů. Opus 4.8 v režimu maximálního úsilí potřebuje 67 020 tokenů.
Na menší obrazovce posuňte tabulku vodorovně.
| Model | Cena výstupu za 1 M | Výstupní tokeny na úlohu | Výstup na jednu úlohu |
|---|---|---|---|
| Grok 4.5 | 6 USD | 15 954 | 0,10 USD |
| Opus 4.8 (max) | 25 USD | 67 020 | 1,68 USD |
Ceníkový rozdíl je 4,2násobný. Rozdíl ve spotřebě je také zhruba 4,2násobný. Jenže ty dva násobky se nesčítají, ale násobí, takže reálný rozdíl na jedné úloze je přibližně sedmnáctinásobný.
Berte to jako ilustraci mechaniky, ne jako verdikt o modelech. Jsou to publikovaná benchmarková čísla, ne naše měření, a na jiné úloze vyjde pořadí jinak. Důležitý je princip. Spotřeba tokenů je druhá polovina ceny a většina firem ji vůbec nesleduje.
Laboratoře to už vědí. Proto Google u Gemini 3.6 Flash inzeroval o 17 procent nižší spotřebu výstupních tokenů jako hlavní vylepšení. Ne vyšší inteligenci. Menší upovídanost.
Druhá změna z července je méně viditelná a v praxi důležitější. Model už není jedna věc s jednou cenou.
Opus 5 přišel s nastavitelnou úrovní úsilí. Nízká, střední nebo vysoká. Stejná otázka, stejný model, jiná spotřeba i jiná odpověď. GPT-5.6 Sol dostal rychlý režim, který běží asi 2,5krát rychleji za dvojnásobnou cenu. Grok 4.5 účtuje jinak pod hranicí 200 tisíc tokenů kontextu a jinak nad ní, přičemž při překročení se přeceňuje celý požadavek.
Prakticky to znamená, že rozhodnutí „použijeme tento model" už není jedno rozhodnutí. Je to model, úroveň úsilí, velikost kontextu a způsob cachování. Firma, která si to nastaví jednou a nechá být, platí za třídění e-mailů stejným režimem jako za analýzu smlouvy.
Faktura od poskytovatele vám řekne, kolik jste utratili. Neřekne vám, který workflow to utratil. Označte volání podle procesu, který je vyvolal, a sledujte cenu za zpracovaný dokument, za vyřízený ticket nebo za připravenou nabídku. Teprve tohle číslo se dá porovnat s prací člověka.
V červenci se pořadí na ceníku změnilo třikrát. Pokud je model konstanta rozsypaná po dvaceti souborech, každá změna je projekt. Pokud je to jedna konfigurační hodnota za rozhraním, je to úprava na deset minut. Tohle je nejlevnější pojistka, jakou si umíte koupit, a stojí vás jedno odpoledne.
Bez třiceti až padesáti reálných případů s očekávaným výsledkem je přechod na levnější model hazard. S nimi je to otázka jednoho měření. Tato sada je zároveň jediná obrana proti tichému zhoršení kvality po aktualizaci modelu.
Alert na celkovou měsíční útratu vás upozorní, když je pozdě. Limit na počet volání a tokenů v jednom běhu agenta zastaví smyčku, která se zacyklila, ještě ten den. Většina drahých překvapení není pomalý růst, ale jedna chyba, která běžela přes víkend.
Cachovaný vstup stojí u většiny poskytovatelů zlomek běžné sazby. Grok 4.5 účtuje cachovaný vstup za 0,50 dolaru místo dvou. U agenta, který v každém kroku posílá stejný systémový kontext, to není detail. A na klasifikaci, routing či extrakci polí stačí nejlevnější třída modelů, která je dnes téměř zadarmo.
Pro firmu s dvaceti lidmi není rozdíl mezi pěti dolary a dvaceti centy za milion tokenů tím, co rozhodne o návratnosti projektu. Při běžné zátěži jde o desítky eur měsíčně.
Váha je jinde. Pokud výměna modelu znamená přepsat dvacet souborů, každé zlevnění na trhu je vám k ničemu, protože se k němu prostě nedostanete. Druhá věc je viditelnost. Firma, která umí na požádání říct, kolik ji stojí zpracování jedné faktury, dokáže to číslo taky stlačit. Firma, která to neví, se o rostoucí spotřebě dozví až z faktury.
Trh se bude hýbat i dál. Za poslední měsíc zlevnila střední třída o pětinu, spodní o čtyři pětiny a vlajkové modely zdražily. Firmy, které si postavily AI jako vyměnitelnou součástku, na tom vydělají. Firmy, které si vybraly jednoho dodavatele a zabetonovaly ho do kódu, budou platit za rozhodnutí z minulé sezony.
V Rise.sk stavíme automatizace a AI workflow tak, aby se model dal vyměnit bez zásahu do architektury. Cenu za zpracovanou jednotku měříme od prvního dne. Pokud potřebujete zjistit, kolik vás dnes stojí jeden proces a jestli se to dá zlevnit, ozvěte se.

První automatizaci vybírejte podle práce, dat, rizika, vlastníka a možnosti návratu zpět. Jeden pilot pak ověřte dříve, než jej rozšíříte.
GrantAI sleduje grantové výzvy, páruje je s profilem firmy, připraví analýzu oprávněnosti a draft žádosti. Demo a pilot pro grantové týmy.
Poradenské týmy ztrácejí marži tehdy, když každá nová výzva začíná ručním čtením, interní debatou a opakovaným ověřováním profilů klientů. V článku ukazujeme, jak GrantAI zkracuje grant screening, aniž by odstraňoval expertní review.