impetroAIAI Digest

Archiv

47 vydání v archivu · filtrujte podle zdroje, tématu nebo data.

Zrušit

2 novinky · zobrazeno 1–2

středa 26. srpna 2026

🛎️ Token Costs Slashed 35x

Nvidia oznámila plnou výrobu čipu Groq 3 LPX, prvního čipu vzniklého z loňské akvizice startupu Groq za 20 miliard dolarů. Odpověď o délce 5000 tokenů, která dříve trvala 50 sekund, nyní trvá 1,5 sekundy, což odpovídá 35násobnému snížení nákladů na generování tokenů. Prvním cloudovým zákazníkem čipu je Nebius. Nižší latence odstraňuje čekání jako hlavní překážku u AI agentů, kteří potřebují deset a více kroků uvažování.

Proč to je důležité: Pro firmy to znamená, že agentní workflow a produkty, které byly dosud kvůli ceně a latenci nerentabilní, se najednou stávají ekonomicky proveditelné – jde o reálný posun v infrastruktuře dostupný už nyní, ne jen o hype.

pondělí 24. srpna 2026

How Crusoe makes scaling AI less painful

Crusoe vlastní celý technologický stack od energetiky přes datacentra až po cloud, což podle firmy umožňuje rychlejší a levnější AI inference. Technologie MemoryAlloy dosahuje 9,9krát rychlejšího time-to-first-token a 5krát vyššího throughputu oproti vLLM na modelu GPT-OSS-120B od OpenAI. Firma nabízí Managed Intelligence portfolio – Serverless Inference, Tailored Deployments, Self-serve Deployments a Serverless Fine-Tuning – v rámci platformy Intelligence Foundry. Podle odhadu Gartner mají náklady na provoz AI agentů kvůli rostoucí spotřebě tokenů do roku 2028 vzrůst pětinásobně.

Proč to je důležité: Jde o placený partnerský obsah, ne nezávislou recenzi, ale ukazuje reálný trend – firmy budou muset řešit rostoucí náklady na inference u agentních AI workflow už teď, nejen v budoucnu.