impetroAIAI Digest

Archiv

47 vydání v archivu · filtrujte podle zdroje, tématu nebo data.

Zrušit

1 novinka · zobrazeno 1–1

úterý 4. srpna 2026

The Inference Engineering Masterclass — Philip Kiely & Ali Taha, Baseten

Newsletter Latent Space přináší 101minutový rozhovor s Philipem Kielym a Ali Tahou z Basetenu (po jejich 13miliardovém Series F) o inference engineeringu – jak se natrénované váhy modelu mění na rychlé, spolehlivé produkční API. Probírají cache-aware routing, oddělení prefill/decode na různé GPU, kvantizaci (kde kombinace chyb napříč vrstvami zvýšila propustnost o 20 % u GLM-5.2 při zachování kvality), spekulativní dekódování, KV-cache a nasazení nových open modelů v den vydání.

Proč to je důležité: Pro firmy nasazující LLM v produkci jde o konkrétní technické postupy ke snížení nákladů a latence inference (kvantizace, cache-aware routing, speculative decoding), nikoli o hype – zároveň potvrzuje, že inference infrastruktura je samostatný, rychle rostoucí obor s velkými investicemi.