The Evolution of the Agent Harness
Esej Latent.Space popisuje, jak se od konce roku 2025 AI agenti výrazně zlepšili díky souhře modelu a tzv. harness (nástroje, kontext, oprávnění kolem modelu). Harness-Bench ukázal, že stejný model dosáhl na 106 úlohách skóre od 52,4 do 76,2 jen díky změně harness. OpenAI ztrojnásobilo skóre modelu na ARC-AGI-3 (z 13,3 % na 38,3 %) přidáním retained reasoning a komprese kontextu. Podle Anthropic tým nedávno smazal 80 % systémového promptu Claude Code, protože schopnosti harness se postupně vstřebávají přímo do modelu. Autor předpovídá, že firmy začnou publikovat „attention policy“ dokumenty, které budou definovat, kdy smí agent vyrušit člověka a která rozhodnutí zvládne sám.
Proč to je důležité: Pro české firmy nasazující AI agenty je klíčové sledovat kvalitu harness (oprávnění, správu kontextu, kompresi), ne jen výběr modelu – rozdíly v efektivitě agenta jsou často dané právě tímto obalem.