Benckmarks Are Died
OpenAI vydalo model GPT-6 Astra a prezentuje ho jako vstup do „éry AGI“ s výrazným posunem v ovládání počítače, kódování, výzkumu a dlouhých, méně dohlížených úkolech. Autor newsletteru argumentuje, že klasické benchmarky (otázka – předem daná správná odpověď) fungovaly pro chatboty, ale u agentů, kteří dostanou vágní cíl na skutečném počítači, žádná jednotná „správná“ cesta neexistuje. Zmiňuje neověřené, ale výmluvné zprávy, že OpenAI nakoupilo desítky tisíc spotřebitelských Maců pro trénink pomocí reinforcement learningu a computer-use scénářů. Jako náhradu za žebříčky navrhuje hodnocení podobné stáži – dát agentovi laptop, účet, rozpočet a týden času a sledovat spolehlivost, náklady, rychlost a míru potřebné lidské asistence, ne jen procento úspěšnosti.
Proč to je důležité: Pro firmy je to signál, aby při výběru AI agentů nespoléhaly na marketingová čísla z benchmarků, ale testovaly nasazení na vlastních reálných a „špinavých“ procesech – jde ale zatím spíš o koncepční výzvu než o hotovou metodiku hodnocení.