impetroAIAI Digest

Archiv

47 vydání v archivu · filtrujte podle zdroje, tématu nebo data.

Zrušit

2 novinky · zobrazeno 1–2

pátek 4. září 2026

Benckmarks Are Died

OpenAI vydalo model GPT-6 Astra a prezentuje ho jako vstup do „éry AGI“ s výrazným posunem v ovládání počítače, kódování, výzkumu a dlouhých, méně dohlížených úkolech. Autor newsletteru argumentuje, že klasické benchmarky (otázka – předem daná správná odpověď) fungovaly pro chatboty, ale u agentů, kteří dostanou vágní cíl na skutečném počítači, žádná jednotná „správná“ cesta neexistuje. Zmiňuje neověřené, ale výmluvné zprávy, že OpenAI nakoupilo desítky tisíc spotřebitelských Maců pro trénink pomocí reinforcement learningu a computer-use scénářů. Jako náhradu za žebříčky navrhuje hodnocení podobné stáži – dát agentovi laptop, účet, rozpočet a týden času a sledovat spolehlivost, náklady, rychlost a míru potřebné lidské asistence, ne jen procento úspěšnosti.

Proč to je důležité: Pro firmy je to signál, aby při výběru AI agentů nespoléhaly na marketingová čísla z benchmarků, ale testovaly nasazení na vlastních reálných a „špinavých“ procesech – jde ale zatím spíš o koncepční výzvu než o hotovou metodiku hodnocení.

čtvrtek 3. září 2026

[AINews] Muse Spark 1.3 matches GPT-5.6-Sol, confirming Meta Superintelligence as the newest Frontier Lab, >90% discount for data sharing

Meta vydala model Muse Spark 1.3, který je dle žebříčku AAII nyní 3. nejlepší model na světě a v benchmarcích (např. MRCR 512k-1m s 98,1 %) se vyrovná GPT-5.6-Sol a Claude Opus 5, zejména v kódování a agentních úlohách. Zuckerberg oznámil až o 90 % nižší cenu pro uživatele, kteří svolí ke sdílení dat pro trénink, a slíbil brzké uvolnění otevřených vah. Google představil Gemini 3.8 Flash Cyber, specializovaný bezpečnostní model s 86,2 % na CyberGym a 47,2 % na CWE-Bench. Anthropic vydal Claude Fable 5.1, který zvýšil skóre na Terminal-Bench 4.0 ze 42,0 % na 55,8 % a snížil náklady na cache o 75 %. Newsletter dále zmiňuje nové Stanfordské kurzy o agentic softwarovém inženýrství, výzkum HarnessDev a žebříčky Qwen 3.8 a Wan 3.0 ve videu.

Proč to je důležité: Rychlé dohánění uzavřených frontier modelů open-weight konkurencí (Meta, Alibaba) snižuje náklady nasazení AI a rozšiřuje výběr pro firmy, zatímco specializované modely jako Gemini Cyber ukazují tlak směrem k bezpečnostním use-case.