🛎️ Google Crowned Itself the GOAT
Google DeepMind vydal model Gemini 4 Argon, nejprve kyberbezpečnostním obráncům v programu Fairwind, poté placeným API zákazníkům. Google tvrdí, že model vede v benchmarcích pro programování, agenty a dlouhá videa, před OpenAI Astra a Anthropic Opus 5.5. Bloomberg ale cituje zaměstnance Google, podle kterých model selhává na produkčním kódu a je slabý ve front-endovém designu – interně se tomu říká „benchmaxxing“. Vydání přichází po tom, co slibovaný Gemini 3.5 Pro z května 2026 nikdy nevyšel, přestože šéf DeepMind Koray Kavukcuoglu týden předtím prohlásil, že týmu bezvýhradně věří a že zůstane na špici.
Proč to je důležité: Firmy by měly brát vlastní prohlášení AI labů o „nejlepším modelu“ s rezervou a před nasazením testovat modely na reálném produkčním kódu, ne jen podle benchmarků. Ukazuje to i širší riziko marketingového zkreslování výkonu AI nástrojů, které může ovlivnit nákupní rozhodnutí firem.