impetroAIAI Digest

Archiv

47 vydání v archivu · filtrujte podle zdroje, tématu nebo data.

Zrušit

4 novinky · zobrazeno 1–4

pátek 2. října 2026

[AINews] Gemini 4 Argon: GDM's answer to Astra/Fable, with 1M output

Google DeepMind představil 30. září 2026 model Gemini 4 Argon, svou odpověď na konkurenční modely třídy Astra/Fable, zatím jen v omezeném přístupu pro vládní uživatele a kyberbezpečnostní experty v programu Fairwind. Model díky funkci Long Decode Continuation jako první v oboru zvládá výstup až 1 milion tokenů (oproti dřívějším 64 tisícům) a podle Google obsadil první místo v 13 z 19 sledovaných benchmarků proti GPT-6 Astra a Claude Opus 5.5 (např. 77,9 % na DeepSWE). Standardní cena je 4 USD/20 USD za milion vstupních/výstupních tokenů, se zaváděcí 50% slevou na 2/10 USD. Interně Google uvádí, že agenti na bázi Argonu uvolnili přes 300 TiB paměti datacenter a migrují přes 800 tisíc řádků C/C++ kódu do Rustu; nezávislí pozorovatelé ale zpochybňují některé publikované výsledky (např. nižší skóre v právním benchmarku Harvey oproti Muse Spark 1.2).

Proč to je důležité: Pro české firmy jde o signál, že do enterprise segmentu (kódování, znalostní práce, kybernetická obrana) přichází další silný a cenově konkurenční model, což zvyšuje tlak na ceny API a nabízí nové možnosti pro firemní AI nasazení, byť zatím jen v omezeném přístupu.

Google's frontier comeback starts with cyber

Google ve středu představil nový frontier model Gemini 4 Argon, který podle firmy dosahuje špičkových výsledků v softwarovém inženýrství, znalostní práci i v oblastech jako právo a finance. Model se nejdřív nasadí v programu Fairwind pro kybernetické obránce a zároveň prochází dobrovolnými bezpečnostními kontrolami americké vlády před veřejným vydáním. Google uvádí, že Argon překonal předchozí generaci Gemini 3.8 Flash Cyber v úkolech jako reálné hledání zranitelností a penetrační testování. V podcastu Deep View Conversations CrowdStrike (Adam Meyers) popsal, jak AI mění rovnováhu sil mezi útočníky a obránci a jak firma trénuje útočné a obranné modely proti sobě na bázi Nvidia Nemotron. Vydání dále zmiňuje sondu FTC proti OpenAI a Anthropic kvůli možným škodám pro spotřebitele a vyjádření Sama Altmana, že OpenAI nepůjde na burzu, dokud nebudou modely bezpečné.

Proč to je důležité: Pro české B2B firmy to signalizuje zrychlující se konkurenci mezi frontier modely, kde vedle výkonu začíná rozhodovat i cena, a rostoucí tlak regulátorů (FTC) i bezpečnostní rizika spojená s AI agenty.

🛎️ Google Crowned Itself the GOAT

Google DeepMind vydal model Gemini 4 Argon, nejprve kyberbezpečnostním obráncům v programu Fairwind, poté placeným API zákazníkům. Google tvrdí, že model vede v benchmarcích pro programování, agenty a dlouhá videa, před OpenAI Astra a Anthropic Opus 5.5. Bloomberg ale cituje zaměstnance Google, podle kterých model selhává na produkčním kódu a je slabý ve front-endovém designu – interně se tomu říká „benchmaxxing“. Vydání přichází po tom, co slibovaný Gemini 3.5 Pro z května 2026 nikdy nevyšel, přestože šéf DeepMind Koray Kavukcuoglu týden předtím prohlásil, že týmu bezvýhradně věří a že zůstane na špici.

Proč to je důležité: Firmy by měly brát vlastní prohlášení AI labů o „nejlepším modelu“ s rezervou a před nasazením testovat modely na reálném produkčním kódu, ne jen podle benchmarků. Ukazuje to i širší riziko marketingového zkreslování výkonu AI nástrojů, které může ovlivnit nákupní rozhodnutí firem.

Academia is for Ambition — Alex Zhang, MIT

Latent Space mluví s Alexem Zhangem, PhD studentem MIT a autorem konceptu Recursive Language Models (RLM), podle kterého jsou modely mnohem výkonnější, když mohou se svým vlastním promptem pracovat jako s externím objektem mimo kontextové okno. Diskutují Prime Agent od Prime Intellect – samoučící se RLM harness, který jako první vyřešil ARC-AGI-3 ještě před OpenAI Astrou – a nový koncept Context Language Models (CLM) od Rulin Shao, kde si model spravuje kontext sám bez pevného harnessu. Probírají také AI generované GPU kernely (GPT-5.6 údajně snížil náklady na Tera a Luna kernely o 80 %), OpenAI experiment s 10 000 agenty a 130 miliardami výstupních tokenů (~40 mil. USD ekvivalent výpočtu) a proč mají Claude Code, Codex a Pi strukturálně podobný harness design.

Proč to je důležité: Konkurenční výhoda se čím dál víc přesouvá z volby LLM na architekturu kolem něj – správu kontextu a multi-agentní orchestraci – firmy by měly sledovat vývoj harness designu, i když jde zatím o rané výzkumné koncepty, ne hotová produkční řešení.