impetroAIAI Digest

Archiv

47 vydání v archivu · filtrujte podle zdroje, tématu nebo data.

Zrušit

8 novinek · zobrazeno 1–8

pátek 2. října 2026

[AINews] Gemini 4 Argon: GDM's answer to Astra/Fable, with 1M output

Google DeepMind představil 30. září 2026 model Gemini 4 Argon, svou odpověď na konkurenční modely třídy Astra/Fable, zatím jen v omezeném přístupu pro vládní uživatele a kyberbezpečnostní experty v programu Fairwind. Model díky funkci Long Decode Continuation jako první v oboru zvládá výstup až 1 milion tokenů (oproti dřívějším 64 tisícům) a podle Google obsadil první místo v 13 z 19 sledovaných benchmarků proti GPT-6 Astra a Claude Opus 5.5 (např. 77,9 % na DeepSWE). Standardní cena je 4 USD/20 USD za milion vstupních/výstupních tokenů, se zaváděcí 50% slevou na 2/10 USD. Interně Google uvádí, že agenti na bázi Argonu uvolnili přes 300 TiB paměti datacenter a migrují přes 800 tisíc řádků C/C++ kódu do Rustu; nezávislí pozorovatelé ale zpochybňují některé publikované výsledky (např. nižší skóre v právním benchmarku Harvey oproti Muse Spark 1.2).

Proč to je důležité: Pro české firmy jde o signál, že do enterprise segmentu (kódování, znalostní práce, kybernetická obrana) přichází další silný a cenově konkurenční model, což zvyšuje tlak na ceny API a nabízí nové možnosti pro firemní AI nasazení, byť zatím jen v omezeném přístupu.

🛎️ Google Crowned Itself the GOAT

Google DeepMind vydal model Gemini 4 Argon, nejprve kyberbezpečnostním obráncům v programu Fairwind, poté placeným API zákazníkům. Google tvrdí, že model vede v benchmarcích pro programování, agenty a dlouhá videa, před OpenAI Astra a Anthropic Opus 5.5. Bloomberg ale cituje zaměstnance Google, podle kterých model selhává na produkčním kódu a je slabý ve front-endovém designu – interně se tomu říká „benchmaxxing“. Vydání přichází po tom, co slibovaný Gemini 3.5 Pro z května 2026 nikdy nevyšel, přestože šéf DeepMind Koray Kavukcuoglu týden předtím prohlásil, že týmu bezvýhradně věří a že zůstane na špici.

Proč to je důležité: Firmy by měly brát vlastní prohlášení AI labů o „nejlepším modelu“ s rezervou a před nasazením testovat modely na reálném produkčním kódu, ne jen podle benchmarků. Ukazuje to i širší riziko marketingového zkreslování výkonu AI nástrojů, které může ovlivnit nákupní rozhodnutí firem.

pondělí 28. září 2026

Claude objevil nový enzym, GPT-6 Sol zdražuje AI závod a česká hvězda Nápadu roku

Anthropic nasadil Claude do vlastní mokré laboratoře v Bay Area, kde model přes 950 agentů za 21 hodin prohledal databáze DNA a identifikoval nový enzymatický systém se znaky podobnými CRISPR; fyzické experimenty pak provedli lidé a výsledek čeká na ověření, i když MIT a Broad Institute jej označují za podnětný. Ve stejném týdnu, 22. září, Anthropic vydal Claude Opus 5.5 (rychlejší a o 20 procent levnější než Opus 5) a OpenAI o hodinu později odpověděla modely GPT-6 Sol (kódování, agenti) a Luna (rutinní úlohy), oba za poloviční cenu předchůdců - cenová válka mezi předními AI firmami tak zrychluje. Bezpečnostní firma Irregular navíc zjistila, že Gemini kvůli konfigurační chybě při testu v květnu 2026 pronikl do tří reálných firem, protože fiktivní testovací cíl sdílel jméno se skutečnou společností; Google incident zveřejnil až po sedmi týdnech, po dotazech Wall Street Journal. Na Meta Connect Zuckerberg představil rozšíření AI agenta Muse do chytrých brýlí a nový přívěskový gadget Muse Charm. Český startup PangeAI Marka Miltnera vyhrál soutěž Nápad roku a získal 300 000 Kč za AI model planety Země pro pojišťovny a energetické firmy.

Proč to je důležité: Pro české B2B firmy je klíčový hlavně cenový tlak (levnější a rychlejší modely Claude i GPT-6) a bezpečnostní incident Gemini jako varování před nedostatečně izolovaným testováním agentů s přístupem k internetu - objev enzymu je zatím spíše vědecký příslib než okamžitě využitelný byznys case.

úterý 22. září 2026

🛎️ A Coward with A Price List

Hlavní příběh popisuje, jak Anthropic 361 dní odmítal začlenit čtení souboru AGENTS.md do Claude Code, přestože jej konkurenti čtou už dávno, a požadavek nejprve uzavřel bez řešení. Ke změně došlo až po veřejném prohlášení CEO Shopify, že by mohl přejít jinam; výsledná oprava byla menší, než bylo slíbeno, a velké korporace z ní byly záměrně vyloučeny. Vydání dále pokrývá launch modelu Jev od TypeSafe AI (15. září), který dosahuje 5-18× vyšší rychlosti než OpenAI Luna za nižší cenu (0,042 USD za milion tokenů). Třetí klíčová část se týká bezpečnostního incidentu: voják použil AI k analýze manifestu bez ověření a téměř vyvolal vojenský zásah, který zastavilo jen opakované pročtení jedním analytikem.

Proč to je důležité: Pro český B2B trh ukazuje, že dostupná cena a rychlost mohou trumfnout technologickou sofistikovanost. Zároveň odhaluje kritické riziko v řízení AI: organizace berou výstupy AI jako fakta bez vlastního ověření, což v citlivých oblastech znamená vážné riziko.

úterý 8. září 2026

The Frontier AEO Tracker: What Astra Chooses (and every other frontier model, and what you can do about it)

Latent.Space představil Frontier AEO Tracker, který testuje 7 frontier modelů v 6 variacích promptů napříč 161 kategoriemi (od coding agentů po payroll software), přičemž extrakci odpovědí a skórování provádí model označovaný jako Astra. Proprietární AEO skóre zohledňuje první volby, alternativy i zmínky a penalizuje negativní doporučení; 28 ze 161 kategorií má napříč modely jednoznačně dominantního vítěze. Analýza odhalila výrazné rozdíly mezi generacemi modelů od stejné laboratoře (např. přechod Sol→Astra a Opus→Fable) i tzv. soft bias, kdy model často preferuje produkt vlastní firmy (Claude Code, Codex, Cursor apod.). Anthropic modely prohledávají výrazně více zdrojů (medián 11 u Opus, 15 u Fable) než konkurence (Sol 9, Astra 5 zdrojů), ale Astra je zároveň mnohem sebejistější a méně mění odpověď při přeformulování dotazu.

Proč to je důležité: Pro české B2B firmy roste význam AEO jako nového kanálu vedle SEO – pokud AI asistenti doporučují dodavatele a nástroje zákazníkům, firmy musí optimalizovat svůj obsah tak, aby je modely vůbec viděly a doporučovaly.

čtvrtek 3. září 2026

GenAI Works via LinkedIn2. 9.AnthropicClaudeAI modelyCeny API

🎁 Anthropic surprise drops Fable 5.1

Anthropic vydal dva nové modely, Fable 5.1 a Mythos 5.1 – jde o stejný základní model s odlišným nastavením bezpečnostních zábran. Fable 5.1 je dostupný všem, Mythos jen prověřeným týmům v kybernetické bezpečnosti a life sciences. Firma Millennium díky Fable 5.1 po 4-5 letech odhalila chybu, která se projevovala jen jednou z milionu běhů a kterou přehlédl i předchozí Fable 5 – model rozebral knihovnu třetí strany a spároval ji s výpisem paměti (core dump). Klíčová je ale změna cen: čtení z cache kleslo o 75 %, což typické náklady sníží asi o 25 % a u agentových úloh až o 45 %.

Proč to je důležité: Pro firmy nasazující AI agenty jde o okamžitou úsporu nákladů, ne jen o hype z benchmarků – vyplatí se přepočítat aktuální API výdaje. Oddělení Mythos pro regulované obory (kyberbezpečnost, life sciences) signalizuje, že Anthropic cílí na enterprise nasazení s přísnějšími požadavky.

[AINews] Muse Spark 1.3 matches GPT-5.6-Sol, confirming Meta Superintelligence as the newest Frontier Lab, >90% discount for data sharing

Meta vydala model Muse Spark 1.3, který je dle žebříčku AAII nyní 3. nejlepší model na světě a v benchmarcích (např. MRCR 512k-1m s 98,1 %) se vyrovná GPT-5.6-Sol a Claude Opus 5, zejména v kódování a agentních úlohách. Zuckerberg oznámil až o 90 % nižší cenu pro uživatele, kteří svolí ke sdílení dat pro trénink, a slíbil brzké uvolnění otevřených vah. Google představil Gemini 3.8 Flash Cyber, specializovaný bezpečnostní model s 86,2 % na CyberGym a 47,2 % na CWE-Bench. Anthropic vydal Claude Fable 5.1, který zvýšil skóre na Terminal-Bench 4.0 ze 42,0 % na 55,8 % a snížil náklady na cache o 75 %. Newsletter dále zmiňuje nové Stanfordské kurzy o agentic softwarovém inženýrství, výzkum HarnessDev a žebříčky Qwen 3.8 a Wan 3.0 ve videu.

Proč to je důležité: Rychlé dohánění uzavřených frontier modelů open-weight konkurencí (Meta, Alibaba) snižuje náklady nasazení AI a rozšiřuje výběr pro firmy, zatímco specializované modely jako Gemini Cyber ukazují tlak směrem k bezpečnostním use-case.

[AINews] Claude Fable/Mythos 5.1: new SOTA model, 75% cache price cut but 70% more output tokens

Anthropic 1. září 2026 vydal Claude Fable 5.1 a Mythos 5.1, nové vlajkové modely pro programování a znalostní práci s kontextovým oknem 1 milion tokenů a podporou obrázků. Ceny za vstup/výstup/cache write zůstávají stejné ($10/$50/$12,5 za milion tokenů), ale cena za čtení z cache klesla o 75 % na $0,25 za milion tokenů. Podle Artificial Analysis model dosáhl skóre 66 v Intelligence Index (Opus 5 má 63) a 52,6 % na Terminal-Bench-Science oproti 24,7 % u Fable 5, kvůli 1,7x vyššímu počtu výstupních tokenů ale celkové náklady na úlohu vzrostly o cca 20 % i přes úsporu z cache. Komunita spekuluje, že Fable a Mythos 5.1 sdílejí stejné váhy a liší se jen prahem bezpečnostního filtru s fallbackem na Opus 4.8 u cca 4 % výstupních tokenů. Anthropic zároveň zavedl Enterprise Frontier Safeguards pro sledování agentů, uživatelé si ale stěžují na přísnější rate limity a falešně pozitivní bezpečnostní zásahy.

Proč to je důležité: Pro firmy nasazující AI agenty je klíčové výrazné zlevnění cache čtení u dlouhých relací, ale je nutné počítat s vyššími celkovými náklady na úlohu kvůli delším výstupům a zohlednit nové podnikové bezpečnostní kontroly (ZDR, EFS) při výběru dodavatele.