AINews (swyx)15. 9.AI bezpečnostRegulace AIAnthropicAEF-1
[AINews] AEF-1 standard emerges for Third Party Evaluators, as Xai, OpenAI, and Anthropic all cosign
AI Evaluator Forum (vznikl v prosinci 2025) zveřejnil standard AEF-1, který definuje očekávání na nezávislé třetí strany hodnotící bezpečnost frontier AI modelů - pravidla pro přístup, střet zájmů, financování, rekuzaci a transparentnost. Anthropic v reakci jednostranně slíbil dát týmům jako METR trvalý přístup srovnatelný s interními zaměstnanci - vlastní stůl, přístupovou kartu i firemní notebook a přístup k tréninkovým pipelinám, ne jen hotovým modelům. Šéf Anthropicu Dario Amodei navazuje na červencový dopis o tempu vývoje AI a navrhuje tři pilíře: zabudované evaluátory, demokratickou koordinaci mezi laboratořemi a globální koordinaci včetně Číny. Zároveň se rozhořela debata - Bilal Chughtai opustil Google DeepMind s výzvou ke zpomalení, Dan Selsam varuje, že modely si mohou uvědomovat testování a předstírat soulad, zatímco Sayash Kapoor a Lennart Heim argumentují, že jde spíš o problém kontroly a bezpečnostního inženýrství než nutnost zpomalovat vývoj.
Proč to je důležité: Pro firmy nasazující AI modely od OpenAI, Anthropicu či xAI to signalizuje přicházející rámec externího auditu bezpečnosti, na který se bude možné odkazovat při compliance a due diligence dodavatelů AI; zatím jde o dobrovolný závazek, ne regulaci.
AI For Work15. 9.AnthropicOpenAIRegulace AIApple Siri
How AI slow-down rhetoric shook the industry
Šéf Anthropicu Dario Amodei zveřejnil esej „We Must Pace the Frontier“ vyzývající ke zpomalení vývoje frontier AI, s čímž souhlasili i Sam Altman (OpenAI) a Elon Musk. Akcie AI firem v pondělí klesly (Intel -6 %, Nvidia přes -3 %), prezident Trump esej kritizoval na Truth Social a čínské ministerstvo zahraničí ho označilo za „fearmongering“. Anthropic, Google a OpenAI již dříve jednaly o vytvoření standardizačního orgánu pro AI bezpečnost, zatímco poradce Bílého domu David Sacks obvinil Anthropic a OpenAI z pokrytectví kvůli jejich „duopolu na frontier inteligenci“. Souběžně Apple spustil iOS 27 s dlouho očekávaným upgradem Siri (osobní kontext, konverzační dotazy, aplikace Siri AI, expresivní hlasy), dostupným od iPhone 15 Pro výše.
Proč to je důležité: Pro B2B firmy jde spíš o politický a mediální šum než o okamžitou akci - regulace ani tempo vývoje modelů se zatím reálně nemění, ale je vhodné sledovat, zda rétorika povede ke skutečnému zpomalení uvolňování nových modelů.
Futurepedia15. 9.ChatGPT 6OpenAIAutomatizaceProduktivita
ChatGPT 6 Turns One Prompt Into a Live Website
Nový model ChatGPT 6 s kódovým označením Astra dokáže na základě jednoho detailního promptu vytvořit interaktivní vícestránkovou stránku (např. onboarding guide pro nové zaměstnance) a rovnou ji publikovat jako živý sdílený odkaz přes ChatGPT Sites. Model si pamatuje celý projekt, umí uprostřed tvorby reagovat na opravy bez nutnosti začínat znovu a k dispozici je nastavení úrovně uvažování (Light až Ultra) - doporučeno High, Max může trvat přes hodinu. Astra je dostupná na Plus, Pro, Business a Enterprise plánech, na free plánu zatím chybí, a intenzivní tvorba rychle spotřebovává limity použití. Stejný postup lze využít i pro marketingové vysvětlovače, prodejní one-pagery, self-service podporu nebo interaktivní výukové materiály.
Proč to je důležité: Firmy mohou nahradit opakované manuální vysvětlování (onboarding, podpora, prodejní materiály) jedním živým odkazem, což šetří čas týmů - jde o reálně použitelnou funkci, ne jen hype, ale vyžaduje placený plán a je třeba výstup před sdílením ručně zkontrolovat.
Latent Space (swyx)15. 9.AI agentiReinforcement learningGood Start LabsTrénink modelů
Can Skills Learned in Games Transfer to Real-World Work?
Startup Good Start Labs (spin-off z Every, 3,6 mil. USD od General Catalyst a dalších) trénuje AI modely na hrách jako Diplomacy a 1830: The Game of Railroads, aby jim předal přenositelné dovednosti jako strategické plánování. U hry 1830 zlepšil trénink 30B modelu výkon na Finance-Agent benchmarku, ale jen když šlo o multi-turn terminálového agenta s nástroji, nikoli u jednoduchého single-turn Q&A. Firma prodává frontier labům trajektorie agentů a herní prostředí jako RL data, anonymizovaná a bez osobních údajů. CEO Alex Duffy uvádí, že u novějších modelů (GPT-6 Astra, Claude Fable 5.1) záleží spíš na designu harness a prostředí než na samotné síle modelu.
Proč to je důležité: Ukazuje konkrétní metodu, jak firmy mohou vylepšovat agentní AI pro byznys úlohy (finance, zákaznická podpora) pomocí simulovaných prostředí místo drahého fine-tuningu na reálných datech - zatím jde ale o rané, nepotvrzené přenositelnosti napříč doménami.