Dnešné širšie pokrytie siaha od otvoreného generovania videa so zvukom a sandboxov pre agentov až po výskum pamäte, bezpečnosti a rekurentnej hĺbky modelov. Výsledky preprintov, merania dodávateľov a komunitné experimenty zostávajú pripísané svojim vydavateľom.

Nové modely a vydania

KandinskyLab vydáva váhy na generovanie videa so zvukom. Kandinsky 6.0 Lite a Pro generujú päťsekundové klipy so synchronizovaným zvukom z textu alebo prvého snímku; váhy a kód verzie Lite s 3 miliardami parametrov majú licenciu MIT, zatiaľ čo repozitár verzie Pro s 29 miliardami parametrov má obmedzený prístup. Kontrolovateľné artefakty Lite dávajú vydaniu význam napriek hodnoteniam vykonaným autormi. Priamy zdroj: huggingface.co/kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers

GPT-6 prichádza ku všetkým používateľom ChatGPT. OpenAI uvádza, že nový model sa celosvetovo zavádza s funkciou „Intelligent UI“, ktorá dokáže vytvárať interaktívne prvky odpovede, a spolu s ním sa zmenil alias API chat-latest. Oznámenie nesprevádzala technická správa ani karta modelu, preto ide skôr o nasadenie produktu než o hodnotiteľné vydanie modelu. Priamy zdroj: openai.com

Výskum

Queen prepája šachové pozície s jazykovými vysvetleniami. Výskumníci z Princetonu spájajú šachový enkóder so 4 miliardami parametrov s jazykovým modelom cez krížovú pozornosť, aby zachovali silnú hru a zároveň vysvetľovali ťahy. Autori uvádzajú približne veľmajstrovskú úroveň, čo poskytuje kontrolovateľný test, či strategické reprezentácie dokážu podporiť jazyk. Priamy zdroj: arxiv.org

SafeActBench meria prechod od dôkazu k bezpečnému konaniu. Benchmark testuje, či model, ktorý dokáže rozpoznať riziko, primerane zmení aj svoje správanie. Toto rozlíšenie je dôležité pre systémy, ktorých bezpečnostné hodnotenia sa končia pri slovnom uvedomení. Priamy zdroj: arxiv.org

Memadapter skúma súhlas vyvolaný pamäťou. Preprint skúma, ako môžu vyhľadané spomienky viesť asistenta k nasledovaniu skorších tvrdení aj vtedy, keď odporujú aktuálnym dôkazom. Práca si zaslúži pozornosť, pretože trvalá pamäť agenta môže zosilňovať pritakávanie naprieč reláciami. Priamy zdroj: arxiv.org

Slučkové modely sa približujú k stabilným vnútorným stavom. Výskumníci opakovane aplikujú zdieľané bloky modelu a analyzujú, kedy skrytý stav konverguje k pevnému bodu. Uvádzané prínosy pre rýchlosť a trénovanie zostávajú výsledkami autorov, no mechanizmus ponúka konkrétne vysvetlenie výpočtu cez rekurentnú hĺbku. Priamy zdroj: arxiv.org

Multilingual GSM-Symbolic testuje uvažovanie mimo angličtiny. Dataset mení matematické úlohy pre základné školy medzi jazykmi a symbolickými formami, aby oddelil zapamätanú formuláciu od výpočtu. Viacjazyčným hodnoteniam dáva kontrolovanejší záťažový test než preložené pevné otázky. Priamy zdroj: arxiv.org

LoopCD pristupuje k hĺbke modelu ako k spojitému procesu. Metóda trénuje opakovaný blok, aby reprezentácie vylepšoval v premenlivom počte krokov namiesto samostatných parametrov pre každú vrstvu. Práca pomáha porovnávať rekurentný výpočet s bežnou hĺbkou pri rovnakom rozpočte parametrov. Priamy zdroj: arxiv.org

Techniky promptovania

Terse udržiava stručný štýl Claude Code. Plugin združuje pravidlá odpovedí, konvencie dokumentov, pokyny pre subagentov a merač kontextu; autor v teste s 20 promptmi uvádza o 46–54 % menej slov. Výsledky nákladov a štýlu si meral sám, no repozitár je praktickým príkladom presunu trvalého správania do pluginu. Priamy zdroj: github.com/lowenbjer/claude-terse

Prednáška AWS rozlišuje štyri operácie s kontextom. Elizabeth Fuentes Leone zoskupuje prácu agentov s kontextom na externalizáciu, výber, kompresiu a izoláciu informácií a ukazuje ich pomocou Strands Agents. Prepis sa nekontroloval, preto je anglické video skôr ukazovateľom techniky než overeným benchmarkom. Priamy zdroj: youtube.com

Čo ľudia tvoria

nanoMuse spája samohostovaného agenta v telefóne a počítači. Projekt s licenciou GPL kombinuje klientov pre Android, počítač a web s upraviteľnou pamäťou v Markdowne a schvaľovaním dôsledných krokov. Novinkou je verzia 0.1.41; tvrdenia o bezpečnosti a schopnostiach zostávajú tvrdeniami tímu. Priamy zdroj: github.com/nano-muse/nanoMuse

Prehliadač ukazuje každé číslo v malom GPT. Vizualizácia Manogyu Singha počíta dopredný priechod miniatúrneho transformera, spätné šírenie a jeden krok posilňovaného učenia s kontrolovateľnou aritmetikou. Ide o učebný materiál, nie novú metódu, a repozitár zatiaľ nemá licenčný súbor. Priamy zdroj: github.com/manogyasingh/transformer-visualisation

Klon SimCity vytvorený agentmi vyvoláva otázky o overení. Autor uvádza, že Claude Opus 5.5 použil 27 subagentov na preklad pôvodného kódu PowerPC do verzie WebGL približne za dve hodiny a následne porovnával stav hry cez emulátor. Hrateľná ukážka existuje, no proces a tvrdenia o vernosti nie sú overené a repozitár sa nenašiel. Priamy zdroj: dator.dev

Stojí za prečítanie

Cloudflare ponecháva zhromažďovanie dôkazov mimo modelu. Jeho návrh bezpečnostných operácií vykonáva pevný prieskum v kóde a potom úzkym agentom poskytuje dôkazy s explicitnými stavmi neprítomných, prítomných a nekontrolovaných dát. Opis nemá údaje o presnosti produktu, no oddelenie zberu a posudzovania sa dá preniesť inde. Priamy zdroj: blog.cloudflare.com

Konfliktné trénovacie hodnoty môžu potlačiť uvedené uvažovanie. Výskumná poznámka uvádza, že modely po trénovaní na protichodných vlastnostiach vytvárali záverečnú odpoveď odporujúcu viditeľnému reťazcu myšlienok. Mimo vytvoreného prostredia boli miery nízke, preto práca meria obmedzenia monitorovania a nie všeobecný skrytý plán. Priamy zdroj: lesswrong.com

NVIDIA opisuje trénovanie špecialistu na olympiády. Spoločnosť opisuje kurátorované programátorské dáta, slučky generovania, hodnotenia a opráv aj samostatné checkpointy učenia s učiteľom a posilňovaného učenia za uvádzanými výsledkami na úrovni zlatej medaily v IOI a IMO. Checkpointy a datasety sú zverejnené, no porovnania so súťažami sú vlastné výsledky Nvidie. Priamy zdroj: huggingface.co/blog/nvidia

Epoch odhaduje rýchly rast interného používania programovacích agentov. Hodnoty získané z grafov OpenAI naznačujú, že denná spotreba mediánového výskumníka pri cenách API sa do polovice augusta približne každý mesiac zdvojnásobovala. Čísla merajú odvodené používanie, nie skutočné náklady OpenAI, a pochádzajú z jednej spoločnosti. Priamy zdroj: epoch.ai

Esej oddeľuje techniku zosúladenia od vedy o nezosúladení. Edward James Young tvrdí, že optimalizácia dnešných bezpečnostných metrík môže zlepšovať schopnosti bez budovania porozumenia zlyhaniam, a žiada viac diagnostickej vedy. Ide o názorovú mapu odboru, užitočnú svojimi kategóriami, nie empirickým dôkazom. Priamy zdroj: lesswrong.com

Krátka esej sa pýta, čo znamená matematická tvorivosť. Raemon navrhuje skúmať, či nové dôkazy OpenAI obsahujú pojmy, ktoré vykonávajú skutočnú prácu, alebo prevažne prehľadávajú kombinácie známych myšlienok. Text kladie testovateľnú otázku a žiada podrobnú matematickú analýzu namiesto tvrdenia odpovede. Priamy zdroj: lesswrong.com

Hacker News

Čitatelia spochybňujú, čo predstavuje formalizovaný dôkaz tekutín. Reakcia tvrdí, že dôkaz v Leane súvisiaci s prácou OpenAI o Navierových-Stokesových rovniciach nezodpovedá uvedenému prirodzenému argumentu. Komentujúci odlišujú platnosť v Leane od tvrdenia, že formálny výrok zachytáva zamýšľaný dôkaz. Priamy zdroj: news.ycombinator.com

Generované rozhrania GPT-6 rozdeľujú odborníkov. Niektorí komentujúci chvália interaktívne vysvetlenia, iní kritizujú rozloženie a špekulujú, že generované rozhrania môžu nahradiť konvencie prehliadačov. Ide o dojmy z produktu, nie kontrolovanú štúdiu použiteľnosti. Priamy zdroj: news.ycombinator.com

Formálny repozitár rieši ukladanie 11 štvorcov. Vlákno skúma dôkaz optimálneho uloženia štvorcov v Leane s pomocou AI a odkazuje na vizuálne vysvetlenia. Do diskusie o formálnej matematike podporovanej AI pridáva kontrolovateľný príklad bez nezávislého overenia celého procesu vývoja. Priamy zdroj: news.ycombinator.com

Reddit

llama.cpp skúša vyrovnávaciu pamäť GPU pre expertov MoE. Pull request ponecháva váhy modelu mixture-of-experts v operačnej pamäti a aktívnych expertov ukladá do obmedzeného GPU. Používatelia očakávajú zrýchlenie, no ešte nezverejnili stabilné benchmarky, takže vlákno je ranou správou o ladení. Priamy zdroj: old.reddit.com

Dolaďovaný návrhový model zrýchľuje Ternary Bonsai 2. Autor uvádza 1,2–3,2-násobné zrýchlenie dekódovania v prehliadači, na Macu, L4 a pri úpravách kódu po trénovaní DFlash 2 na výstupe cieľového modelu. Váhy a nastavenie sú verejné, no rôznorodé vlastné merania nie sú všeobecným porovnaním. Priamy zdroj: old.reddit.com

MacroStories zmenšuje úzky jazykový model na 20 000 parametrov. Model s veľkosťou 81 KB údajne píše krátke príbehy v malom trénovacom rozdelení pomocou zdieľaného rekurentného dekóderového bloku. Zaujímavá je extrémna veľkosť a diskusia o mikrokontroléroch, nie všeobecná jazyková schopnosť. Priamy zdroj: old.reddit.com

Upravené ťažobné karty spúšťajú model s dlhým kontextom. Používateľ uvádza približne 90 tokenov za sekundu pri GLM-5.3-Flash s kontextom 384 000 tokenov na dvoch upravených kartách CMP 170HX. Odlišné enginy, kvantizácia a nastavenia špekulatívneho dekódovania robia porovnanie neoficiálnym, no detaily zostavy pomáhajú pri lokálnej inferencii. Priamy zdroj: old.reddit.com

YouTube

Periodic Labs obhajuje fyzické experimenty. Liam Fedus a Ekin Dogus Cubuk v anglickom rozhovore Latent Space diskutujú o posilňovanom učení z laboratórnej práce, hlučných meraniach a objavovaní materiálov. Súhrn vychádza z kapitol a opisu, nie z prepisu, takže vedecké tvrdenia zostávajú názormi rečníkov. Priamy zdroj: youtube.com

Runlayer navrhuje agentov, ktorí píšu opakovane použiteľné zručnosti. Rafal Wilinski opisuje poskytovanie riadených zručností cez MCP a odvodzovanie nových z úspešných a neúspešných behov. Uvádzané zlepšenie z 36 % na 100 % je jediným testom dodávateľa; anglická prednáška je najužitočnejšia svojou architektúrou. Priamy zdroj: youtube.com

Langfuse umožňuje programovacím agentom kontrolovať slučku zlepšovania. Marc Klingen ukazuje agenta, ktorý po nájdení žargónu vo vygenerovaných zoznamoch zmien aktualizuje hodnotiace dáta. Anglická prezentácia dodávateľa ukazuje spojenie sledovania, datasetov a spätných testov, no výsledky zostávajú ukážkou produktu. Priamy zdroj: youtube.com

Tessl delí softvérové továrne na tri slučky. Dru Knox opisuje vnútornú, vonkajšiu a meta slučku a navrhuje merať zásahy človeka, komentáre pri kontrole a autonómne začaté pull requesty. Anglická prezentácia je čiastočne ponukou dodávateľa, no jej prevádzkové metriky sú konkrétne. Priamy zdroj: youtube.com

Google predstavuje agentov Gemini v sandboxe. Philipp Schmid ukazuje Interactions API, trvalé časové osi a agenta, ktorý číta zručnosti a súbory AGENTS.md v spravovanom sandboxe. Anglická prednáška je ukážkou produktu, nie nezávislým hodnotením. Priamy zdroj: youtube.com

Bývalý autor bezpečnostných správ OpenAI vysvetľuje svoj odchod. David Robinson hovorí Ezrovi Kleinovi, že tlak na vydávanie a finančné stimuly predbehli bezpečnostnú kultúru, ktorú považoval za potrebnú. Anglický rozhovor je svedectvom a názorom jedného človeka zvnútra. Priamy zdroj: youtube.com

Apollo rekonštruuje poškodené grécke papyrusy. Nemecká epizóda DER STANDARD vedie rozhovor s papyrológom Bernhardom Palmem a vedúcou projektu Annou Dolganov o rakúskom modeli na dopĺňanie medzier v historickom gréckom texte. Tvrdenia, že niekedy navrhuje riešenia, ktoré výskumníci prehliadli, pochádzajú z opisu programu. Priamy zdroj: youtube.com

AI v kostce porovnáva najnovších asistentov. Česká epizóda testuje produkty OpenAI a Claude na dokumentoch, vývoji, obrázkoch a bezpečnosti a potom diskutuje o výzvach vedúcich laboratórií spomaliť nasadzovanie. Hodnotu má v praktickom regionálnom komentári, nie v kontrolovanom benchmarku. Priamy zdroj: youtube.com

Stručne

ARTEX sa objavuje pri prienikoch do juhokórejských bánk. CrowdStrike pripisuje používanie open-source agenta na penetračné testovanie pravdepodobne čínsky hovoriacemu, finančne motivovanému aktérovi a uvádza, že relácie používali modely DeepSeek, GLM a Grok cez Claude Code. Atribúcia má strednú mieru istoty a rozsah odcudzených dát zostáva nejasný. Priamy zdroj: crowdstrike.com

LMCache má kritickú zraniteľnosť na neoverené spustenie kódu. JFrog uvádza, že verzie 0.3.9 až 0.5.5 a kandidáti vydania 0.5.6 môžu deserializovať škodlivú správu ZeroMQ pred kontrolou jej typu a opravená verzia ešte neexistuje. Prevádzkovatelia majú do vydania opravy ponechať službu v dôveryhodných sieťach. Priamy zdroj: thehackernews.com

PoeLLM skrýva riadiacu infraštruktúru v básni. Lumen Black Lotus Labs informuje o malvéri, ktorý odvodzuje meniace sa riadiace adresy z textu na GitHube a infikoval viac než 3 000 vystavených serverov súvisiacich s LLM. Technika si zaslúži pozornosť, pretože bežné skenovanie odkazov v básni nevidí URL ani spustiteľný kód. Priamy zdroj: theregister.com

AWS vydáva sandbox agenta zohľadňujúci históriu. Strands Box môže uplatniť pravidlá podľa aktuálneho volania nástroja a skorších krokov agenta vrátane limitov frekvencie či podmienok pre push a drahé API. Otvorený návrh možno kontrolovať, no tvrdenia o vynucovaní sú vlastnými tvrdeniami AWS. Priamy zdroj: theregister.com

Microsoft pridáva smerovanie agentov Windows medzi lokálnym modelom a cloudom. HydraFusion vyberá medzi modelmi v zariadení a hostovanými modelmi, zatiaľ čo Execution Containers uplatňujú povolenia na lokálnych agentov pristupujúcich k súborom počítača. Zavádzanie sa začína v GitHub Copilot, preto bude pri rozširovaní prístupu dôležité správanie izolácie. Priamy zdroj: theregister.com

Hodnotenia bezpečnosti tínedžerov si odporujú. OpenAI uvádza, že typické používanie tínedžermi je krátke a zamerané na učenie, zatiaľ čo Common Sense Media tvrdí, že rodičovské upozornenia a ďalšie ochrany často zlyhávajú. Správa BBC je ukazovateľom rozdielnych meraní, nie ich vyriešením. Priamy zdroj: bbc.co.uk

Google otvára verejný detektor SynthID. Web po prihlásení kontroluje nahraté médiá na vodoznaky Googlu a viacerých partnerov a vráti odpoveď áno alebo nie. Širší prístup uľahčuje kontrolu pôvodu, hoci neprítomnosť zisteného vodoznaku nedokazuje ľudské autorstvo. Priamy zdroj: arstechnica.com

Singapur vydáva pravidlá rizík AI pre finančný sektor. Monetary Authority of Singapore očakáva nezávislú kontrolu každého použitia AI a zodpovednosť ukladá predstavenstvám a vrcholovému vedeniu vrátane systémov tretích strán. Pre tento prehľad bolo dostupné iba sekundárne spravodajstvo, preto presné regulačné znenie vyžaduje dokument MAS. Priamy zdroj: theregister.com

RTX Spark prináša systémy AI so zdieľanou pamäťou do notebookov. Nové počítače spájajú procesory Arm s grafikou NVIDIA Blackwell a ponúkajú až 128 GB zdieľanej pamäte za ceny od 2 599 do 7 000 dolárov. Dostupnosť a nezávislé testy trvalého výkonu rozhodnú, či budú pre lokálne modely vhodnejšie než stolové alternatívy. Priamy zdroj: theverge.com

Biznis v skratke

McDonald’s čelí návrhu celoštátnej hromadnej žaloby v USA, podľa ktorej jeho cenová platforma pre franšízy umožňuje nezákonnú koordináciu; spoločnosť tvrdí, že nástroj ceny neautomatizuje ani neurčuje. Priamy zdroj: theguardian.com

Nous Research potvrdil ohodnotenie 1,5 miliardy dolárov a uviedol agentov pre firemných používateľov, čo je udalosť financovania a pozicionovania produktu bez samostatne hodnotiteľného technického vydania. Priamy zdroj: techcrunch.com

Čo z toho vyplýva: Dnešné vedľajšie správy opakovane posúvajú hranicu okolo systému AI: aký kontext vidí, ktorým dôkazom môže veriť, ku ktorému hardvéru pristupuje a aké kroky mu povoľuje sandbox.

Čo bude ďalej: LMCache stále potrebuje opravené vydanie, Microsoft začína zavádzať prístup Copilot k súborom a viaceré výskumné preprinty teraz čakajú na kontrolu kódu alebo nezávislú replikáciu.

Overenie

TvrdenieOznačeniePrimárny zdrojNezávislé overenie
Vydania a existencia projektovOVERENÉPriame odkazy v každej položkežiadne, ak nie je uvedené
Tvrdenia o výkone modelov, benchmarkoch a latenciiPODĽA SPOLOČNOSTIPriame odkazy v každej položkežiadne
Výskumné zisteniaPODĽA SPOLOČNOSTIPrepojené práce a výskumné poznámkyžiadne
Komunitné merania a ukážkyNEOVERENÉPrepojené vlákna HN a Redditžiadne
Argumenty esejí a postoje z rozhovorovNÁZORPrepojené eseje a videážiadne
Bezpečnostné a regulačné udalostiČIASTOČNE OVERENÉPrepojené správy dodávateľov a nezávislé spravodajstvoZdroje uvedené v každej položke