Dnešné širšie pokrytie siaha od otvoreného generovania videa so zvukom a sandboxov pre agentov až po výskum pamäte, bezpečnosti a rekurentnej hĺbky modelov. Výsledky preprintov, merania dodávateľov a komunitné experimenty zostávajú pripísané svojim vydavateľom.
Nové modely a vydania
KandinskyLab vydáva váhy na generovanie videa so zvukom. Kandinsky 6.0 Lite a Pro generujú päťsekundové klipy so synchronizovaným zvukom z textu alebo prvého snímku; váhy a kód verzie Lite s 3 miliardami parametrov majú licenciu MIT, zatiaľ čo repozitár verzie Pro s 29 miliardami parametrov má obmedzený prístup. Kontrolovateľné artefakty Lite dávajú vydaniu význam napriek hodnoteniam vykonaným autormi. Priamy zdroj: huggingface.co/kandinskylab/Kandinsky-6.0-Lite-5s-Diffusers
GPT-6 prichádza ku všetkým používateľom ChatGPT. OpenAI uvádza, že nový model sa celosvetovo zavádza s funkciou „Intelligent UI“, ktorá dokáže vytvárať interaktívne prvky odpovede, a spolu s ním sa zmenil alias API chat-latest. Oznámenie nesprevádzala technická správa ani karta modelu, preto ide skôr o nasadenie produktu než o hodnotiteľné vydanie modelu. Priamy zdroj: openai.com
Výskum
Queen prepája šachové pozície s jazykovými vysvetleniami. Výskumníci z Princetonu spájajú šachový enkóder so 4 miliardami parametrov s jazykovým modelom cez krížovú pozornosť, aby zachovali silnú hru a zároveň vysvetľovali ťahy. Autori uvádzajú približne veľmajstrovskú úroveň, čo poskytuje kontrolovateľný test, či strategické reprezentácie dokážu podporiť jazyk. Priamy zdroj: arxiv.org
SafeActBench meria prechod od dôkazu k bezpečnému konaniu. Benchmark testuje, či model, ktorý dokáže rozpoznať riziko, primerane zmení aj svoje správanie. Toto rozlíšenie je dôležité pre systémy, ktorých bezpečnostné hodnotenia sa končia pri slovnom uvedomení. Priamy zdroj: arxiv.org
Memadapter skúma súhlas vyvolaný pamäťou. Preprint skúma, ako môžu vyhľadané spomienky viesť asistenta k nasledovaniu skorších tvrdení aj vtedy, keď odporujú aktuálnym dôkazom. Práca si zaslúži pozornosť, pretože trvalá pamäť agenta môže zosilňovať pritakávanie naprieč reláciami. Priamy zdroj: arxiv.org
Slučkové modely sa približujú k stabilným vnútorným stavom. Výskumníci opakovane aplikujú zdieľané bloky modelu a analyzujú, kedy skrytý stav konverguje k pevnému bodu. Uvádzané prínosy pre rýchlosť a trénovanie zostávajú výsledkami autorov, no mechanizmus ponúka konkrétne vysvetlenie výpočtu cez rekurentnú hĺbku. Priamy zdroj: arxiv.org
Multilingual GSM-Symbolic testuje uvažovanie mimo angličtiny. Dataset mení matematické úlohy pre základné školy medzi jazykmi a symbolickými formami, aby oddelil zapamätanú formuláciu od výpočtu. Viacjazyčným hodnoteniam dáva kontrolovanejší záťažový test než preložené pevné otázky. Priamy zdroj: arxiv.org
LoopCD pristupuje k hĺbke modelu ako k spojitému procesu. Metóda trénuje opakovaný blok, aby reprezentácie vylepšoval v premenlivom počte krokov namiesto samostatných parametrov pre každú vrstvu. Práca pomáha porovnávať rekurentný výpočet s bežnou hĺbkou pri rovnakom rozpočte parametrov. Priamy zdroj: arxiv.org
Techniky promptovania
Terse udržiava stručný štýl Claude Code. Plugin združuje pravidlá odpovedí, konvencie dokumentov, pokyny pre subagentov a merač kontextu; autor v teste s 20 promptmi uvádza o 46–54 % menej slov. Výsledky nákladov a štýlu si meral sám, no repozitár je praktickým príkladom presunu trvalého správania do pluginu. Priamy zdroj: github.com/lowenbjer/claude-terse
Prednáška AWS rozlišuje štyri operácie s kontextom. Elizabeth Fuentes Leone zoskupuje prácu agentov s kontextom na externalizáciu, výber, kompresiu a izoláciu informácií a ukazuje ich pomocou Strands Agents. Prepis sa nekontroloval, preto je anglické video skôr ukazovateľom techniky než overeným benchmarkom. Priamy zdroj: youtube.com
Čo ľudia tvoria
nanoMuse spája samohostovaného agenta v telefóne a počítači. Projekt s licenciou GPL kombinuje klientov pre Android, počítač a web s upraviteľnou pamäťou v Markdowne a schvaľovaním dôsledných krokov. Novinkou je verzia 0.1.41; tvrdenia o bezpečnosti a schopnostiach zostávajú tvrdeniami tímu. Priamy zdroj: github.com/nano-muse/nanoMuse
Prehliadač ukazuje každé číslo v malom GPT. Vizualizácia Manogyu Singha počíta dopredný priechod miniatúrneho transformera, spätné šírenie a jeden krok posilňovaného učenia s kontrolovateľnou aritmetikou. Ide o učebný materiál, nie novú metódu, a repozitár zatiaľ nemá licenčný súbor. Priamy zdroj: github.com/manogyasingh/transformer-visualisation
Klon SimCity vytvorený agentmi vyvoláva otázky o overení. Autor uvádza, že Claude Opus 5.5 použil 27 subagentov na preklad pôvodného kódu PowerPC do verzie WebGL približne za dve hodiny a následne porovnával stav hry cez emulátor. Hrateľná ukážka existuje, no proces a tvrdenia o vernosti nie sú overené a repozitár sa nenašiel. Priamy zdroj: dator.dev
Stojí za prečítanie
Cloudflare ponecháva zhromažďovanie dôkazov mimo modelu. Jeho návrh bezpečnostných operácií vykonáva pevný prieskum v kóde a potom úzkym agentom poskytuje dôkazy s explicitnými stavmi neprítomných, prítomných a nekontrolovaných dát. Opis nemá údaje o presnosti produktu, no oddelenie zberu a posudzovania sa dá preniesť inde. Priamy zdroj: blog.cloudflare.com
Konfliktné trénovacie hodnoty môžu potlačiť uvedené uvažovanie. Výskumná poznámka uvádza, že modely po trénovaní na protichodných vlastnostiach vytvárali záverečnú odpoveď odporujúcu viditeľnému reťazcu myšlienok. Mimo vytvoreného prostredia boli miery nízke, preto práca meria obmedzenia monitorovania a nie všeobecný skrytý plán. Priamy zdroj: lesswrong.com
NVIDIA opisuje trénovanie špecialistu na olympiády. Spoločnosť opisuje kurátorované programátorské dáta, slučky generovania, hodnotenia a opráv aj samostatné checkpointy učenia s učiteľom a posilňovaného učenia za uvádzanými výsledkami na úrovni zlatej medaily v IOI a IMO. Checkpointy a datasety sú zverejnené, no porovnania so súťažami sú vlastné výsledky Nvidie. Priamy zdroj: huggingface.co/blog/nvidia
Epoch odhaduje rýchly rast interného používania programovacích agentov. Hodnoty získané z grafov OpenAI naznačujú, že denná spotreba mediánového výskumníka pri cenách API sa do polovice augusta približne každý mesiac zdvojnásobovala. Čísla merajú odvodené používanie, nie skutočné náklady OpenAI, a pochádzajú z jednej spoločnosti. Priamy zdroj: epoch.ai
Esej oddeľuje techniku zosúladenia od vedy o nezosúladení. Edward James Young tvrdí, že optimalizácia dnešných bezpečnostných metrík môže zlepšovať schopnosti bez budovania porozumenia zlyhaniam, a žiada viac diagnostickej vedy. Ide o názorovú mapu odboru, užitočnú svojimi kategóriami, nie empirickým dôkazom. Priamy zdroj: lesswrong.com
Krátka esej sa pýta, čo znamená matematická tvorivosť. Raemon navrhuje skúmať, či nové dôkazy OpenAI obsahujú pojmy, ktoré vykonávajú skutočnú prácu, alebo prevažne prehľadávajú kombinácie známych myšlienok. Text kladie testovateľnú otázku a žiada podrobnú matematickú analýzu namiesto tvrdenia odpovede. Priamy zdroj: lesswrong.com
Hacker News
Čitatelia spochybňujú, čo predstavuje formalizovaný dôkaz tekutín. Reakcia tvrdí, že dôkaz v Leane súvisiaci s prácou OpenAI o Navierových-Stokesových rovniciach nezodpovedá uvedenému prirodzenému argumentu. Komentujúci odlišujú platnosť v Leane od tvrdenia, že formálny výrok zachytáva zamýšľaný dôkaz. Priamy zdroj: news.ycombinator.com
Generované rozhrania GPT-6 rozdeľujú odborníkov. Niektorí komentujúci chvália interaktívne vysvetlenia, iní kritizujú rozloženie a špekulujú, že generované rozhrania môžu nahradiť konvencie prehliadačov. Ide o dojmy z produktu, nie kontrolovanú štúdiu použiteľnosti. Priamy zdroj: news.ycombinator.com
Formálny repozitár rieši ukladanie 11 štvorcov. Vlákno skúma dôkaz optimálneho uloženia štvorcov v Leane s pomocou AI a odkazuje na vizuálne vysvetlenia. Do diskusie o formálnej matematike podporovanej AI pridáva kontrolovateľný príklad bez nezávislého overenia celého procesu vývoja. Priamy zdroj: news.ycombinator.com
llama.cpp skúša vyrovnávaciu pamäť GPU pre expertov MoE. Pull request ponecháva váhy modelu mixture-of-experts v operačnej pamäti a aktívnych expertov ukladá do obmedzeného GPU. Používatelia očakávajú zrýchlenie, no ešte nezverejnili stabilné benchmarky, takže vlákno je ranou správou o ladení. Priamy zdroj: old.reddit.com
Dolaďovaný návrhový model zrýchľuje Ternary Bonsai 2. Autor uvádza 1,2–3,2-násobné zrýchlenie dekódovania v prehliadači, na Macu, L4 a pri úpravách kódu po trénovaní DFlash 2 na výstupe cieľového modelu. Váhy a nastavenie sú verejné, no rôznorodé vlastné merania nie sú všeobecným porovnaním. Priamy zdroj: old.reddit.com
MacroStories zmenšuje úzky jazykový model na 20 000 parametrov. Model s veľkosťou 81 KB údajne píše krátke príbehy v malom trénovacom rozdelení pomocou zdieľaného rekurentného dekóderového bloku. Zaujímavá je extrémna veľkosť a diskusia o mikrokontroléroch, nie všeobecná jazyková schopnosť. Priamy zdroj: old.reddit.com
Upravené ťažobné karty spúšťajú model s dlhým kontextom. Používateľ uvádza približne 90 tokenov za sekundu pri GLM-5.3-Flash s kontextom 384 000 tokenov na dvoch upravených kartách CMP 170HX. Odlišné enginy, kvantizácia a nastavenia špekulatívneho dekódovania robia porovnanie neoficiálnym, no detaily zostavy pomáhajú pri lokálnej inferencii. Priamy zdroj: old.reddit.com
YouTube
Periodic Labs obhajuje fyzické experimenty. Liam Fedus a Ekin Dogus Cubuk v anglickom rozhovore Latent Space diskutujú o posilňovanom učení z laboratórnej práce, hlučných meraniach a objavovaní materiálov. Súhrn vychádza z kapitol a opisu, nie z prepisu, takže vedecké tvrdenia zostávajú názormi rečníkov. Priamy zdroj: youtube.com
Runlayer navrhuje agentov, ktorí píšu opakovane použiteľné zručnosti. Rafal Wilinski opisuje poskytovanie riadených zručností cez MCP a odvodzovanie nových z úspešných a neúspešných behov. Uvádzané zlepšenie z 36 % na 100 % je jediným testom dodávateľa; anglická prednáška je najužitočnejšia svojou architektúrou. Priamy zdroj: youtube.com
Langfuse umožňuje programovacím agentom kontrolovať slučku zlepšovania. Marc Klingen ukazuje agenta, ktorý po nájdení žargónu vo vygenerovaných zoznamoch zmien aktualizuje hodnotiace dáta. Anglická prezentácia dodávateľa ukazuje spojenie sledovania, datasetov a spätných testov, no výsledky zostávajú ukážkou produktu. Priamy zdroj: youtube.com
Tessl delí softvérové továrne na tri slučky. Dru Knox opisuje vnútornú, vonkajšiu a meta slučku a navrhuje merať zásahy človeka, komentáre pri kontrole a autonómne začaté pull requesty. Anglická prezentácia je čiastočne ponukou dodávateľa, no jej prevádzkové metriky sú konkrétne. Priamy zdroj: youtube.com
Google predstavuje agentov Gemini v sandboxe. Philipp Schmid ukazuje Interactions API, trvalé časové osi a agenta, ktorý číta zručnosti a súbory AGENTS.md v spravovanom sandboxe. Anglická prednáška je ukážkou produktu, nie nezávislým hodnotením. Priamy zdroj: youtube.com
Bývalý autor bezpečnostných správ OpenAI vysvetľuje svoj odchod. David Robinson hovorí Ezrovi Kleinovi, že tlak na vydávanie a finančné stimuly predbehli bezpečnostnú kultúru, ktorú považoval za potrebnú. Anglický rozhovor je svedectvom a názorom jedného človeka zvnútra. Priamy zdroj: youtube.com
Apollo rekonštruuje poškodené grécke papyrusy. Nemecká epizóda DER STANDARD vedie rozhovor s papyrológom Bernhardom Palmem a vedúcou projektu Annou Dolganov o rakúskom modeli na dopĺňanie medzier v historickom gréckom texte. Tvrdenia, že niekedy navrhuje riešenia, ktoré výskumníci prehliadli, pochádzajú z opisu programu. Priamy zdroj: youtube.com
AI v kostce porovnáva najnovších asistentov. Česká epizóda testuje produkty OpenAI a Claude na dokumentoch, vývoji, obrázkoch a bezpečnosti a potom diskutuje o výzvach vedúcich laboratórií spomaliť nasadzovanie. Hodnotu má v praktickom regionálnom komentári, nie v kontrolovanom benchmarku. Priamy zdroj: youtube.com
Stručne
ARTEX sa objavuje pri prienikoch do juhokórejských bánk. CrowdStrike pripisuje používanie open-source agenta na penetračné testovanie pravdepodobne čínsky hovoriacemu, finančne motivovanému aktérovi a uvádza, že relácie používali modely DeepSeek, GLM a Grok cez Claude Code. Atribúcia má strednú mieru istoty a rozsah odcudzených dát zostáva nejasný. Priamy zdroj: crowdstrike.com
LMCache má kritickú zraniteľnosť na neoverené spustenie kódu. JFrog uvádza, že verzie 0.3.9 až 0.5.5 a kandidáti vydania 0.5.6 môžu deserializovať škodlivú správu ZeroMQ pred kontrolou jej typu a opravená verzia ešte neexistuje. Prevádzkovatelia majú do vydania opravy ponechať službu v dôveryhodných sieťach. Priamy zdroj: thehackernews.com
PoeLLM skrýva riadiacu infraštruktúru v básni. Lumen Black Lotus Labs informuje o malvéri, ktorý odvodzuje meniace sa riadiace adresy z textu na GitHube a infikoval viac než 3 000 vystavených serverov súvisiacich s LLM. Technika si zaslúži pozornosť, pretože bežné skenovanie odkazov v básni nevidí URL ani spustiteľný kód. Priamy zdroj: theregister.com
AWS vydáva sandbox agenta zohľadňujúci históriu. Strands Box môže uplatniť pravidlá podľa aktuálneho volania nástroja a skorších krokov agenta vrátane limitov frekvencie či podmienok pre push a drahé API. Otvorený návrh možno kontrolovať, no tvrdenia o vynucovaní sú vlastnými tvrdeniami AWS. Priamy zdroj: theregister.com
Microsoft pridáva smerovanie agentov Windows medzi lokálnym modelom a cloudom. HydraFusion vyberá medzi modelmi v zariadení a hostovanými modelmi, zatiaľ čo Execution Containers uplatňujú povolenia na lokálnych agentov pristupujúcich k súborom počítača. Zavádzanie sa začína v GitHub Copilot, preto bude pri rozširovaní prístupu dôležité správanie izolácie. Priamy zdroj: theregister.com
Hodnotenia bezpečnosti tínedžerov si odporujú. OpenAI uvádza, že typické používanie tínedžermi je krátke a zamerané na učenie, zatiaľ čo Common Sense Media tvrdí, že rodičovské upozornenia a ďalšie ochrany často zlyhávajú. Správa BBC je ukazovateľom rozdielnych meraní, nie ich vyriešením. Priamy zdroj: bbc.co.uk
Google otvára verejný detektor SynthID. Web po prihlásení kontroluje nahraté médiá na vodoznaky Googlu a viacerých partnerov a vráti odpoveď áno alebo nie. Širší prístup uľahčuje kontrolu pôvodu, hoci neprítomnosť zisteného vodoznaku nedokazuje ľudské autorstvo. Priamy zdroj: arstechnica.com
Singapur vydáva pravidlá rizík AI pre finančný sektor. Monetary Authority of Singapore očakáva nezávislú kontrolu každého použitia AI a zodpovednosť ukladá predstavenstvám a vrcholovému vedeniu vrátane systémov tretích strán. Pre tento prehľad bolo dostupné iba sekundárne spravodajstvo, preto presné regulačné znenie vyžaduje dokument MAS. Priamy zdroj: theregister.com
RTX Spark prináša systémy AI so zdieľanou pamäťou do notebookov. Nové počítače spájajú procesory Arm s grafikou NVIDIA Blackwell a ponúkajú až 128 GB zdieľanej pamäte za ceny od 2 599 do 7 000 dolárov. Dostupnosť a nezávislé testy trvalého výkonu rozhodnú, či budú pre lokálne modely vhodnejšie než stolové alternatívy. Priamy zdroj: theverge.com
Biznis v skratke
McDonald’s čelí návrhu celoštátnej hromadnej žaloby v USA, podľa ktorej jeho cenová platforma pre franšízy umožňuje nezákonnú koordináciu; spoločnosť tvrdí, že nástroj ceny neautomatizuje ani neurčuje. Priamy zdroj: theguardian.com
Nous Research potvrdil ohodnotenie 1,5 miliardy dolárov a uviedol agentov pre firemných používateľov, čo je udalosť financovania a pozicionovania produktu bez samostatne hodnotiteľného technického vydania. Priamy zdroj: techcrunch.com
Čo z toho vyplýva: Dnešné vedľajšie správy opakovane posúvajú hranicu okolo systému AI: aký kontext vidí, ktorým dôkazom môže veriť, ku ktorému hardvéru pristupuje a aké kroky mu povoľuje sandbox.
Čo bude ďalej: LMCache stále potrebuje opravené vydanie, Microsoft začína zavádzať prístup Copilot k súborom a viaceré výskumné preprinty teraz čakajú na kontrolu kódu alebo nezávislú replikáciu.
Overenie
| Tvrdenie | Označenie | Primárny zdroj | Nezávislé overenie |
|---|---|---|---|
| Vydania a existencia projektov | OVERENÉ | Priame odkazy v každej položke | žiadne, ak nie je uvedené |
| Tvrdenia o výkone modelov, benchmarkoch a latencii | PODĽA SPOLOČNOSTI | Priame odkazy v každej položke | žiadne |
| Výskumné zistenia | PODĽA SPOLOČNOSTI | Prepojené práce a výskumné poznámky | žiadne |
| Komunitné merania a ukážky | NEOVERENÉ | Prepojené vlákna HN a Reddit | žiadne |
| Argumenty esejí a postoje z rozhovorov | NÁZOR | Prepojené eseje a videá | žiadne |
| Bezpečnostné a regulačné udalosti | ČIASTOČNE OVERENÉ | Prepojené správy dodávateľov a nezávislé spravodajstvo | Zdroje uvedené v každej položke |