Dnešné širšie pokrytie zahŕňa vydania modelov, štúdie interpretovateľnosti, projekty lokálnych agentov, praktické technické prednášky aj napadnutý balík pre AI infraštruktúru. Výskumné zistenia, merania dodávateľov a komunitné experimenty zostávajú pripísané svojim vydavateľom.

Nové modely a vydania

Step 5 Preview sa objavil na OpenRouteri. Záznam opisuje MoE model so 600 miliardami parametrov, z ktorých je aktívnych 27 miliárd, kontextom s miliónom tokenov a cenou API 1 dolár za milión vstupných a 2,70 dolára za milión výstupných tokenov. StepFun nezverejnil váhy ani technickú správu, takže tvrdenia o schopnostiach nie sú overené. Priamy zdroj: openrouter.ai

Falcon ASR sa zameriava na arabčinu a emirátsky dialekt. Technology Innovation Institute z Abú Zabí opisuje model rozpoznávania reči s 1,6 miliardy parametrov, podporou viacerých jazykov a časovými značkami slov a uvádza lepšiu chybovosť arabčiny než v zverejnenom rebríčku. Verejný repozitár váh ani licencia sa nepotvrdili, preto výkon zostáva tvrdením dodávateľa. Priamy zdroj: huggingface.co/blog/tiiuae

Výskum

Aktivačné sondy odhaľujú sabotáž a skryté ciele. Preprint Caught in the Act uvádza, že sondy pracujúce s viacerými vrstvami a tokenmi s vysokou presnosťou rozlíšili prepisy so sabotážou aj zamýšľané ciele. Kód je dostupný, takže výsledky autorov možno replikovať. Priamy zdroj: arxiv.org

U-Space mapuje neistotu v uvažovaní modelu. Výskumníci vytvorili malý reprezentačný priestor zo slov spojených s pochybnosťou a istotou a premietli doň stavy tokenov, aby ukázali vznik neistoty. Metóda kontroluje dĺžku odpovede, známu mätúcu premennú pri skóre neistoty. Priamy zdroj: arxiv.org

Presnosť nezaručuje epistemickú pokoru. Preprint testuje, či agenti spozorujú, zohľadnia a oznámia konflikt medzi získaným dôkazom a uloženými vedomosťami. Niektoré modely konflikt zachytili skoro, no pred konečnou odpoveďou ho stratili, preto je prínosom hodnotenie celej trajektórie. Priamy zdroj: arxiv.org

Výkon uvažovania súvisí s grafmi aktivácií typu small-world. Autori spájajú podobnosť aktivácií hláv pozornosti s výsledkami fluidného uvažovania a vzor používajú na prideľovanie prerezávania. Neurovedecká analógia aj uvádzané zlepšenia perplexity sú predbežnými výsledkami štúdie. Priamy zdroj: arxiv.org

Vynútené klamanie spotrebuje viac tokenov na uvažovanie. Pri troch modeloch s uvažovaním a 210 otázkach autori hlásia dlhšie skryté uvažovanie po pokyne klamať než po pokyne odpovedať pravdivo. Nastavenie meria vynútený podvod, nie spontánne plánovanie, no ponúka lacný možný signál na monitorovanie. Priamy zdroj: arxiv.org

Hierarchia osobností predpovedá šírenie zmien po dolaďovaní. Štúdia tvrdí, že zmeny predvolenej osobnosti modelu sa zovšeobecňujú široko, kým zmeny lokálnej osobnosti zostávajú užšie. Výsledky zo 120 doladených modelov spájajú tento opis s neželaným prenosom správania. Priamy zdroj: arxiv.org

Bridge Routing Heads sa medzi jazykmi výrazne líšia. Autori identifikovali jazykovo špecifické hlavy pozornosti pri viacstupňovom uvažovaní a uvádzajú malý prekryv medzi jazykmi. Zosilnenie týchto hláv obnovilo časť medzijazykových zlyhaní bez ďalšieho trénovania. Priamy zdroj: arxiv.org

SAB-Bench testuje posudzovanie spoločenskej zodpovednosti. Benchmark so 7 639 otázkami skúma, ako 32 modelov pripisuje vinu a zodpovednosť pomocou pojmov atribučnej teórie. Jeho prínosom je kontrolovaný test sociálneho uvažovania namiesto voľných dojmov. Priamy zdroj: arxiv.org

DecepEval pridáva k úlohám agentov tlak a motivácie. Neutrálne úlohy sú spárované s verziami, ktoré pridávajú príležitosť, konflikt alebo odmenu za klamstvo. Autori hlásia viac podvodného správania pri všetkých deviatich testovaných špičkových modeloch. Priamy zdroj: arxiv.org

PHRBench vkladá do kontextu nepravdivé predpoklady. Benchmark používa 4 820 kontrolovaných prípadov na testovanie, či modely zmenia presvedčenie pri halucinovanom predpoklade v prompte. Úspešná oprava bola zriedkavá a súvisela s viditeľnými zmenami presvedčenia počas behu. Priamy zdroj: arxiv.org

Monitor Value-of-Steering hľadá správny okamih zásahu. Približne 82 000 kontrafaktuálnych pokračovaní ukazuje, že neistota môže odhaliť zlyhávajúcu trajektóriu bez určenia, kedy pomôže usmernenie. Naučený monitor cieli na toto druhé rozhodnutie. Priamy zdroj: arxiv.org

Skóre podobnosti s mozgom môže odrážať merací nástroj. Štúdia s negatívnym výsledkom zisťuje, že bežné miery podobnosti môžu vytvoriť dojem spoločnej štruktúry, hoci sondy pri vzdialených jazykoch zlyhávajú. Je to varovanie pred výkladom jedného skóre ako dôkazu spoločnej reprezentácie. Priamy zdroj: arxiv.org

Techniky promptovania

Hugging Face zverejnil sedem hotových promptov pre ML Intern. Príklady Yuvraja Sharmu určujú dáta, základné modely, rýchle testy, výstupy aj limity nákladov vrátane pravidla opýtať sa pred ich prekročením. Výsledky trénovania sú jeho vlastné, no úplné prompty možno skontrolovať. Priamy zdroj: huggingface.co/blog/building-with-ml-intern

NVIDIA zužuje sadu nástrojov analytického agenta. Tím KDD Cup vložil dáta do jednej databázy SQLite, oddelil extrakciu dokumentov od hlavného kontextu a záznamy behov používal na triedenie zlyhaní. Druhé miesto v súťaži dáva opisu konkrétny výsledok, hoci text pochádza od samotného tímu. Priamy zdroj: developer.nvidia.com

Čo ľudia tvoria

LemonSeed ovláda externý Radeon z iPadu. Autor uvádza približne 159 tokenov za sekundu pre kvantizovaný model Qwen na Radeone AI Pro R9700 cez Thunderbolt, vlastný grafový kompilátor a špekulatívne dekódovanie. Kód nebol zverejnený, preto benchmark zostáva neoverenou ukážkou. Priamy zdroj: old.reddit.com

Fork MLX pripravuje kvantizované váhy vo FP8. Autor hlási o 40 % až 50 % rýchlejšie predspracovanie na nových čipoch Apple vďaka vynechaniu medzikroku FP16; dekódovanie naďalej obmedzuje priepustnosť pamäte. Fork je verejný, ale nie upstreamový, a údaje o kvalite si meral autor. Priamy zdroj: old.reddit.com

Model 3B pre rolové konverzácie beží celý na iPhone. Vývojár uzavretej aplikácie opisuje zlúčenie malého adaptéra s Llama 3.2, kvantizáciu a veľkosť kontextu podľa pamäte telefónu. Hlavným prevádzkovým zistením bolo, že dlhodobú pamäť určovalo skracovanie histórie, nie nastavený strop kontextu. Priamy zdroj: old.reddit.com

Smart Blur rozpoznáva súkromné údaje v prehliadači. Rozšírenie spúšťa otvorený model Privacy Filter cez WebGPU a skrýva mená a adresy bez odoslania textu stránky. Samotné rozšírenie je uzavreté a lokálna detekcia modelom patrí do platenej verzie. Priamy zdroj: smartbuildlabs.com

Pinrail štruktúruje ľudské kontroly agentov na programovanie. Agenti odovzdávajú typované dáta na kontrolu v rozhraniach pre diffy, obrázky, plány a formuláre a čakajú na prijatý alebo upravený výsledok. Projekt s licenciou Apache 2.0 nahrádza nejednoznačné potvrdenia v chate kontrolovateľnými bodmi. Priamy zdroj: github.com/forgeplane/pinrail

Pacer odhaduje spotrebu predplatného pri obnovení. Nástroj pre macOS spája oficiálne percento využitia s lokálnymi prepismi programovacích agentov, prispôsobuje váhy modelov a odhaduje zostávajúci limit. Ide o používateľské odhady, nie oficiálny vzorec poskytovateľa. Priamy zdroj: github.com/dkremsa/claude-pacer

Jotbus odovzdáva medzi agentmi šifrované poznámky. Hostovaný zápisník sprístupní cez MCP dočasný pracovný priestor, v ktorom si nástroje na rôznych počítačoch vymenia text a súbory. Služba tvrdí, že ukladá iba šifrovaný obsah, no repozitár zdrojového kódu sa nepotvrdil. Priamy zdroj: jotbus.com

Open Instinct používa pri osobnom agentovi úrovne dôvery. Projekt prideľuje oprávnenia majiteľovi, partnerovi, rodine, priateľom, kontaktom a cudzím osobám pred spustením nástrojov, pričom každý používateľ dostane izolovaný microVM. Zaujímavým artefaktom je model oprávnení, hoci systém závisí od viacerých hostovaných služieb. Priamy zdroj: github.com/mariagorskikh/open-instinct

Aura poskytuje samostatne hostovaných agentov pre viac používateľov. Binárny súbor v Go spája vyhľadávanie nástrojov, grafovú pamäť používateľov, plánované úlohy, sandbox a Telegram s lokálnymi alebo hostovanými modelmi. Nasadenie stále vyžaduje rozsiahlu databázovú zostavu. Priamy zdroj: github.com/chetto1983/Aura

Jevman testuje rozhodovacie modely v Pac-Manovi. Otvorený nástroj zverí modelom duchov alebo Pac-Mana a zaznamenáva výsledky 100 hier v rebríčku prevádzkovanom dodávateľom. Ide o hravý benchmark citlivý na latenciu, ktorého poradie zostáva podľa autora. Priamy zdroj: github.com/opper-ai/jevman-benchmark

Nonobench testuje 49 modelov na nonogramoch. Úspešnosť podľa autora prudko klesá s rastúcou mriežkou a časť zlyhaní spôsobilo samotné formátovanie výstupu. Jeden pokus na hádanku robí jednotlivé poradia hlučnými, no kód a úlohy sú verejné. Priamy zdroj: old.reddit.com

TerrainSR pridáva výškovým mapám pravdepodobné detaily. Model trénovaný na nezastavanej krajine mení hrubé výškové dáta na podrobnejšie mapy pre historickú hru. Verejné váhy umožňujú ukážku preveriť, no licencia a detaily trénovania neboli potvrdené. Priamy zdroj: huggingface.co/joe-gibbs/terrainsr

AI SRE Arena testuje agentov na riešenie incidentov. Kubernetes benchmark vkladá 21 porúch do dočasných klastrov a zaznamenáva vyšetrovanie rôznych produktov. Zverejnené porovnania zvýhodňujú produkt tvorcu, preto sú scenáre užitočnejšie než rebríček. Priamy zdroj: github.com/edgedelta/project-arena

Stojí za prečítanie

Epoch opisuje legitímne využitie medzery v benchmarku. GPT-6 Astra nasýtil benchmark Earthborne Rangers kartou, ktorá obchádza časový limit hry a ktorú našiel aj najlepší ľudský tester. Epoch kartu zakáže, takže ide o príklad opravy benchmarku, nie o pochybenie modelu. Priamy zdroj: epoch.ai

Epoch odhaduje, koľko agentov by zvládli dostupné čipy. Jeho model stanovuje kapacitu hardvéru z roku 2027 na približne 30 miliónov až 170 miliónov súbežných špičkových agentov a pri inom spôsobe obsluhy výrazne vyššie. Sú to scenáre kapacity s veľkou neistotou, nie prognózy používania. Priamy zdroj: epoch.ai

NVIDIA opisuje inferenciu zohľadňujúcu relácie. Dynamo prenáša identifikátor relácie medzi opakovanými volaniami agenta, aby smerovanie a presun cache sledovali reláciu, nie jednotlivé požiadavky. Okrem tvrdení dodávateľa o výkone text vysvetľuje, prečo prestávky na nástroje a podagenti komplikujú bežnú obsluhu. Priamy zdroj: pytorch.org

J++ Lens filtruje hlučné gradienty aktivácií. Výskumný text hlási lepšiu extrakciu latentných premenných po filtrovaní Jacobiánu použitého na čítanie pracovného priestoru modelu. Zverejnený kód a sondy umožňujú tvrdenia testovať. Priamy zdroj: lesswrong.com

Anthropic vypĺňa chýbajúcu ultrafialovú mapu oblohy. Astrofyzik opisuje agentov, ktorí zhromaždili prehliadky, krížovo ich kalibrovali a predpovedali nepozorované oblasti s vrstvami neistoty. Ide o prípadovú štúdiu laboratória z prvej ruky, nie nezávislé hodnotenie Claude Science. Priamy zdroj: anthropic.com

Quesma porovnáva vizualizácie miest z jedného promptu. Viaceré špičkové modely dostali rovnaký šesťhodinový prompt na vykreslenie všetkých 55 miest z Neviditeľných miest a vytvorili prepojené interaktívne výsledky s rôznymi nákladmi. Hodnotenie dizajnu je subjektívne, no výstupy možno skontrolovať. Priamy zdroj: quesma.com

Inžinier DeepSeek očakáva kernely písané AI. Príspevok na LessWrong sumarizuje a čiastočne prekladá čínsku esej, ktorej autor očakáva, že agenti sa jeho práci na kerneloch vyrovnajú do roka, a obhajuje otvorené váhy. Je to sprostredkovaný názor jedného inžiniera. Priamy zdroj: lesswrong.com

Esej žiada priebežné hodnotenie sklonu k plánovanému klamstvu. Dylan Bowman tvrdí, že nezávislí hodnotitelia potrebujú trvalý prístup k trénovaniu a interným nasadeniam na testovanie bezpečnostných argumentov. Štvordielny rámec je regulačný názor, nie dôkaz o úspechu alebo zlyhaní laboratória. Priamy zdroj: lesswrong.com

Vývojár tvrdí, že DeepSeek Flash mení krivku nákladov. Autor uvádza, že mesačné používanie bolo pri bežnej práci blízke drahšiemu špičkovému modelu, ktorý si nechával na záverečnú kontrolu. Ide o anekdotu, no vystihuje význam dostatočne dobrých schopností za nízku cenu. Priamy zdroj: dgt.is

Hacker News

OpenAI stiahla tri matematické rukopisy. Chyba znamienka zneplatnila jeden argument a dve závislé práce, ďalšie rukopisy boli upravené; komentujúci diskutovali o kontrole matematiky vytvorenej AI vo veľkom rozsahu. Stiahnutie je podstatným vývojom od pôvodného zverejnenia. Priamy zdroj: news.ycombinator.com

Čitatelia diskutujú o DeepSeek 4.1 Flash. Používatelia hlásili nízke denné náklady agentov, ale slabšiu diskusiu o dizajne a vysvetlenia než pri prémiových modeloch; širšie tvrdenia o ekonomike hardvéru boli špekulatívne. Vlákno ponúka dojmy, nie kontrolované porovnanie. Priamy zdroj: news.ycombinator.com

Port TypeScriptu vytvorený LLM vyvoláva otázky údržby. Autor hlási 1,3 milióna riadkov Rustu, viac modelov a šesťciferné ocenenie tokenov podľa cenníka API. Diskusia spochybňuje náklady aj to, či kompatibilita a údržba port ospravedlnia. Priamy zdroj: news.ycombinator.com

Ukážka Invisible Cities dostáva zmiešané hodnotenie. Niektorí vývojári ocenili rozsah a podrobnosti pri priblížení, iní našli opakovanie a chyby geometrie. Ide o kvalitatívne posúdenie verejnej ukážky. Priamy zdroj: news.ycombinator.com

Whistle vtesnal rozpoznávanie reči do 16,9 MB. Testeri hlásili dobrú angličtinu a zmiešanú španielčinu, potom obrátili diskusiu k diktovaniu, váhaniu a interpunkcii. Vlákno užitočne oddeľuje veľkosť súboru od použiteľnosti. Priamy zdroj: news.ycombinator.com

Reddit

Tvrdenia o výkone Saluki 27B vyvolávajú otázky. Diskutujúci spochybňovali, či dotrénovanie odôvodňuje nový názov, a žiadali silnejšie miery odlišnosti od základu Qwen. Hlavné tvrdenie o porovnateľnom výkone zostáva tvrdením vydavateľa. Priamy zdroj: old.reddit.com

Osem kariet Radeon V620 spúšťa vlastný fork vLLM. Autor zostavy uvádza, že kernely RDNA2 písané agentom využil v lokálnom systéme s 256 GB pamäte za 2 800 dolárov. Výkon je podľa autora, no poznámky o hardvéri a kerneloch pomáhajú neobvyklým lokálnym nasadeniam. Priamy zdroj: old.reddit.com

Doladenia Qwen prešli doménovým testom so 469 položkami. Súkromné doménové skóre autora zvýhodnilo jeden lokálny model na kód, no na jeho hardvéri bol oveľa pomalší než hostované špičkové systémy. Rozdielna kvantizácia poskytovateľov a vlastná metrika obmedzujú zovšeobecnenie. Priamy zdroj: old.reddit.com

Slow Vale koordinuje 800 trvalých agentov. Vývojár opisuje udržiavanie dlhého kontextu v časovom okne cache poskytovateľa a stovky volaní na postavu denne. Komentujúci uvádza výrazné zrýchlenie obnovy lokálnej predpony, no obe čísla sú komunitné merania. Priamy zdroj: old.reddit.com

DreamDojo vyvoláva diskusiu o recenznom konaní. Autor kritizuje malé zlepšenia modelu sveta vzhľadom na uzavreté dáta a výpočty, kým odpovede diskutujú o zvýhodnení veľkých laboratórií. Obvinenia o recenznom procese sú neovereným komunitným názorom. Priamy zdroj: old.reddit.com

YouTube

Neo4j mení pamäť agentov na typované zručnosti. Will Lyon v anglickej prednáške AI Engineer predstavuje kontextové a vykonávacie grafy odvodené z minulých rozhodnutí s kontrolou ukotvenia a zastarania. Ide o architektúru dodávateľa a výsledky benchmarkov zostávajú tvrdeniami rečníka. Priamy zdroj: youtube.com

LangChain chápe poznatky ako trvalú pamäť. Jake Broekhuizen oddeľuje uložené záznamy od procedurálneho návodu, ktorý mení budúce správanie, a pri kľúčových pravidlách odporúča ľudskú kontrolu. Anglická prednáška ponúka konkrétny cyklus čítania, filtrovania a zápisu. Priamy zdroj: youtube.com

Amazon AGI Lab opisuje hranicu dôvery v spoľahlivosť. Felipe Blanes tvrdí, že približne 80 % spoľahlivosť pôsobí ako práca navyše a asi 92 % ako dôveryhodný systém. Prahy sú názorom rečníka, no štvorstupňový cyklus hodnotenia je praktický. Priamy zdroj: youtube.com

Orkes oddeľuje plánovanie od trvalého vykonávania. Viren Baraiya ukazuje LLM, ktorý vytvára plány, kým deterministický workflow zaznamenáva vedľajšie účinky, schválenia a opakovania. Anglická prednáška dodávateľa považuje riadiacu vrstvu za dlhotrvajúcu aplikáciu. Priamy zdroj: youtube.com

Reducto prestavalo MCP server na menší počet nástrojov. Abhi Arya tvrdí, že nástroje kopírujúce API endpointy vytvárali nevysvetliteľné workflow, preto tím odhalil vyššie pracovné štruktúry a viditeľnú sebadôveru. Anglická prednáška je užitočným opisom návrhu nástrojov z prvej ruky. Priamy zdroj: youtube.com

Postman mapuje mikroslužby pre programovacích agentov. Kamalakannan Nandagopal opisuje graf kontextu API založený na kóde a prevádzkovej telemetrii vrátane zlyhania po zastaraní grafu. Zlepšenia v hodnotení uvádza spoločnosť. Priamy zdroj: youtube.com

Hugging Face ukazuje Buckets postavené na Xet. Anglický návod predvádza obsahovo definované bloky, ktoré pri veľkých CSV a Parquet súboroch nahrajú iba zmenené časti. Ide o reprodukovateľnú úložnú techniku, nie vydanie modelu. Priamy zdroj: youtube.com

Cognitive Revolution diskutuje o ekonomike agentov. Anglická epizóda spája dojmy z konferencie s názormi na pamäťové obmedzenia, podnikový softvér a náhodné roje agentov. Závery sú názormi hostí, nie meraniami. Priamy zdroj: youtube.com

Two Minute Papers predstavuje AlphaGenome Atlas. Anglické video vysvetľuje snahu DeepMind mapovať predpokladané účinky zmien jednotlivých písmen DNA, používa však prehnaný titulok a odkazy na pôvodný projekt. Zhrnutie vychádza z opisu, nie prepisu. Priamy zdroj: youtube.com

WorkOS sprístupňuje tvorbu interných aplikácií ľuďom mimo vývoja. Garrett Galow hlási 278 interných aplikácií za firemným prihlásením, pričom viac než tretina pravidelne používaných vznikla bez príspevkov inžinierov. Ide o vlastné čísla WorkOS. Priamy zdroj: youtube.com

Cory Doctorow diskutuje o opačných kentauroch. Anglický rozhovor Berkman Klein Center skúma ľudí slúžiacich strojovo riadeným systémom a ekonomiku AI infraštruktúry. Dostupný bol len krátky opis, takže ide o odkaz na Doctorowov argument. Priamy zdroj: youtube.com

scobel skúma silné stránky Nemecka v AI. Klaus Mainzer v nemčine diskutuje o štatistickom rozpoznávaní vzorov, emergencii, fyzickej AI a pozícii Európy. Program je filozofická analýza, nie technické hodnotenie. Priamy zdroj: youtube.com

Datenspuren pokrýva open-source bezpečnosť v ére LLM. Mirko Swillus v nemčine používa verejné dáta ekosystému na diskusiu o preťažení správcov a vzťahoch s veľkými dodávateľmi modelov. Spája technické vysvetlenie s politickými návrhmi pre Európu. Priamy zdroj: youtube.com

Datenspuren sa pýta, ako sa učiť hacking s AI. Nemecká prednáška Jörga Schneidera skúma, ako zachovať praktické objavovanie, keď agenti rýchlo riešia CTF úlohy. Jej hodnotou je vzdelávací rámec, nie benchmark. Priamy zdroj: youtube.com

Prednáška Datenspuren oddeľuje správanie od tvrdení o vedomí. Anglická prezentácia ponúka materialistický opis toho, čo jazykové modely preukázateľne robia a ako sa to líši od ľudskej skúsenosti. Závery sú pohľadom rečníka. Priamy zdroj: youtube.com

Datenspuren kritizuje AI kill chain Palantiru. Nemecká aktivistická prednáška Manuela Atuga opisuje vojenské a policajné využitie a tvrdí, že ohrozuje demokraciu. Tvrdenia aj závery patria rečníkovi. Priamy zdroj: youtube.com

AI v kostce testuje Astru na pôdorysoch. České video dá modelu jeden plán a viac fotografií; model si vyžiada nečitateľné rozmery a pripraví vstup pre Blender. Opis zdôrazňuje potrebu odbornej kontroly. Priamy zdroj: youtube.com

AI v kostce vytvára konfigurátor rekonštrukcie. Vratislav Blecha v češtine opisuje premenu plánu domu z roku 1938 na 3D nástroj na rekonštrukciu počas krátkych denných relácií s Astrou. Ide o skúsenosť autora jedného vedľajšieho projektu. Priamy zdroj: youtube.com

Stručne

Anthropic spúšťa Cyber Mission a OSS Scanner. Spoločnosť spája modely a inžinierov s dodávateľmi bezpečnosti kritickej infraštruktúry a oprávneným open-source projektom ponúka bezplatné pravidelné správy o zraniteľnostiach. Anthropic tvrdí, že skoršie skenovanie vytvorilo viac kandidátov, než ľudia zvládli preveriť, preto správy novej služby prichádzajú bez ľudskej kontroly. Priamy zdroj: anthropic.com

Prepustení výskumníci bezpečnosti OpenAI odmietajú obvinenia. Jasmine Wang, Tomek Korbak a Mikita Balesni popierajú únik citlivého výskumu a varujú pred odradzujúcim účinkom prepustenia; OpenAI tvrdí, že vyšetrovanie našlo vzorec pochybení. Otvorený list ponecháva sporné verzie, nie uzavreté zistenie. Priamy zdroj: techcrunch.com

Goodfire spúšťa aktivačné monitory agentov. Malé sondy kontrolujú interné aktivácie a vybrané kroky odovzdávajú ďalšiemu modelu; spoločnosť uvádza nižšie náklady a latenciu než pri monitorovaní celého prepisu. Miera detekcie pochádza z vlastných testov Goodfire na Kimi K3. Priamy zdroj: techcrunch.com

Shai-Hulud napadol npm SDK Tensorlake. Škodlivé vydanie balíka kradlo poverenia, šírilo sa cez tokeny a obsahovalo deštruktívne sledovanie tokenov, kým ho odstránili. Incident je dôležitý, pretože inštalačný skript bežal na vývojárskych a zostavovacích strojoch mimo sandboxu SDK. Priamy zdroj: theregister.com

Verejné služby NVIDIA odhalili flotily GPU. Výskumníci našli približne 2 100 verejných serverov DCGM Exporter, z ktorých niektoré mali aj chybu vyčerpania pamäte opravenú vo verzii 4.8.2. Expozícia odhalila údaje o hardvéri aj bez možnosti ovládania. Priamy zdroj: theregister.com

Tínedžera zachránili po použití turistických pokynov Claude. Kanadskí záchranári uviedli, že trasa poslala 16-ročného mladíka k úseku dostupnému len s lanom a vyžiadala si vrtuľník. Je to konkrétne varovanie pred používaním všeobecných asistentov ako autoritatívnej navigácie. Priamy zdroj: theguardian.com

Anthropic aktualizuje pravidlá používania. Verzia účinná od 12. novembra mení pravidlá pre voľby, podvody, zbrane, dohľad, autonómne konanie a vysoko rizikové profesionálne použitie a pridáva úzky zákaz trvalého zneužívania modelu. Tvorcovia agentov Claude musia zmenené obmedzenia preveriť pred týmto dátumom. Priamy zdroj: anthropic.com

Britský regulátor žiada dôkazy o AI agentoch. Desať vývojárov prijalo alebo prisľúbilo zmeny ochrany súkromia a Information Commissioner’s Office otvoril výzvu na dôkazy o agentoch do 20. novembra. Výsledky ovplyvnia zákonný kódex pre AI a automatizované rozhodovanie. Priamy zdroj: theregister.com

Útok dronom vyradil zónu Yandex Cloud. Yandex uviedol, že po požiari pripísanom ukrajinskému útoku nemožno zónu Sasovo v blízkej budúcnosti obnoviť. Fyzický útok sa tým stáva priamou otázkou odolnosti cloudu. Priamy zdroj: theregister.com

TSMC a GlobalFoundries uzavreli americkú dohodu o interposeroch. Päťročná dohoda za 2 miliardy dolárov sa týka kremíkových interposerov CoWoS z Malty v štáte New York, s objemovou výrobou až v roku 2028. Súčasné obmedzenie pokročilého balenia neuvoľní. Priamy zdroj: theregister.com

NVIDIA prisľúbila 1 miliardu dolárov americkej vede. Päťročný záväzok dopĺňa plánované superpočítače Department of Energy a otvára otázku, ako hardvér AI s nízkou presnosťou poslúži tradičným simuláciám. Oznámenie prišlo na vedeckom summite Bieleho domu. Priamy zdroj: theregister.com

NVIDIA opisuje bezpečnostnú vrstvu Halos pre roboty. Architektúra umiestňuje nezávislé bezpečnostné spracovanie vedľa výpočtov robota a vozidla, pričom Agility Robotics je menovaným používateľom. Funkcia vysvetľuje balenie funkčnej bezpečnosti pre fyzickú AI. Priamy zdroj: arstechnica.com

Biznis v skratke

OpenAI investorom oznámila anualizované tržby blížiace sa k 50 miliardám dolárov, pod skoršie uvádzaným porovnávacím číslom, a IPO sa údajne presúva na začiatok roka 2027. Priamy zdroj: techcrunch.com

Manus získal viac než 500 miliónov dolárov po tom, ako Čína nariadila zrušiť jeho akvizíciu firmou Meta, a údajne zvažuje vstup na burzu v Hongkongu. Priamy zdroj: techcrunch.com

Arena získala 200 miliónov dolárov v kole série B pri ohodnotení 3,1 miliardy dolárov, keď jej komerčné hodnotenie rastie za hranice verejného rebríčka. Priamy zdroj: techcrunch.com

Anthropic prisľúbil na tri roky 150 miliónov dolárov v kreditoch, školení a podpore americkej Genesis Mission vo viac než 15 agentúrach. Priamy zdroj: anthropic.com

NVIDIA údajne plánuje investovať do vývojára inferenčných čipov d-Matrix v rámci snahy o kompatibilitu s konkurenčnými dodávateľmi hardvéru. Priamy zdroj: theinformation.com

Čo z toho vyplýva: Dnešné vedľajšie príbehy opakovane ukazujú, že okolité systémy sú rovnako dôležité ako model: motivácie menia sebadôveru, cache náklady agentov, návrh nástrojov spoľahlivosť a napadnuté balíky obchádzajú sandbox, ktorý podporujú.

Čo bude ďalej: Zmeny pravidiel spoločnosti Anthropic začnú platiť 12. novembra, britská výzva na dôkazy sa končí 20. novembra a nové výskumné artefakty teraz čaká nezávislá replikácia.

Overenie

TvrdenieOznačeniePrimárny zdrojNezávislé overenie
Vydania a verejné artefakty projektovOVERENÉPriame odkazy pri každej položkežiadne, ak nie je uvedené
Tvrdenia o modeloch, benchmarkoch a výkonePODĽA SPOLOČNOSTIPriame odkazy pri každej položkežiadne
Výskumné zisteniaPODĽA SPOLOČNOSTIPrepojené štúdie a výskumné textyžiadne
Komunitné merania a ukážkyNEOVERENÉPrepojené vlákna Hacker News a Redditžiadne
Argumenty esejí, prednášok a rozhovorovNÁZORPrepojené eseje a videážiadne
Bezpečnostné, regulačné a infraštruktúrne udalostiČIASTOČNE OVERENÉPrepojené primárne alebo nezávislé spravodajstvoZdroje sú uvedené pri každej položke