vLLM 展示分离式服务何时有利、何时有弊
一份实用指南测量了分离提示词处理与 token 生成的权衡。负载下的尾部延迟有所改善,但转移模型工作内存会延迟首个 token。
一份实用指南测量了分离提示词处理与 token 生成的权衡。负载下的尾部延迟有所改善,但转移模型工作内存会延迟首个 token。
今天其余 AI 新闻涵盖一款不寻常的混合模型、空间记忆与诚实性研究、社区测量、智能体安全事件、欧盟水印和实用讲座。
一篇预印本将临床空间记忆测试改编后用于 16 个视觉语言模型。所有模型都能从学习时的角度识别景观,但镜头一移动,多数便只能猜测。
一篇预印本测试了八种已发布探针,让语言模型扮演否认基本事实的角色。真实和虚假答案共用提示词后,许多探针失效,而经过训练、能区分真相与服从的探针仍然有效。
这套开放翻译模型现已提供 GGUF、FP8 和 NVFP4 包、免费的兼容 API,以及四套公开基准测试。性能数字仍来自开发者自己。
一项受控研究发现,一句信心或怀疑表达就能显著改变推理模型是否调用工具,但这些变化很少针对真正需要帮助的问题。
一项可解释性研究发现,在少样本准确率上升之前,相同的抽象、归纳和检索路径就已存在。这表明示例强化了现有机制,而非构建新算法。
一个针对特定硬件的分支,在两个 POWER9 处理器和四张 V100 GPU 上运行 Qwen3.8-Flash-Next,展示了模型感知优化能从 2018年系统中释放的能力。
用 GLM 5.3 Flash 完成 9月工程工作的计划消耗了 20 亿 token,但只有一半交给目标模型。原型、服务商容量和评测解释了这一差距。
这位密码学家认为,隔离仍然必要,却无法解决智能体安全最难的部分:判断哪些信息和指令获得了授权。
说话人分离、模型认知论文、本地项目、提示词实践、社区测试,以及当天的安全与政策进展。