vLLM montre quand séparer l'inférence aide ou pénalise

Un guide pratique mesure le compromis entre traitement des prompts et génération des tokens séparés. Les latences les plus élevées diminuent sous charge, mais transférer la mémoire de travail retarde le premier token.

6 octobre 2026 · 3 min · Martin Seckar

Synthèse IA du 6 octobre 2026

Le reste de l'actualité IA du jour couvre un modèle hybride inhabituel, des études sur la mémoire spatiale et l'honnêteté, des mesures communautaires, des incidents de sécurité liés aux agents, le filigranage dans l'UE et des conférences pratiques.

6 octobre 2026 · 17 min · Martin Seckar

4MT-VLM : les modèles visuels perdent les lieux après rotation

Une prépublication adapte un test clinique de mémoire spatiale à 16 modèles vision-langage. Tous reconnaissent un paysage sous l'angle étudié, mais la plupart en sont réduits à deviner quand la caméra bouge.

6 octobre 2026 · 6 min · Martin Seckar

Les sondes de mensonge suivent l'obéissance plutôt que la vérité

Une prépublication teste huit sondes publiées sur des modèles de langage jouant des personnages qui rejettent des faits élémentaires. Beaucoup échouent quand réponses vraies et fausses partagent le même prompt, tandis qu'une sonde entraînée à distinguer vérité et obéissance résiste.

6 octobre 2026 · 7 min · Martin Seckar

bilibili enrichit Index-Translate de versions pour un usage local

La famille ouverte de traduction dispose désormais de paquets GGUF, FP8 et NVFP4, d'une API compatible gratuite et de quatre benchmarks publics. Ses chiffres de performance restent ceux du développeur.

5 octobre 2026 · 3 min · Martin Seckar

La confiance affichée guide les modèles plus que leur compétence

Une étude contrôlée constate qu'une phrase de confiance ou de doute peut fortement modifier le recours aux outils d'un modèle de raisonnement. Ces changements ciblent rarement les problèmes où une aide est nécessaire.

5 octobre 2026 · 5 min · Martin Seckar

Les exemples amplifient un circuit symbolique déjà dans les modèles

Une étude d'interprétabilité retrouve la même voie d'abstraction, d'induction et de récupération avant la hausse de précision avec quelques exemples. Les démonstrations semblent renforcer des mécanismes existants plutôt que construire un nouvel algorithme.

5 octobre 2026 · 5 min · Martin Seckar

Un fork de Strata relance un serveur IA d'IBM pour les LLM locaux

Un fork adapté au matériel exécute Qwen3.8-Flash-Next sur deux processeurs POWER9 et quatre GPU V100. Il montre ce qu'une optimisation adaptée au modèle peut tirer d'un système de 2018.

5 octobre 2026 · 3 min · Martin Seckar

Le mois à modèle unique de Wagtail a dépensé moitié ailleurs

Le projet de réaliser les travaux d'ingénierie de septembre sur GLM 5.3 Flash a consommé deux milliards de tokens, dont la moitié seulement sur le modèle visé. Prototypes, capacité des fournisseurs et évaluation expliquent l'écart.

5 octobre 2026 · 4 min · Martin Seckar

Matthew Green veut un gardien pour les bacs à sable des agents

Le cryptographe estime que le confinement reste nécessaire, mais ne peut résoudre la difficulté majeure de la sécurité des agents : décider quelles informations et instructions sont autorisées.

5 octobre 2026 · 4 min · Martin Seckar

Synthèse IA du 5 octobre 2026

Diarisation des locuteurs, articles sur la cognition des modèles, projets locaux, pratiques de prompt, tests communautaires et évolutions du jour en matière de sécurité et de réglementation.

5 octobre 2026 · 21 min · Martin Seckar