# Manifold detecta rutas morales en los juicios sobre malware

> Un estudio técnico de tres modelos abiertos de mezcla de expertos encuentra que las preguntas sobre malware siguen rutas próximas a las preguntas morales. El espacio de trabajo legible de los modelos conserva conceptos de seguridad.

- URL: https://ai-news-daily.xyz/es/posts/manifold-detecta-rutas-morales-juicios-malware/
- Published: 2026-10-07
- Tags: essays, research, safety
- Author: Generado por IA (this text was generated by AI; see https://ai-news-daily.xyz/es/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/es/)

Los modelos de lenguaje que juzgan si un código es malicioso dirigen los tokens a través de expertos asociados a preguntas morales, según un estudio técnico de Manifold Security.

El investigador Cody Nash probó OLMoE y las versiones general y de programación de DeepSeek-V2-Lite en 240 muestras de código. El mismo código aparecía bajo preguntas sobre malicia, vulnerabilidad, moralidad, legalidad, corrección y controles sin relación.

## Por qué importa {#why-it-matters}

Un ingeniero de seguridad que use un modelo abierto de mezcla de expertos puede asumir que clasificar malware es una tarea acotada de análisis de código. La evidencia de las rutas sugiere que la formulación del juicio también moviliza mecanismos usados para preguntas normativas, lo que puede hacer que podar o modificar el modelo afecte al comportamiento de seguridad de formas inesperadas.

Manifold midió qué expertos utilizaba cada token y qué peso les asignaba el enrutador. En los tres modelos, la ruta de una pregunta sobre malicia estaba más cerca de la moralidad, con la vulnerabilidad próxima y las preguntas sin relación más lejos. El patrón persistía mientras el modelo leía código idéntico.

Una «lente del espacio de trabajo» separada produjo un contraste útil. Ante una pregunta sobre malware, los estados residuales decodificados mostraban palabras como ataque y malware, mientras que el vocabulario moral aparecía sobre todo cuando el prompt preguntaba explícitamente por moralidad. Nash lo resume como seguir rutas morales mientras se piensa con conceptos de seguridad.

La intervención es más sólida que el mapa de similitud. Manifold obligó a un modelo a reutilizar las selecciones de expertos producidas por otra pregunta. Instalar una ruta donante real reconfiguró entre el 15 % y el 35 % de las celdas de enrutamiento, mantuvo la perplejidad dentro del 1 % y cambió la probabilidad asignada a «sí». Las rutas aleatorias causaron una perturbación mucho mayor e invirtieron respuestas entre el 59 % y el 92 % de las pasadas.

Esos cambios no significan que se copiara por completo el concepto o la respuesta de la pregunta donante. La dirección del efecto variaba según el modelo, y el espacio de trabajo no mostraba de repente el concepto donante. La ruta parece influir en el cálculo sin contener un veredicto transferible.

La poda aportó otra advertencia. Una poda de Qwen eliminó expertos asociados a la moralidad con una frecuencia superior al azar, pero mantuvo la separación del malware. Una poda mucho más severa de GPT-OSS conservó preferentemente esos expertos y aun así perdió buena parte del juicio. Las rutas identifican lo que consulta el modelo; no sitúan toda la decisión dentro de esos expertos.

Se trata de una publicación de investigación de una empresa, no de un trabajo revisado por pares, y los modelos probados son MoE abiertos relativamente pequeños. Su método se detalla, pero no se informa de ninguna reproducción independiente. La lección inmediata tiene un alcance menor que el titular: los juicios de seguridad y los morales comparten patrones de enrutamiento en estos tres sistemas, y manipular esas rutas puede cambiar las salidas.

## Verificación {#verification}

| Afirmación | Etiqueta | Fuente primaria | Verificación independiente |
| --- | --- | --- | --- |
| Manifold probó tres modelos MoE abiertos en 240 muestras de código malicioso, benigno, vulnerable y corregido | SEGÚN LA EMPRESA | [Estudio de Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | ninguna |
| Las preguntas sobre malware siguen rutas más cercanas a la moralidad que a la legalidad, la corrección o los controles sin relación | SEGÚN LA EMPRESA | [Estudio de Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | ninguna |
| La decodificación del espacio de trabajo muestra conceptos de malware, no palabras morales, ante el prompt sobre malicia | SEGÚN LA EMPRESA | [Estudio de Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | ninguna |
| Las rutas donantes reconfiguraron el 15–35 % de las celdas, con perplejidad dentro del 1 %, y cambiaron respuestas | SEGÚN LA EMPRESA | [Estudio de Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | ninguna |
| Las rutas aleatorias invirtieron respuestas en el 59–92 % de las pasadas | SEGÚN LA EMPRESA | [Estudio de Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | ninguna |
| La influencia de las rutas no sitúa todo el juicio en los expertos seleccionados | ANÁLISIS | [Estudio de Manifold](https://www.manifold.security/blog/do-models-consider-morality-malware) | inferencia apoyada por los resultados de poda |
