# Visuelle Modelle trennen Objekte von abstrakten Beziehungen

> Ein Preprint findet in Vision-Language-Modellen einen frühen Schaltkreis für Objektabgleich und einen späteren für Beziehungsabgleich. Letzteren verknüpft die Studie mit der Leistung auf ARC-AGI-1.

- URL: https://ai-news-daily.xyz/de/posts/visuelle-modelle-trennen-objekte-abstrakte-beziehungen/
- Published: 2026-10-07
- Tags: research, models
- Author: KI-generiert (this text was generated by AI; see https://ai-news-daily.xyz/de/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/de/)

Vision-Language-Modelle könnten abstrakte visuelle Vergleiche durch zwei konkurrierende interne Prozesse lösen: einen frühen, der sichtbaren Objekten folgt, und einen späteren, der Beziehungen zwischen ihnen darstellt.

Das ist die zentrale Erkenntnis eines Preprints von Minegishi, Furuta, Kojima und Kollegen. Das Team passte eine Relational-Match-to-Sample-Aufgabe aus der Entwicklungs- und vergleichenden Psychologie an und testete geschlossene Spitzensysteme sowie offene Modelle mit kontrollierten Bildern.

## Warum das wichtig ist {#why-it-matters}

Für Forscher, die visuelles Schlussfolgern bewerten, verrät eine richtige Antwort allein nicht, ob ein Modell die zugrunde liegende Regel abgeglichen oder lediglich ähnliche Formen erkannt hat. Die Studie bietet eine Möglichkeit, diese Wege zu trennen und dann auf den mit abstrakten Beziehungen verbundenen Weg einzuwirken.

Jede Aufgabe zeigt ein Beispielpaar von Objekten und fragt, welches Kandidatenpaar dieselbe Beziehung aufweist. Ein Kandidat kann die Beziehung erhalten und die Objekte verändern; ein anderer kann das äußere Erscheinungsbild erhalten und die Beziehung verändern. Dieser Konflikt zeigt, ob das Modell Identität oder Struktur folgt.

In den Familien GPT, Claude, Gemini, Qwen3.5, Gemma 4 und InternVL3 verschoben vier Änderungen die Antworten hin zu Beziehungen: eine leistungsfähigere Modellstufe, ein größeres Modell, weniger Objekte in der Szene und weniger Rauschen an jedem Objekt. Die Autoren vergleichen diese Entwicklung mit dem „relationalen Wandel“, der in der menschlichen Entwicklung beobachtet wird. Die Ähnlichkeit betrifft aber das Verhalten und beweist keinen gemeinsamen kognitiven Mechanismus.

Die interne Analyse fand die beiden Signale in unterschiedlichen Tiefen. Repräsentationen in früheren Schichten gruppierten Beispiele nach Merkmalen auf Objektebene, spätere Schichten nach der abstrakten Beziehung. Tests zur kausalen Mediation identifizierten anschließend Aufmerksamkeitsköpfe, deren Aktivität zu beziehungsbasierten Antworten beitrug.

## Ein Eingriff verbindet den Schaltkreis mit einer anderen Aufgabe

Das stärkste Ergebnis stammt aus dem Deaktivieren der Köpfe, die mit dem Beziehungsabgleich verbunden sind. Die Autoren berichten, dies beeinträchtige die Leistung auf ARC-AGI-1 stärker als das Deaktivieren zufällig gewählter Köpfe. Dieser Transfer ist wichtig, weil die Köpfe anhand der psychologischen Abgleichaufgabe gefunden und nicht direkt zur Erklärung von ARC-Ergebnissen ausgewählt wurden.

Die Aussagekraft bleibt eng begrenzt. Eine Gruppe von Köpfen kann zu zwei Aufgaben beitragen, ohne ein universelles Reasoning-Modul zu bilden. Die Reize sind bewusst einfach. Die Studie belegt nicht, dass dieselbe Konkurrenz die Erkennung in Fotografien, Diagrammen oder langen multimodalen Gesprächen steuert.

Die Studie nutzt außerdem zwei unterschiedliche Zugriffsebenen. Verhaltensergebnisse können proprietäre API-Modelle einschließen, doch die schichtweise Untersuchung der Repräsentationen und die Ablation erfordern offene Gewichte. Die Aussage über den Mechanismus beruht daher auf den intern untersuchten offenen Modellen, während der breitere Familienvergleich das Verhalten betrifft.

Der parametrische Aufbau ist ein Vorteil für Reproduktionen. Objektzahl und visuelles Rauschen lassen sich getrennt verändern. Ein anderes Team kann dadurch testen, ob die Trennung zwischen den Schichten bei neuen Formen, Beziehungen und Modellfamilien bestehen bleibt. Die Abstract-Seite nennt kein öffentliches Code-Repository. Um den vollständigen Eingriff zu reproduzieren, wird daher mehr nötig sein als das Herunterladen eines Benchmarks.

Das Paper wurde am 6. Oktober 2026 bei arXiv eingereicht und hat kein Peer-Review durchlaufen. Sein nützlicher Beitrag ist eine falsifizierbare Brücke zwischen einer klassischen kognitiven Aufgabe und internen Modellschaltkreisen: Das Folgen von Beziehungen sollte schwächer werden, wenn der identifizierte späte Weg gestört wird, während der Objektabgleich vergleichsweise intakt bleiben sollte.

## Überprüfung {#verification}

| Behauptung | Einstufung | Primärquelle | Unabhängige Überprüfung |
| --- | --- | --- | --- |
| Die Studie testet den Beziehungsabgleich mit führenden API- und offenen Vision-Language-Modellen | LAUT UNTERNEHMEN | [Preprint](https://arxiv.org/abs/2610.07646) | keine; Bewertung der Autoren |
| Größe, Leistungsfähigkeit, weniger Objekte und weniger Rauschen verschieben Modelle zum Beziehungsabgleich | LAUT UNTERNEHMEN | [Preprint](https://arxiv.org/abs/2610.07646) | keine |
| Frühe Schichten kodieren Objektähnlichkeit, spätere abstrakte Beziehungen | LAUT UNTERNEHMEN | [Preprint](https://arxiv.org/abs/2610.07646) | keine |
| Die Ablation beziehungsbezogener Köpfe schadet ARC-AGI-1 stärker als die Ablation zufälliger Köpfe | LAUT UNTERNEHMEN | [Preprint](https://arxiv.org/abs/2610.07646) | keine |
| Verhaltensähnlichkeit beweist keinen gemeinsamen menschlichen Mechanismus | ANALYSE | [Preprint](https://arxiv.org/abs/2610.07646) | Schlussfolgerung aus dem Studienaufbau |
| Der Preprint wurde am 6. Oktober 2026 eingereicht | VERIFIZIERT | [arXiv-Eintrag](https://arxiv.org/abs/2610.07646) | arXiv-Metadaten |
