Vision-Language-Modelle könnten abstrakte visuelle Vergleiche durch zwei konkurrierende interne Prozesse lösen: einen frühen, der sichtbaren Objekten folgt, und einen späteren, der Beziehungen zwischen ihnen darstellt.

Das ist die zentrale Erkenntnis eines Preprints von Minegishi, Furuta, Kojima und Kollegen. Das Team passte eine Relational-Match-to-Sample-Aufgabe aus der Entwicklungs- und vergleichenden Psychologie an und testete geschlossene Spitzensysteme sowie offene Modelle mit kontrollierten Bildern.

Warum das wichtig ist

Für Forscher, die visuelles Schlussfolgern bewerten, verrät eine richtige Antwort allein nicht, ob ein Modell die zugrunde liegende Regel abgeglichen oder lediglich ähnliche Formen erkannt hat. Die Studie bietet eine Möglichkeit, diese Wege zu trennen und dann auf den mit abstrakten Beziehungen verbundenen Weg einzuwirken.

Jede Aufgabe zeigt ein Beispielpaar von Objekten und fragt, welches Kandidatenpaar dieselbe Beziehung aufweist. Ein Kandidat kann die Beziehung erhalten und die Objekte verändern; ein anderer kann das äußere Erscheinungsbild erhalten und die Beziehung verändern. Dieser Konflikt zeigt, ob das Modell Identität oder Struktur folgt.

In den Familien GPT, Claude, Gemini, Qwen3.5, Gemma 4 und InternVL3 verschoben vier Änderungen die Antworten hin zu Beziehungen: eine leistungsfähigere Modellstufe, ein größeres Modell, weniger Objekte in der Szene und weniger Rauschen an jedem Objekt. Die Autoren vergleichen diese Entwicklung mit dem „relationalen Wandel“, der in der menschlichen Entwicklung beobachtet wird. Die Ähnlichkeit betrifft aber das Verhalten und beweist keinen gemeinsamen kognitiven Mechanismus.

Die interne Analyse fand die beiden Signale in unterschiedlichen Tiefen. Repräsentationen in früheren Schichten gruppierten Beispiele nach Merkmalen auf Objektebene, spätere Schichten nach der abstrakten Beziehung. Tests zur kausalen Mediation identifizierten anschließend Aufmerksamkeitsköpfe, deren Aktivität zu beziehungsbasierten Antworten beitrug.

Ein Eingriff verbindet den Schaltkreis mit einer anderen Aufgabe

Das stärkste Ergebnis stammt aus dem Deaktivieren der Köpfe, die mit dem Beziehungsabgleich verbunden sind. Die Autoren berichten, dies beeinträchtige die Leistung auf ARC-AGI-1 stärker als das Deaktivieren zufällig gewählter Köpfe. Dieser Transfer ist wichtig, weil die Köpfe anhand der psychologischen Abgleichaufgabe gefunden und nicht direkt zur Erklärung von ARC-Ergebnissen ausgewählt wurden.

Die Aussagekraft bleibt eng begrenzt. Eine Gruppe von Köpfen kann zu zwei Aufgaben beitragen, ohne ein universelles Reasoning-Modul zu bilden. Die Reize sind bewusst einfach. Die Studie belegt nicht, dass dieselbe Konkurrenz die Erkennung in Fotografien, Diagrammen oder langen multimodalen Gesprächen steuert.

Die Studie nutzt außerdem zwei unterschiedliche Zugriffsebenen. Verhaltensergebnisse können proprietäre API-Modelle einschließen, doch die schichtweise Untersuchung der Repräsentationen und die Ablation erfordern offene Gewichte. Die Aussage über den Mechanismus beruht daher auf den intern untersuchten offenen Modellen, während der breitere Familienvergleich das Verhalten betrifft.

Der parametrische Aufbau ist ein Vorteil für Reproduktionen. Objektzahl und visuelles Rauschen lassen sich getrennt verändern. Ein anderes Team kann dadurch testen, ob die Trennung zwischen den Schichten bei neuen Formen, Beziehungen und Modellfamilien bestehen bleibt. Die Abstract-Seite nennt kein öffentliches Code-Repository. Um den vollständigen Eingriff zu reproduzieren, wird daher mehr nötig sein als das Herunterladen eines Benchmarks.

Das Paper wurde am 6. Oktober 2026 bei arXiv eingereicht und hat kein Peer-Review durchlaufen. Sein nützlicher Beitrag ist eine falsifizierbare Brücke zwischen einer klassischen kognitiven Aufgabe und internen Modellschaltkreisen: Das Folgen von Beziehungen sollte schwächer werden, wenn der identifizierte späte Weg gestört wird, während der Objektabgleich vergleichsweise intakt bleiben sollte.

Überprüfung

BehauptungEinstufungPrimärquelleUnabhängige Überprüfung
Die Studie testet den Beziehungsabgleich mit führenden API- und offenen Vision-Language-ModellenLAUT UNTERNEHMENPreprintkeine; Bewertung der Autoren
Größe, Leistungsfähigkeit, weniger Objekte und weniger Rauschen verschieben Modelle zum BeziehungsabgleichLAUT UNTERNEHMENPreprintkeine
Frühe Schichten kodieren Objektähnlichkeit, spätere abstrakte BeziehungenLAUT UNTERNEHMENPreprintkeine
Die Ablation beziehungsbezogener Köpfe schadet ARC-AGI-1 stärker als die Ablation zufälliger KöpfeLAUT UNTERNEHMENPreprintkeine
Verhaltensähnlichkeit beweist keinen gemeinsamen menschlichen MechanismusANALYSEPreprintSchlussfolgerung aus dem Studienaufbau
Der Preprint wurde am 6. Oktober 2026 eingereichtVERIFIZIERTarXiv-EintragarXiv-Metadaten