# Agenten verkennen den Zusammenhang von Handlung und Ergebnis

> Ein Preprint findet, dass ein Großteil des Nutzens der Agentenhistorie auch nach dem Durchmischen früherer Handlungen erhalten bleibt. Jede Handlung ausdrücklich mit ihrem Ergebnis zu verbinden verbessert den Aufgabenabschluss.

- URL: https://ai-news-daily.xyz/de/posts/agenten-verkennen-zusammenhang-handlung-ergebnis/
- Published: 2026-10-06
- Tags: research, agents
- Author: KI-generiert (this text was generated by AI; see https://ai-news-daily.xyz/de/about/#ai-disclosure)
- Publisher: [AI News Daily](https://ai-news-daily.xyz/de/)

Sprachagenten verbinden eine frühere Handlung oft nicht mit der Beobachtung, die sie hervorgebracht hat, selbst wenn der vollständige Interaktionsverlauf im Kontext bleibt. Das berichtet ein neuer Preprint.

Jingyu Liu und vier Mitautoren untersuchten Agenten, die ihre früheren Handlungen und Rückmeldungen der Umgebung erhalten, bevor sie den nächsten Schritt wählen. Der Verlauf half gewöhnlich. Die alten Handlungen durchzumischen verursachte jedoch nur einen mäßigen Verlust. Das legt nahe, dass die Agenten die Aufzeichnung nutzten, ohne zuverlässig zu lernen, welche Handlung zu welchem Ergebnis geführt hatte.

## Warum das wichtig ist {#why-it-matters}

Für Ingenieure, die einen Agenten mit Werkzeugnutzung bauen, ist eine Transkription nur nützlich, wenn das Modell daraus lernen kann. Liest ein Agent frühere Ergebnisse als lose Hinweise, kann er gescheiterte Handlungen wiederholen oder den falschen Schritt als Ursache ansehen, obwohl jedes relevante Token vorhanden ist.

Die Forscher testeten die Hypothese, indem sie die Paarung von Handlung und Beobachtung aufbrachen. Sie mischten frühere Handlungen durch und ließen Beobachtungen an ihrem Platz. Die Transkription enthielt damit weiterhin einen Großteil derselben Sprache, bewahrte aber keine verlässliche kausale Abfolge mehr. Der Aufgabenabschluss sank weniger als erwartet.

Dieses negative Ergebnis verändert die Interpretation des Nutzens von Historie. Eine höhere Erfolgsquote mit mehr Transkription zeigt allein nicht, dass ein Agent nützliche Erfahrung gebildet hat. Das Modell könnte stattdessen Hinweise aus früheren Beobachtungen entnehmen oder einfach von zusätzlichem aufgabenbezogenem Text profitieren.

Die einfachste Korrektur des Teams fügte keine neuen Aufgabeninformationen hinzu. Jede Beobachtung wurde ausdrücklich als Ergebnis der unmittelbar vorherigen Handlung gekennzeichnet. Laut Preprint verbesserte diese Annotation den Aufgabenerfolg und verringerte Wiederholungen der nächsten Handlung.

## Ein Controller kann nützliche Erfahrung auswählen

Das Paper führt anschließend einen erlernten Handlungskalibrator ein. Er bewertet frühere Handlungen neu und zeichnet gezielt Erfahrung für spätere Entscheidungen auf, statt den Hauptagenten eine undifferenzierte Transkription interpretieren zu lassen. Die Autoren melden eine weitere Verbesserung über die ausdrücklichen Ergebniskennzeichnungen hinaus.

Der Entwurf trennt zwei Aufgaben, die Agentensysteme häufig verbinden: in einer Umgebung zu handeln und zu entscheiden, was die vorherige Interaktion gelehrt hat. Diese Aufteilung ist praktisch, weil sie sich in eine bestehende Agentenschleife einfügen lässt, ohne die Umgebung zu verändern oder externes Wissen hinzuzufügen.

Die zentralen Belege des Preprints betreffen das Verhalten. Er stellt nicht fest, welche Repräsentation das Modell intern bildet, und der Abstract nennt keinen öffentlichen Code-Link. Die gemeldeten Gewinne hängen außerdem von den getesteten Aufgaben, Modellen und dem Transkriptionsformat ab. Sie sollten daher nicht als universelle Schätzung für Produktionsagenten gelten.

Die Kontrolle mit durchmischtem Verlauf ist dennoch ungewöhnlich aufschlussreich. Sie unterscheidet „die Transkription half“ von „der Agent verstand seine Erfahrung“. Diese zwei Aussagen werden in Agentenevaluierungen oft als gleichwertig behandelt.

Liu, Zhiwen Wang, Yuxin Jing, Huanyu Zhou und Yong Liu reichten den Preprint am 2. Oktober 2026 ein. Die Änderung zur Ergebniskennzeichnung ist klar genug beschrieben, dass andere Agentenentwickler sie in ihren eigenen Schleifen testen können. Der erlernte Kalibrator wird dagegen ohne veröffentlichte Trainingsdetails und Code schwieriger zu bewerten sein.

## Überprüfung {#verification}

| Behauptung | Einstufung | Primärquelle | Unabhängige Überprüfung |
| --- | --- | --- | --- |
| Ein Großteil des Nutzens der Historie bleibt nach dem Durchmischen früherer Handlungen erhalten | LAUT UNTERNEHMEN | [Preprint von Liu et al.](https://arxiv.org/abs/2610.02769) | keine; Preprint-Ergebnis |
| Das Aufbrechen der Zuordnung von Handlung und Beobachtung verursacht nur einen mäßigen Rückgang | LAUT UNTERNEHMEN | [Preprint von Liu et al.](https://arxiv.org/abs/2610.02769) | keine |
| Ausdrückliche Ergebniskennzeichnungen verbessern den Aufgabenerfolg und verringern wiederholte Handlungen | LAUT UNTERNEHMEN | [Preprint von Liu et al.](https://arxiv.org/abs/2610.02769) | keine |
| Ein erlernter Kalibrator verbessert den Aufgabenerfolg über Ergebniskennzeichnungen hinaus | LAUT UNTERNEHMEN | [Preprint von Liu et al.](https://arxiv.org/abs/2610.02769) | keine |
| Das Ergebnis trennt den Nutzen der Transkription vom Lernen aus Handlung und Ergebnis | ANALYSE | [Preprint von Liu et al.](https://arxiv.org/abs/2610.02769) | Schlussfolgerung aus der Kontrolle mit durchmischtem Verlauf |
| Der Preprint wurde am 2. Oktober 2026 eingereicht | VERIFIZIERT | [arXiv-Eintrag](https://arxiv.org/abs/2610.02769) | arXiv-Metadaten |
