WARUM DAS WICHTIG IST
Der Ansatz macht einen praktisch relevanten Vorschlag, externe Interaktion in Agententraining und Inferenz teilweise durch kontrollierte interne Umweltsimulation zu ergänzen.
AI THOR · VISUELLE EINORDNUNG
Vom Forschungsproblem zur praktischen Bedeutung
Aus der vorliegenden Paper-Analyse abgeleitet
Ausgangslage
EnvACE lässt Agenten und Umwelt im Training abwechselnd simulieren, damit Tool-Agenten Umweltdynamik mit privaten Rehearsals intern üben können.
Methode
Alternierender Rollenwechsel zwischen Agent und Umwelt
Befund
World Rehearsal ersetzt Teile der externen Umweltinteraktion durch alternierende Agent- und Umweltsimulation.
Anwendung
Agent-Umwelt-Rollenspiele in einen bestehenden RL-Trainingsloop integrieren.
Grenze
Die Wirkung hängt von Qualität und Generalisierbarkeit des internen Weltmodells ab.
DIE ANALYSE IM DETAIL
Was das Paper Kapitel für Kapitel zeigt.
Die folgenden Abschnitte verdichten die vollständige Paper-Analyse auf Deutsch, ohne die zentralen Argumentationsschritte auszulassen.
ABSTRACT
Vorstellung von EnvACE, einer agentischen RL-Methode, die externen Umwelteinfluss durch internalisiertes World Rehearsal ersetzt, um handlungsbasierte Agentenleistung zu verbessern. Starke Leistung auf diversen Benchmarks und Möglichkeit privater Rehearsals zur Effizienzsteigerung.
INTRODUCTION
Diskussion der steigenden Anforderungen an LLM-Agenten für langfristige Toolnutzung in realen Umgebungen. Betonung auf vielfältige Trainingsdaten und verifizierbare Belohnungssignale durch ausführbare Umgebungen oder Simulatoren. Motivation für neue Trainingswege jenseits komplexer Umgebungen.
EnvACE, an agentic reinforcement learning method that replaces
Beschreibung des Kernprinzips von EnvACE: Wechselnde Rollen von Agent (Toolaufruf) und Umwelt (Reaktionssimulation) in einem iterativen Lernprozess. Gemeinsame End-to-End-Optimierung anhand des Aufgabenerfolgs. Vorteilhafte Internalisierung von Umweltreaktionen innerhalb der Modellparameter.
Real Environment
Definition der klassischen RL-Rollouts mit echter Umweltinteraktion als Baseline und Referenzpunkt für Effizienz und Realitätsnähe in Trainingsprozessen.
External LLM Simulator
Beschreibung äußerer Simulatoren als Ersatz für reale Umgebungen bei RL-Training und deren Herausforderungen in Erdung und Realismus.
Action / Rollout
Wiederholte Nennung von Aktion und Rollout-Phasen verdeutlicht die zyklische Entscheidungsausführung und Ergebnisbeobachtung, zentral für Politik- und Modelltraining.
ABSTRACT IM ORIGINAL LESEN
Training large language model agents for long-horizon tool use typically relies on interactions with real or synthesized executable environments, whose construction and verification are costly, or on external simulators that are difficult to ground. We introduce EnvACE, an agentic reinforcement learning method that replaces external environment interaction during training with world rehearsal. The policy alternates between acting and rehearsal: it first generates a tool call, then plays the role of the environment to produce the response induced by that action, and conditions subsequent decisions on the rehearsed response. Both roles are jointly optimized end-to-end using task-success rewards. Through world rehearsal, the policy internalizes the relationship between actions and their environment responses in its parameters, yielding an agent world model that directly supports decision making. Across BFCL-v4, tau^2-Bench, VitaBench, and FinMCP-Bench, EnvACE achieves strong and transferable performance, outperforming environment-scaling baselines in the overall evaluation. Controlled studies further show that world rehearsal consistently improves policy learning across model scales. At test time, the internalized world model enables private rehearsal before committed execution, yielding further gains under a moderate rehearsal budget without additional external interaction. Our findings establish world rehearsal as a new path toward scaling LLM agent training beyond the constraints of external environments. Our code is publicly available at this https URL .
DIE KERNPUNKTE
- 01
World Rehearsal ersetzt Teile der externen Umweltinteraktion durch alternierende Agent- und Umweltsimulation.
- 02
EnvACE übertrifft die betrachteten environment-scaling-Baselines auf BFCL-v4, tau²-Bench, VitaBench und FinMCP-Bench.
- 03
Die Methode verbessert laut Analyse Trainingsstabilität und Policy-Performance modellübergreifend.
- 04
Private Rehearsals sollen die Verfeinerung ohne zusätzliche Kosten externer Umweltinteraktion ermöglichen.
VORGEHEN
- — Alternierender Rollenwechsel zwischen Agent und Umwelt
- — End-to-End-Optimierung beider Rollen mit Reward-Signalen
- — Private Rehearsal-Loops während der Inferenz
PRAKTISCHE ANKNÜPFUNGSPUNKTE
- — Agent-Umwelt-Rollenspiele in einen bestehenden RL-Trainingsloop integrieren.
- — Toolorientierte LLMs mit einer Policy- und einer Umweltsimulationskomponente verbinden.
- — Private Rehearsal-Loops zunächst in kontrollierten Deployment-Szenarien testen.