RESEARCH · ZUR AUSGABE

FORSCHUNGSIMPULS · 07. August 2026

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE lässt Agenten und Umwelt im Training abwechselnd simulieren, damit Tool-Agenten Umweltdynamik mit privaten Rehearsals intern üben können.

WARUM DAS WICHTIG IST

Der Ansatz macht einen praktisch relevanten Vorschlag, externe Interaktion in Agententraining und Inferenz teilweise durch kontrollierte interne Umweltsimulation zu ergänzen.

AI THOR · VISUELLE EINORDNUNG

Vom Forschungsproblem zur praktischen Bedeutung

Aus der vorliegenden Paper-Analyse abgeleitet

01

Ausgangslage

EnvACE lässt Agenten und Umwelt im Training abwechselnd simulieren, damit Tool-Agenten Umweltdynamik mit privaten Rehearsals intern üben können.

02

Methode

Alternierender Rollenwechsel zwischen Agent und Umwelt

03

Befund

World Rehearsal ersetzt Teile der externen Umweltinteraktion durch alternierende Agent- und Umweltsimulation.

04

Anwendung

Agent-Umwelt-Rollenspiele in einen bestehenden RL-Trainingsloop integrieren.

05

Grenze

Die Wirkung hängt von Qualität und Generalisierbarkeit des internen Weltmodells ab.

Redaktionelle Strukturvisualisierung von AI THOR; keine Originalabbildung des Papers.

DIE ANALYSE IM DETAIL

Was das Paper Kapitel für Kapitel zeigt.

Die folgenden Abschnitte verdichten die vollständige Paper-Analyse auf Deutsch, ohne die zentralen Argumentationsschritte auszulassen.

01

ABSTRACT

Vorstellung von EnvACE, einer agentischen RL-Methode, die externen Umwelteinfluss durch internalisiertes World Rehearsal ersetzt, um handlungsbasierte Agentenleistung zu verbessern. Starke Leistung auf diversen Benchmarks und Möglichkeit privater Rehearsals zur Effizienzsteigerung.

02

INTRODUCTION

Diskussion der steigenden Anforderungen an LLM-Agenten für langfristige Toolnutzung in realen Umgebungen. Betonung auf vielfältige Trainingsdaten und verifizierbare Belohnungssignale durch ausführbare Umgebungen oder Simulatoren. Motivation für neue Trainingswege jenseits komplexer Umgebungen.

03

EnvACE, an agentic reinforcement learning method that replaces

Beschreibung des Kernprinzips von EnvACE: Wechselnde Rollen von Agent (Toolaufruf) und Umwelt (Reaktionssimulation) in einem iterativen Lernprozess. Gemeinsame End-to-End-Optimierung anhand des Aufgabenerfolgs. Vorteilhafte Internalisierung von Umweltreaktionen innerhalb der Modellparameter.

04

Real Environment

Definition der klassischen RL-Rollouts mit echter Umweltinteraktion als Baseline und Referenzpunkt für Effizienz und Realitätsnähe in Trainingsprozessen.

05

External LLM Simulator

Beschreibung äußerer Simulatoren als Ersatz für reale Umgebungen bei RL-Training und deren Herausforderungen in Erdung und Realismus.

06

Action / Rollout

Wiederholte Nennung von Aktion und Rollout-Phasen verdeutlicht die zyklische Entscheidungsausführung und Ergebnisbeobachtung, zentral für Politik- und Modelltraining.

ABSTRACT IM ORIGINAL LESEN

Training large language model agents for long-horizon tool use typically relies on interactions with real or synthesized executable environments, whose construction and verification are costly, or on external simulators that are difficult to ground. We introduce EnvACE, an agentic reinforcement learning method that replaces external environment interaction during training with world rehearsal. The policy alternates between acting and rehearsal: it first generates a tool call, then plays the role of the environment to produce the response induced by that action, and conditions subsequent decisions on the rehearsed response. Both roles are jointly optimized end-to-end using task-success rewards. Through world rehearsal, the policy internalizes the relationship between actions and their environment responses in its parameters, yielding an agent world model that directly supports decision making. Across BFCL-v4, tau^2-Bench, VitaBench, and FinMCP-Bench, EnvACE achieves strong and transferable performance, outperforming environment-scaling baselines in the overall evaluation. Controlled studies further show that world rehearsal consistently improves policy learning across model scales. At test time, the internalized world model enables private rehearsal before committed execution, yielding further gains under a moderate rehearsal budget without additional external interaction. Our findings establish world rehearsal as a new path toward scaling LLM agent training beyond the constraints of external environments. Our code is publicly available at this https URL .

DIE KERNPUNKTE

  1. 01

    World Rehearsal ersetzt Teile der externen Umweltinteraktion durch alternierende Agent- und Umweltsimulation.

  2. 02

    EnvACE übertrifft die betrachteten environment-scaling-Baselines auf BFCL-v4, tau²-Bench, VitaBench und FinMCP-Bench.

  3. 03

    Die Methode verbessert laut Analyse Trainingsstabilität und Policy-Performance modellübergreifend.

  4. 04

    Private Rehearsals sollen die Verfeinerung ohne zusätzliche Kosten externer Umweltinteraktion ermöglichen.

VORGEHEN

  • Alternierender Rollenwechsel zwischen Agent und Umwelt
  • End-to-End-Optimierung beider Rollen mit Reward-Signalen
  • Private Rehearsal-Loops während der Inferenz

PRAKTISCHE ANKNÜPFUNGSPUNKTE

  • Agent-Umwelt-Rollenspiele in einen bestehenden RL-Trainingsloop integrieren.
  • Toolorientierte LLMs mit einer Policy- und einer Umweltsimulationskomponente verbinden.
  • Private Rehearsal-Loops zunächst in kontrollierten Deployment-Szenarien testen.

VON DER EINORDNUNG ZUR UMSETZUNG

Was bedeutet das für Ihr Unternehmen?