RESEARCH · ZUR AUSGABE

FORSCHUNGSIMPULS · 14. Juli 2026

Weak-to-Strong Generalization via Direct On-Policy Distillation

Direct-OPD überträgt Verstärkungslern-Effekte schwächerer Lehrermodelle auf stärkere Schülermodelle, ohne deren erneutes Voll-RL.

WARUM DAS WICHTIG IST

Der Ansatz kann Post-Training effizienter machen, weil implizite Reward-Signale aus vorhandenen Vor-/Nach-RL-Lehrercheckpoints auf on-policy Zustände eines stärkeren Zielmodells übertragen werden.

AI THOR · VISUELLE EINORDNUNG

Vom Forschungsproblem zur praktischen Bedeutung

Aus der vorliegenden Paper-Analyse abgeleitet

01

Ausgangslage

Direct-OPD überträgt Verstärkungslern-Effekte schwächerer Lehrermodelle auf stärkere Schülermodelle, ohne deren erneutes Voll-RL.

02

Methode

Direct On-Policy Distillation

03

Befund

Direct-OPD überträgt beobachtete RL-Effekte auf stärkere Schülermodelle ohne erneutes RL auf dem Zielmodell.

04

Anwendung

Vor- und Nach-RL-Checkpoints eines Lehrermodells als Ausgangspunkt verwenden.

05

Grenze

Die Qualität und Relevanz der schwachen Lehrerpolitik begrenzen den Nutzen.

Redaktionelle Strukturvisualisierung von AI THOR; keine Originalabbildung des Papers.

DIE KERNPUNKTE

  1. 01

    Direct-OPD überträgt beobachtete RL-Effekte auf stärkere Schülermodelle ohne erneutes RL auf dem Zielmodell.

  2. 02

    Das Log-Ratio zwischen Post-RL- und Pre-RL-Lehrerpolitik dient als dichter impliziter Reward.

  3. 03

    Direkte Distillation des Post-RL-Lehrers bleibt laut Analyse hinter der Methode zurück, weil sie Grenzen des schwächeren Lehrers mittransportiert.

  4. 04

    Im Bericht wird für Qwen3-1.7B auf AIME 2024 ein Zuwachs von zehn Prozentpunkten bei rund vier Stunden auf acht A100 genannt.

VORGEHEN

  • Direct On-Policy Distillation
  • Log-Ratio als impliziter Reward
  • On-policy Optimierung des stärkeren Schülermodells
  • Sequenzielle Komposition von Policy-Shifts

PRAKTISCHE ANKNÜPFUNGSPUNKTE

  • Vor- und Nach-RL-Checkpoints eines Lehrermodells als Ausgangspunkt verwenden.
  • Den impliziten Reward in eine bestehende Post-Training-Pipeline integrieren.
  • Die Abdeckung der on-policy Zustände und die Passung zwischen Lehrer und Zielmodell prüfen.

VON DER EINORDNUNG ZUR UMSETZUNG

Was bedeutet das für Ihr Unternehmen?