RESEARCH · ZUR AKTUELLEN AUSGABE

AI THOR · RESEARCH-ARCHIV

Wissen, das erreichbar bleibt.

Jede veröffentlichte Einordnung behält ihre feste Adresse – auch wenn das nächste Drei-Tage-Briefing erscheint.

ENTWICKLUNGEN

AI-News und Einordnungen

21 BEITRÄGE

  1. 01

    04. September 2026

    Lokale Agenten rücken auf den Schreibtisch

    NVIDIA stellt zur IFA lokale Agenten-Workflows, PAIR für mehrere Rechner und RTX-Spark-Windows-PCs in Aussicht.

    LESEN →
  2. 02

    04. September 2026

    NVIDIA greift nach dem offenen KI-Marktplatz

    NVIDIA kündigt die Übernahme von Hugging Face an und verspricht, dessen Plattform offen und hardwareagnostisch zu halten.

    LESEN →
  3. 03

    04. September 2026

    OpenAI erklärt Astra zur Cyber-Kritikalität

    OpenAI stuft GPT-6 Astra im eigenen Framework als kritisch für Cybersecurity ein und beschreibt zusätzliche Schutzmaßnahmen.

    LESEN →
  4. 04

    17. August 2026

    InternLM trennt Wissen und Denken im Modell

    Intern-S2-Mobius trennt gespeichertes Wissen von iterativen Schlussfolgerungsschritten und ist als Modellartefakt veröffentlicht.

    LESEN →
  5. 05

    17. August 2026

    MobileMem verlegt Langzeitgedächtnis aufs Gerät

    MobileMem ist ein Benchmark und Framework für langzeitige, multimodale Gedächtnisaufgaben aus mobilen Erfahrungen.

    LESEN →
  6. 06

    17. August 2026

    RA-Bench stresst Detektoren mit Krisenvideos

    RA-Bench prüft die Erkennung KI-generierter Krisenvideos und meldet deutliche Generalisierungslücken bei heutigen Detektoren.

    LESEN →
  7. 07

    08. August 2026

    FinEvo misst, ob Agenten wirklich lernen

    Ein Team aus dem Alibaba-Cloud-Umfeld stellt einen Langzeitbenchmark vor, der prüft, ob Agenten Erfahrung in bessere professionelle Finanz-Workflows übersetzen.

    LESEN →
  8. 08

    08. August 2026

    MicroEvo lässt LLMs bessere Kerne suchen

    MicroEvo verbindet Sprachmodelle und Monte-Carlo-Tree-Search, um die teure Suche nach besseren Mikroarchitekturen gezielter zu machen.

    LESEN →
  9. 09

    08. August 2026

    TrajDebug jagt den ersten Agentenfehler

    TRAJDEBUG will in langen Agentenläufen den frühen Fehler finden, der bis zum endgültigen Scheitern wirksam bleibt.

    LESEN →
  10. 10

    26. Juli 2026

    Agenten zwingen Regulierung zum Perspektivwechsel

    Ein neuer Preprint argumentiert, dass Aufsicht für autonome KI die gesamte Liefer- und Betriebskette stärker berücksichtigen muss.

    LESEN →
  11. 11

    26. Juli 2026

    Korea verschaltet Chips, Compute und Robotik

    NVIDIA beschreibt neue Kooperationen mit koreanischen Partnern über KI-Fabriken, Speicher, Forschung und physische KI.

    LESEN →
  12. 12

    26. Juli 2026

    Meta lässt seinen Assistenten Aufgaben übernehmen

    Meta AI soll mit Muse Spark 1.1 planen, Apps verbinden, recherchieren und wiederkehrende Aufgaben bearbeiten.

    LESEN →
  13. 13

    19. Juli 2026

    Der Governance-Index legt Umsetzungslücken offen

    Der Global Index on Responsible AI zeigt, dass KI-Governance zwar weltweit wächst, verbindliche Umsetzung und Transparenz staatlicher Systeme aber häufig zurückbleiben.

    LESEN →
  14. 14

    19. Juli 2026

    Japan koppelt Fabriken enger an Physik-KI

    NVIDIA verknüpft in Japan AI-native Netze, offene Modelle, digitale Zwillinge und Robotik zu einer Infrastrukturgeschichte für physische KI.

    LESEN →
  15. 15

    19. Juli 2026

    OpenAI misst KI an erledigter Arbeit

    OpenAI schlägt vor, KI nicht vor allem über Tokenkosten oder Nutzung zu bewerten, sondern über den Wert erfolgreich abgeschlossener Arbeit pro eingesetztem Dollar.

    LESEN →
  16. 16

    17. Juli 2026

    GPU-Code-Agenten treffen auf Produktionsrealität

    Atrex-Bench bewertet LLM-generierte GPU-Kernels anhand von Produktions-Inferenztraces und zeigt die Lücke zwischen formaler Korrektheit und realer Hardwareeffizienz.

    LESEN →
  17. 17

    17. Juli 2026

    KI-Governance gewinnt Regeln, verliert aber Zähne

    Der Global Index on Responsible AI dokumentiert wachsende nationale KI-Politik, aber weiterhin Lücken bei verbindlichen Schutzmechanismen, Transparenz und Abhilfe.

    LESEN →
  18. 18

    17. Juli 2026

    Web-Diskussionen öffnen Datenvergiftern die Tür

    Ein frischer Preprint untersucht öffentliche Diskussionsflächen als möglichen Vektor, über den manipulierte Inhalte in Webkorpora für das Vortraining von Sprachmodellen geraten können.

    LESEN →
  19. 19

    14. Juli 2026

    Computer-Agenten skalieren mit prüfbaren Aufgaben

    Ein frischer Preprint zeigt, wie Computer-Use-Agenten mehr Übungsstoff bekommen und effizienter daraus lernen sollen. Das ist keine Produktankündigung. Es ist aber genau die unspektakuläre Infrastrukturarbeit, aus der die nächste Welle klickender Assistenten wahrscheinlich entsteht.

    LESEN →
  20. 20

    14. Juli 2026

    Forscher legen Bias von KI-Juroren frei

    Wenn ein Sprachmodell andere Modellantworten bewertet, wird es schnell zum stillen Schiedsrichter in Trainings- und Evaluationspipelines. Ein neuer Preprint versucht, dessen Verzerrungen nicht nur an den Eingaben, sondern im inneren Zustandsraum sichtbar und steuerbar zu machen.

    LESEN →
  21. 21

    14. Juli 2026

    MoE-Chips verschieben heiße Experten klüger

    Bei Mixture-of-Experts-Modellen werden nicht alle Teilnetze gleich oft gebraucht. Ein neuer Chiplet-Preprint versucht deshalb nicht nur Token herumzuschieben, sondern die besonders gefragten Experten dort wohnen zu lassen, wo Rechenzeit, Speicher und Warteschlangen gerade Luft haben.

    LESEN →

FORSCHUNG

Paper und Forschungsimpulse

18 BEITRÄGE

  1. 01

    03. September 2026

    EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction

    EarlyEval sagt den Ausgang von Agentenläufen aus Zwischenverhalten vorher und beendet aussichtslose Ausführungen frühzeitig.

    LESEN →
  2. 02

    03. September 2026

    Language Models Can Control Their Own Attention

    Declarative Attention lässt Modelle ihren Kontextfokus in drei Modi angeben und reduziert dadurch die berücksichtigten Tokens bei langen Kontexten.

    LESEN →
  3. 03

    03. September 2026

    Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills

    DisCo verdichtet Machine-Learning-Repositorien zu verifizierten Skills, damit Forschungsagenten mit konstantem Modell und Budget handlungsfähiger werden.

    LESEN →
  4. 04

    07. August 2026

    AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

    AgentOPSD erzeugt turngenaue Lernsignale für langlaufende Agenten aus rekursiver Selbst-Distillation – ohne separaten Kritiker und ohne zusätzliche Rollouts.

    LESEN →
  5. 05

    07. August 2026

    EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

    EnvACE lässt Agenten und Umwelt im Training abwechselnd simulieren, damit Tool-Agenten Umweltdynamik mit privaten Rehearsals intern üben können.

    LESEN →
  6. 06

    07. August 2026

    OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    OSReward misst, ob Vision-Language-Modelle Computer-Use-Agenten zuverlässig bewerten, und legt den verbreiteten Nachsichtigkeitsbias heutiger Richter offen.

    LESEN →
  7. 07

    24. Juli 2026

    AREX: Towards a Recursively Self-Improving Agent for Deep Research

    AREX verbindet rekursive Selbstverbesserung, Teilverifikation und Kontextkompression für lange Deep-Research-Aufgaben.

    LESEN →
  8. 08

    24. Juli 2026

    LLMs Get Lost in Evolving User Intent

    Ein Framework überführt statische Benchmarks in kontrollierte Multi-Turn-Szenarien mit sich verändernder Nutzerabsicht.

    LESEN →
  9. 09

    24. Juli 2026

    NVIDIA-labs OO Agents: Native Python Object-Oriented Agents

    NOOA modelliert Agenten als Python-Objekte mit typisierten Methoden für Aktionen und Feldern für Zustand.

    LESEN →
  10. 10

    17. Juli 2026

    BadWAM: When World-Action Models Dream Right but Act Wrong

    BadWAM zeigt, wie kleine visuelle Störungen die Kopplung zwischen vorhergesagter Zukunft und ausgeführter Aktion in World-Action Models lösen können.

    LESEN →
  11. 11

    17. Juli 2026

    SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

    SearchOS-V1 macht Suchfortschritt in Multi-Agenten-Systemen als persistenten, geteilten Zustand explizit und soll damit Wiederholungen, Budgetverschwendung und unvollständige Antworten verringern.

    LESEN →
  12. 12

    17. Juli 2026

    VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

    VideoChat3 ist ein offenes Video-MLLM mit 4 Milliarden Parametern, das effizientes und domänenübergreifendes Videoverstehen durch Architektur- und Datenentscheidungen verbindet.

    LESEN →
  13. 13

    15. Juli 2026

    Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

    Funktionsbewusstes Fill-in-the-Middle-Mid-Training soll Code-Agenten besser auf die Verarbeitung von Tool-Ergebnissen vorbereiten.

    LESEN →
  14. 14

    15. Juli 2026

    Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution

    ACQUIRE lässt einen Agenten Wissenslücken im Repository zuerst als Fragen klären und erzeugt Patches erst auf Basis der evidenzgestützten Antworten.

    LESEN →
  15. 15

    15. Juli 2026

    SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

    SynthDocBench prüft visuelle Sprachmodelle mit kontrolliert erzeugten Langdokumenten und macht Fehler durch Länge, Position, Layout und Charts sichtbar.

    LESEN →
  16. 16

    14. Juli 2026

    LightMem-Ego: Your AI Memory for Everyday Life

    LightMem-Ego strukturiert kontinuierliche visuelle und auditive Alltagsdaten in ein hierarchisches, multimodales Gedächtnis für evidenzbasierte Assistenz.

    LESEN →
  17. 17

    14. Juli 2026

    Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals

    PUST trennt die Exploration von Optimierungssignalen über ein leichtgewichtiges Proxy-Modell von der Ausrichtung eines stärkeren Hauptmodells.

    LESEN →
  18. 18

    14. Juli 2026

    Weak-to-Strong Generalization via Direct On-Policy Distillation

    Direct-OPD überträgt Verstärkungslern-Effekte schwächerer Lehrermodelle auf stärkere Schülermodelle, ohne deren erneutes Voll-RL.

    LESEN →

VON DER EINORDNUNG ZUR UMSETZUNG

Was bedeutet das für Ihr Unternehmen?