AI THOR · RESEARCH-ARCHIV
Wissen, das erreichbar bleibt.
Jede veröffentlichte Einordnung behält ihre feste Adresse – auch wenn das nächste Drei-Tage-Briefing erscheint.
ENTWICKLUNGEN
AI-News und Einordnungen
21 BEITRÄGE
- 01
04. September 2026
LESEN →Lokale Agenten rücken auf den Schreibtisch
NVIDIA stellt zur IFA lokale Agenten-Workflows, PAIR für mehrere Rechner und RTX-Spark-Windows-PCs in Aussicht.
- 02
04. September 2026
LESEN →NVIDIA greift nach dem offenen KI-Marktplatz
NVIDIA kündigt die Übernahme von Hugging Face an und verspricht, dessen Plattform offen und hardwareagnostisch zu halten.
- 03
04. September 2026
LESEN →OpenAI erklärt Astra zur Cyber-Kritikalität
OpenAI stuft GPT-6 Astra im eigenen Framework als kritisch für Cybersecurity ein und beschreibt zusätzliche Schutzmaßnahmen.
- 04
17. August 2026
LESEN →InternLM trennt Wissen und Denken im Modell
Intern-S2-Mobius trennt gespeichertes Wissen von iterativen Schlussfolgerungsschritten und ist als Modellartefakt veröffentlicht.
- 05
17. August 2026
LESEN →MobileMem verlegt Langzeitgedächtnis aufs Gerät
MobileMem ist ein Benchmark und Framework für langzeitige, multimodale Gedächtnisaufgaben aus mobilen Erfahrungen.
- 06
17. August 2026
LESEN →RA-Bench stresst Detektoren mit Krisenvideos
RA-Bench prüft die Erkennung KI-generierter Krisenvideos und meldet deutliche Generalisierungslücken bei heutigen Detektoren.
- 07
08. August 2026
LESEN →FinEvo misst, ob Agenten wirklich lernen
Ein Team aus dem Alibaba-Cloud-Umfeld stellt einen Langzeitbenchmark vor, der prüft, ob Agenten Erfahrung in bessere professionelle Finanz-Workflows übersetzen.
- 08
08. August 2026
LESEN →MicroEvo lässt LLMs bessere Kerne suchen
MicroEvo verbindet Sprachmodelle und Monte-Carlo-Tree-Search, um die teure Suche nach besseren Mikroarchitekturen gezielter zu machen.
- 09
08. August 2026
LESEN →TrajDebug jagt den ersten Agentenfehler
TRAJDEBUG will in langen Agentenläufen den frühen Fehler finden, der bis zum endgültigen Scheitern wirksam bleibt.
- 10
26. Juli 2026
LESEN →Agenten zwingen Regulierung zum Perspektivwechsel
Ein neuer Preprint argumentiert, dass Aufsicht für autonome KI die gesamte Liefer- und Betriebskette stärker berücksichtigen muss.
- 11
26. Juli 2026
LESEN →Korea verschaltet Chips, Compute und Robotik
NVIDIA beschreibt neue Kooperationen mit koreanischen Partnern über KI-Fabriken, Speicher, Forschung und physische KI.
- 12
26. Juli 2026
LESEN →Meta lässt seinen Assistenten Aufgaben übernehmen
Meta AI soll mit Muse Spark 1.1 planen, Apps verbinden, recherchieren und wiederkehrende Aufgaben bearbeiten.
- 13
19. Juli 2026
LESEN →Der Governance-Index legt Umsetzungslücken offen
Der Global Index on Responsible AI zeigt, dass KI-Governance zwar weltweit wächst, verbindliche Umsetzung und Transparenz staatlicher Systeme aber häufig zurückbleiben.
- 14
19. Juli 2026
LESEN →Japan koppelt Fabriken enger an Physik-KI
NVIDIA verknüpft in Japan AI-native Netze, offene Modelle, digitale Zwillinge und Robotik zu einer Infrastrukturgeschichte für physische KI.
- 15
19. Juli 2026
LESEN →OpenAI misst KI an erledigter Arbeit
OpenAI schlägt vor, KI nicht vor allem über Tokenkosten oder Nutzung zu bewerten, sondern über den Wert erfolgreich abgeschlossener Arbeit pro eingesetztem Dollar.
- 16
17. Juli 2026
LESEN →GPU-Code-Agenten treffen auf Produktionsrealität
Atrex-Bench bewertet LLM-generierte GPU-Kernels anhand von Produktions-Inferenztraces und zeigt die Lücke zwischen formaler Korrektheit und realer Hardwareeffizienz.
- 17
17. Juli 2026
LESEN →KI-Governance gewinnt Regeln, verliert aber Zähne
Der Global Index on Responsible AI dokumentiert wachsende nationale KI-Politik, aber weiterhin Lücken bei verbindlichen Schutzmechanismen, Transparenz und Abhilfe.
- 18
17. Juli 2026
LESEN →Web-Diskussionen öffnen Datenvergiftern die Tür
Ein frischer Preprint untersucht öffentliche Diskussionsflächen als möglichen Vektor, über den manipulierte Inhalte in Webkorpora für das Vortraining von Sprachmodellen geraten können.
- 19
14. Juli 2026
LESEN →Computer-Agenten skalieren mit prüfbaren Aufgaben
Ein frischer Preprint zeigt, wie Computer-Use-Agenten mehr Übungsstoff bekommen und effizienter daraus lernen sollen. Das ist keine Produktankündigung. Es ist aber genau die unspektakuläre Infrastrukturarbeit, aus der die nächste Welle klickender Assistenten wahrscheinlich entsteht.
- 20
14. Juli 2026
LESEN →Forscher legen Bias von KI-Juroren frei
Wenn ein Sprachmodell andere Modellantworten bewertet, wird es schnell zum stillen Schiedsrichter in Trainings- und Evaluationspipelines. Ein neuer Preprint versucht, dessen Verzerrungen nicht nur an den Eingaben, sondern im inneren Zustandsraum sichtbar und steuerbar zu machen.
- 21
14. Juli 2026
LESEN →MoE-Chips verschieben heiße Experten klüger
Bei Mixture-of-Experts-Modellen werden nicht alle Teilnetze gleich oft gebraucht. Ein neuer Chiplet-Preprint versucht deshalb nicht nur Token herumzuschieben, sondern die besonders gefragten Experten dort wohnen zu lassen, wo Rechenzeit, Speicher und Warteschlangen gerade Luft haben.
FORSCHUNG
Paper und Forschungsimpulse
18 BEITRÄGE
- 01
03. September 2026
LESEN →EarlyEval: Cheaper Agent Evaluation via Early Outcome Prediction
EarlyEval sagt den Ausgang von Agentenläufen aus Zwischenverhalten vorher und beendet aussichtslose Ausführungen frühzeitig.
- 02
03. September 2026
LESEN →Language Models Can Control Their Own Attention
Declarative Attention lässt Modelle ihren Kontextfokus in drei Modi angeben und reduziert dadurch die berücksichtigten Tokens bei langen Kontexten.
- 03
03. September 2026
LESEN →Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills
DisCo verdichtet Machine-Learning-Repositorien zu verifizierten Skills, damit Forschungsagenten mit konstantem Modell und Budget handlungsfähiger werden.
- 04
07. August 2026
LESEN →AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
AgentOPSD erzeugt turngenaue Lernsignale für langlaufende Agenten aus rekursiver Selbst-Distillation – ohne separaten Kritiker und ohne zusätzliche Rollouts.
- 05
07. August 2026
LESEN →EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning
EnvACE lässt Agenten und Umwelt im Training abwechselnd simulieren, damit Tool-Agenten Umweltdynamik mit privaten Rehearsals intern üben können.
- 06
07. August 2026
LESEN →OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
OSReward misst, ob Vision-Language-Modelle Computer-Use-Agenten zuverlässig bewerten, und legt den verbreiteten Nachsichtigkeitsbias heutiger Richter offen.
- 07
24. Juli 2026
LESEN →AREX: Towards a Recursively Self-Improving Agent for Deep Research
AREX verbindet rekursive Selbstverbesserung, Teilverifikation und Kontextkompression für lange Deep-Research-Aufgaben.
- 08
24. Juli 2026
LESEN →LLMs Get Lost in Evolving User Intent
Ein Framework überführt statische Benchmarks in kontrollierte Multi-Turn-Szenarien mit sich verändernder Nutzerabsicht.
- 09
24. Juli 2026
LESEN →NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
NOOA modelliert Agenten als Python-Objekte mit typisierten Methoden für Aktionen und Feldern für Zustand.
- 10
17. Juli 2026
LESEN →BadWAM: When World-Action Models Dream Right but Act Wrong
BadWAM zeigt, wie kleine visuelle Störungen die Kopplung zwischen vorhergesagter Zukunft und ausgeführter Aktion in World-Action Models lösen können.
- 11
17. Juli 2026
LESEN →SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
SearchOS-V1 macht Suchfortschritt in Multi-Agenten-Systemen als persistenten, geteilten Zustand explizit und soll damit Wiederholungen, Budgetverschwendung und unvollständige Antworten verringern.
- 12
17. Juli 2026
LESEN →VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
VideoChat3 ist ein offenes Video-MLLM mit 4 Milliarden Parametern, das effizientes und domänenübergreifendes Videoverstehen durch Architektur- und Datenentscheidungen verbindet.
- 13
15. Juli 2026
LESEN →Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
Funktionsbewusstes Fill-in-the-Middle-Mid-Training soll Code-Agenten besser auf die Verarbeitung von Tool-Ergebnissen vorbereiten.
- 14
15. Juli 2026
LESEN →Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution
ACQUIRE lässt einen Agenten Wissenslücken im Repository zuerst als Fragen klären und erzeugt Patches erst auf Basis der evidenzgestützten Antworten.
- 15
15. Juli 2026
LESEN →SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
SynthDocBench prüft visuelle Sprachmodelle mit kontrolliert erzeugten Langdokumenten und macht Fehler durch Länge, Position, Layout und Charts sichtbar.
- 16
14. Juli 2026
LESEN →LightMem-Ego: Your AI Memory for Everyday Life
LightMem-Ego strukturiert kontinuierliche visuelle und auditive Alltagsdaten in ein hierarchisches, multimodales Gedächtnis für evidenzbasierte Assistenz.
- 17
14. Juli 2026
LESEN →Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
PUST trennt die Exploration von Optimierungssignalen über ein leichtgewichtiges Proxy-Modell von der Ausrichtung eines stärkeren Hauptmodells.
- 18
14. Juli 2026
LESEN →Weak-to-Strong Generalization via Direct On-Policy Distillation
Direct-OPD überträgt Verstärkungslern-Effekte schwächerer Lehrermodelle auf stärkere Schülermodelle, ohne deren erneutes Voll-RL.
VON DER EINORDNUNG ZUR UMSETZUNG