AI THOR · RESEARCH-ARCHIV
Wissen, das erreichbar bleibt.
Jede veröffentlichte Einordnung behält ihre feste Adresse – auch wenn das nächste Drei-Tage-Briefing erscheint.
ENTWICKLUNGEN
AI-News und Einordnungen
9 BEITRÄGE
- 01
19. Juli 2026
LESEN →Der Governance-Index legt Umsetzungslücken offen
Der Global Index on Responsible AI zeigt, dass KI-Governance zwar weltweit wächst, verbindliche Umsetzung und Transparenz staatlicher Systeme aber häufig zurückbleiben.
- 02
19. Juli 2026
LESEN →Japan koppelt Fabriken enger an Physik-KI
NVIDIA verknüpft in Japan AI-native Netze, offene Modelle, digitale Zwillinge und Robotik zu einer Infrastrukturgeschichte für physische KI.
- 03
19. Juli 2026
LESEN →OpenAI misst KI an erledigter Arbeit
OpenAI schlägt vor, KI nicht vor allem über Tokenkosten oder Nutzung zu bewerten, sondern über den Wert erfolgreich abgeschlossener Arbeit pro eingesetztem Dollar.
- 04
17. Juli 2026
LESEN →GPU-Code-Agenten treffen auf Produktionsrealität
Atrex-Bench bewertet LLM-generierte GPU-Kernels anhand von Produktions-Inferenztraces und zeigt die Lücke zwischen formaler Korrektheit und realer Hardwareeffizienz.
- 05
17. Juli 2026
LESEN →KI-Governance gewinnt Regeln, verliert aber Zähne
Der Global Index on Responsible AI dokumentiert wachsende nationale KI-Politik, aber weiterhin Lücken bei verbindlichen Schutzmechanismen, Transparenz und Abhilfe.
- 06
17. Juli 2026
LESEN →Web-Diskussionen öffnen Datenvergiftern die Tür
Ein frischer Preprint untersucht öffentliche Diskussionsflächen als möglichen Vektor, über den manipulierte Inhalte in Webkorpora für das Vortraining von Sprachmodellen geraten können.
- 07
14. Juli 2026
LESEN →Computer-Agenten skalieren mit prüfbaren Aufgaben
Ein frischer Preprint zeigt, wie Computer-Use-Agenten mehr Übungsstoff bekommen und effizienter daraus lernen sollen. Das ist keine Produktankündigung. Es ist aber genau die unspektakuläre Infrastrukturarbeit, aus der die nächste Welle klickender Assistenten wahrscheinlich entsteht.
- 08
14. Juli 2026
LESEN →Forscher legen Bias von KI-Juroren frei
Wenn ein Sprachmodell andere Modellantworten bewertet, wird es schnell zum stillen Schiedsrichter in Trainings- und Evaluationspipelines. Ein neuer Preprint versucht, dessen Verzerrungen nicht nur an den Eingaben, sondern im inneren Zustandsraum sichtbar und steuerbar zu machen.
- 09
14. Juli 2026
LESEN →MoE-Chips verschieben heiße Experten klüger
Bei Mixture-of-Experts-Modellen werden nicht alle Teilnetze gleich oft gebraucht. Ein neuer Chiplet-Preprint versucht deshalb nicht nur Token herumzuschieben, sondern die besonders gefragten Experten dort wohnen zu lassen, wo Rechenzeit, Speicher und Warteschlangen gerade Luft haben.
FORSCHUNG
Paper und Forschungsimpulse
9 BEITRÄGE
- 01
17. Juli 2026
LESEN →BadWAM: When World-Action Models Dream Right but Act Wrong
BadWAM zeigt, wie kleine visuelle Störungen die Kopplung zwischen vorhergesagter Zukunft und ausgeführter Aktion in World-Action Models lösen können.
- 02
17. Juli 2026
LESEN →SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
SearchOS-V1 macht Suchfortschritt in Multi-Agenten-Systemen als persistenten, geteilten Zustand explizit und soll damit Wiederholungen, Budgetverschwendung und unvollständige Antworten verringern.
- 03
17. Juli 2026
LESEN →VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
VideoChat3 ist ein offenes Video-MLLM mit 4 Milliarden Parametern, das effizientes und domänenübergreifendes Videoverstehen durch Architektur- und Datenentscheidungen verbindet.
- 04
15. Juli 2026
LESEN →Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
Funktionsbewusstes Fill-in-the-Middle-Mid-Training soll Code-Agenten besser auf die Verarbeitung von Tool-Ergebnissen vorbereiten.
- 05
15. Juli 2026
LESEN →Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution
ACQUIRE lässt einen Agenten Wissenslücken im Repository zuerst als Fragen klären und erzeugt Patches erst auf Basis der evidenzgestützten Antworten.
- 06
15. Juli 2026
LESEN →SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
SynthDocBench prüft visuelle Sprachmodelle mit kontrolliert erzeugten Langdokumenten und macht Fehler durch Länge, Position, Layout und Charts sichtbar.
- 07
14. Juli 2026
LESEN →LightMem-Ego: Your AI Memory for Everyday Life
LightMem-Ego strukturiert kontinuierliche visuelle und auditive Alltagsdaten in ein hierarchisches, multimodales Gedächtnis für evidenzbasierte Assistenz.
- 08
14. Juli 2026
LESEN →Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals
PUST trennt die Exploration von Optimierungssignalen über ein leichtgewichtiges Proxy-Modell von der Ausrichtung eines stärkeren Hauptmodells.
- 09
14. Juli 2026
LESEN →Weak-to-Strong Generalization via Direct On-Policy Distillation
Direct-OPD überträgt Verstärkungslern-Effekte schwächerer Lehrermodelle auf stärkere Schülermodelle, ohne deren erneutes Voll-RL.
VON DER EINORDNUNG ZUR UMSETZUNG