RESEARCH · ZUR AKTUELLEN AUSGABE

AI THOR · RESEARCH-ARCHIV

Wissen, das erreichbar bleibt.

Jede veröffentlichte Einordnung behält ihre feste Adresse – auch wenn das nächste Drei-Tage-Briefing erscheint.

ENTWICKLUNGEN

AI-News und Einordnungen

9 BEITRÄGE

  1. 01

    19. Juli 2026

    Der Governance-Index legt Umsetzungslücken offen

    Der Global Index on Responsible AI zeigt, dass KI-Governance zwar weltweit wächst, verbindliche Umsetzung und Transparenz staatlicher Systeme aber häufig zurückbleiben.

    LESEN →
  2. 02

    19. Juli 2026

    Japan koppelt Fabriken enger an Physik-KI

    NVIDIA verknüpft in Japan AI-native Netze, offene Modelle, digitale Zwillinge und Robotik zu einer Infrastrukturgeschichte für physische KI.

    LESEN →
  3. 03

    19. Juli 2026

    OpenAI misst KI an erledigter Arbeit

    OpenAI schlägt vor, KI nicht vor allem über Tokenkosten oder Nutzung zu bewerten, sondern über den Wert erfolgreich abgeschlossener Arbeit pro eingesetztem Dollar.

    LESEN →
  4. 04

    17. Juli 2026

    GPU-Code-Agenten treffen auf Produktionsrealität

    Atrex-Bench bewertet LLM-generierte GPU-Kernels anhand von Produktions-Inferenztraces und zeigt die Lücke zwischen formaler Korrektheit und realer Hardwareeffizienz.

    LESEN →
  5. 05

    17. Juli 2026

    KI-Governance gewinnt Regeln, verliert aber Zähne

    Der Global Index on Responsible AI dokumentiert wachsende nationale KI-Politik, aber weiterhin Lücken bei verbindlichen Schutzmechanismen, Transparenz und Abhilfe.

    LESEN →
  6. 06

    17. Juli 2026

    Web-Diskussionen öffnen Datenvergiftern die Tür

    Ein frischer Preprint untersucht öffentliche Diskussionsflächen als möglichen Vektor, über den manipulierte Inhalte in Webkorpora für das Vortraining von Sprachmodellen geraten können.

    LESEN →
  7. 07

    14. Juli 2026

    Computer-Agenten skalieren mit prüfbaren Aufgaben

    Ein frischer Preprint zeigt, wie Computer-Use-Agenten mehr Übungsstoff bekommen und effizienter daraus lernen sollen. Das ist keine Produktankündigung. Es ist aber genau die unspektakuläre Infrastrukturarbeit, aus der die nächste Welle klickender Assistenten wahrscheinlich entsteht.

    LESEN →
  8. 08

    14. Juli 2026

    Forscher legen Bias von KI-Juroren frei

    Wenn ein Sprachmodell andere Modellantworten bewertet, wird es schnell zum stillen Schiedsrichter in Trainings- und Evaluationspipelines. Ein neuer Preprint versucht, dessen Verzerrungen nicht nur an den Eingaben, sondern im inneren Zustandsraum sichtbar und steuerbar zu machen.

    LESEN →
  9. 09

    14. Juli 2026

    MoE-Chips verschieben heiße Experten klüger

    Bei Mixture-of-Experts-Modellen werden nicht alle Teilnetze gleich oft gebraucht. Ein neuer Chiplet-Preprint versucht deshalb nicht nur Token herumzuschieben, sondern die besonders gefragten Experten dort wohnen zu lassen, wo Rechenzeit, Speicher und Warteschlangen gerade Luft haben.

    LESEN →

FORSCHUNG

Paper und Forschungsimpulse

9 BEITRÄGE

  1. 01

    17. Juli 2026

    BadWAM: When World-Action Models Dream Right but Act Wrong

    BadWAM zeigt, wie kleine visuelle Störungen die Kopplung zwischen vorhergesagter Zukunft und ausgeführter Aktion in World-Action Models lösen können.

    LESEN →
  2. 02

    17. Juli 2026

    SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration

    SearchOS-V1 macht Suchfortschritt in Multi-Agenten-Systemen als persistenten, geteilten Zustand explizit und soll damit Wiederholungen, Budgetverschwendung und unvollständige Antworten verringern.

    LESEN →
  3. 03

    17. Juli 2026

    VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

    VideoChat3 ist ein offenes Video-MLLM mit 4 Milliarden Parametern, das effizientes und domänenübergreifendes Videoverstehen durch Architektur- und Datenentscheidungen verbindet.

    LESEN →
  4. 04

    15. Juli 2026

    Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

    Funktionsbewusstes Fill-in-the-Middle-Mid-Training soll Code-Agenten besser auf die Verarbeitung von Tool-Ergebnissen vorbereiten.

    LESEN →
  5. 05

    15. Juli 2026

    Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution

    ACQUIRE lässt einen Agenten Wissenslücken im Repository zuerst als Fragen klären und erzeugt Patches erst auf Basis der evidenzgestützten Antworten.

    LESEN →
  6. 06

    15. Juli 2026

    SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

    SynthDocBench prüft visuelle Sprachmodelle mit kontrolliert erzeugten Langdokumenten und macht Fehler durch Länge, Position, Layout und Charts sichtbar.

    LESEN →
  7. 07

    14. Juli 2026

    LightMem-Ego: Your AI Memory for Everyday Life

    LightMem-Ego strukturiert kontinuierliche visuelle und auditive Alltagsdaten in ein hierarchisches, multimodales Gedächtnis für evidenzbasierte Assistenz.

    LESEN →
  8. 08

    14. Juli 2026

    Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals

    PUST trennt die Exploration von Optimierungssignalen über ein leichtgewichtiges Proxy-Modell von der Ausrichtung eines stärkeren Hauptmodells.

    LESEN →
  9. 09

    14. Juli 2026

    Weak-to-Strong Generalization via Direct On-Policy Distillation

    Direct-OPD überträgt Verstärkungslern-Effekte schwächerer Lehrermodelle auf stärkere Schülermodelle, ohne deren erneutes Voll-RL.

    LESEN →

VON DER EINORDNUNG ZUR UMSETZUNG

Was bedeutet das für Ihr Unternehmen?