RESEARCH · ZUR AUSGABE

FORSCHUNGSIMPULS · 17. Juli 2026

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3 ist ein offenes Video-MLLM mit 4 Milliarden Parametern, das effizientes und domänenübergreifendes Videoverstehen durch Architektur- und Datenentscheidungen verbindet.

WARUM DAS WICHTIG IST

Für praktische Video-KI sind Reproduzierbarkeit, Datenpipeline und Rechenaufwand ebenso wichtig wie Modellqualität. Die Arbeit stellt Code, Daten und Trainingsstrategie als vollständige offene Grundlage bereit.

AI THOR · VISUELLE EINORDNUNG

Vom Forschungsproblem zur praktischen Bedeutung

Aus der vorliegenden Paper-Analyse abgeleitet

01

Ausgangslage

VideoChat3 ist ein offenes Video-MLLM mit 4 Milliarden Parametern, das effizientes und domänenübergreifendes Videoverstehen durch Architektur- und Datenentscheidungen verbindet.

02

Methode

I3D-ViT für räumlich-zeitliche Featureextraktion

03

Befund

VideoChat3 kombiniert I3D-ViT für räumlich-zeitliche Featureextraktion mit adaptiver Frame-Auflösung für Streaming-Videos.

04

Anwendung

Die offene Trainingspipeline auf repräsentativen eigenen Videoaufgaben evaluieren.

05

Grenze

Die Analyse benennt keine explizite Modellgrößen-Limitation für die 4B-Variante.

Redaktionelle Strukturvisualisierung von AI THOR; keine Originalabbildung des Papers.

DIE ANALYSE IM DETAIL

Was das Paper Kapitel für Kapitel zeigt.

Die folgenden Abschnitte verdichten die vollständige Paper-Analyse auf Deutsch, ohne die zentralen Argumentationsschritte auszulassen.

01

Abstract

Das Modell adressiert Mängel aktueller offener Video-MLLM hinsichtlich Domänengeneralität, Effizienz und Offenheit durch Einführung des Inflated 3D Vision Transformers (I3D-ViT) und adaptive Frame-Auflösung. Eine skalierbare Datensynthese liefert vielfältige Trainingssets für eine verbesserte Generalisierung.

02

Introduction

Es wird hervorgehoben, dass Video als Medium dynamische visuelle Informationen liefert, die besser geeignet sind für reales Wahrnehmen und Interagieren als statische Bilder. Die Motivation für ein generalistisches, effizientes Videoverstehensmodell wird erläutert.

03

Methoden: Effizienz durch Architektur

I3D-ViT und adaptive Frame Resolution dienen zur effizienten räumlich-zeitlichen Darstellung und möglichen Reduktion der Rechenkosten während Training und Inferenz, was VideoChat3 gegenüber Vorgängern schneller und skalierbarer macht.

04

Methoden: Effektivität durch Datengenerierung

Eine Pipeline zur skalierbaren Datensynthese erzeugt drei diverse Datensätze (VideoChat3-Academic2M, LV116K, OL617K) für allgemeine, Langzeit- und Streaming-Videoszenarien. Dies fördert die robuste domänenübergreifende Generalisierung des Modells.

05

Evaluation und Ergebnisse

VideoChat3 übertrifft frühere offene Modelle bei verschiedenen Benchmarks (allgemein, lang, streaming) mit nur 4 Mrd. Parametern, zeigt dabei bessere Effizienz und Generalität. Dies wird als bedeutender Fortschritt für offene Video-MLLM gesehen.

06

Offenheit und Community-Einbindung

Alle relevanten Komponenten wie Modellgewichte, Trainingscode, Trainingsstrategie und volle Datensätze werden offen bereitgestellt, um Reproduzierbarkeit sicherzustellen und gemeinschaftliche Weiterentwicklung realitätsnaher Videoverstehenssysteme zu fördern.

07

Schlussfolgerung

Die Kombination von effizienzsteigernder Architektur mit hochwertigen, vielfältigen Trainingsdaten setzt einen neuen Standard für offene, generalistische Video-MLLM und adressiert bisherige Limitierungen hinsichtlich Domänenspezifität und Ressourcen.

ABSTRACT IM ORIGINAL LESEN

Recent advances in video understanding have spanned motion, long video, and streaming interaction, driving this field toward real-world applications. Despite this progress, current open-source models remain limited in several ways. They often struggle to generalize across diverse video types, making them effective only in specific domains. High computational demands further restrict their efficiency and scalability. Moreover, most models are only partially open, with key components such as training code, strategy, or datasets unavailable, which hinders reproducibility and slows community-driven development. To address these issues, we introduce VideoChat3, a fully open, efficient, and generalist video-centric MLLM. VideoChat3 advances video understanding through two complementary designs. For efficiency, we introduce Inflated 3D Vision Transformer (I3D-ViT) and Adaptive Frame Resolution for Streaming Video Perception, which enables efficient spatiotemporal representation and reduces the cost of processing video inputs during training and inference. For effectiveness, we develop a scalable video data synthesis pipeline that curates three diverse, high-quality training datasets: VideoChat3-Academic2M, VideoChat3-LV116K, and VideoChat3-OL617K, covering general, long-form, and streaming video scenarios, improving the model's generalization across domains. By integrating these designs, VideoChat3 achieves a rare balance of broad generalization and computational efficiency. Experiments across general, long-form, and streaming benchmarks demonstrate that VideoChat3 surpasses prior open-source models with equal or larger parameter counts with only 4B parameters and higher efficiency.

DIE KERNPUNKTE

  1. 01

    VideoChat3 kombiniert I3D-ViT für räumlich-zeitliche Featureextraktion mit adaptiver Frame-Auflösung für Streaming-Videos.

  2. 02

    Die Analyse berichtet bessere Generalisierung über unterschiedliche Videoarten als frühere Modelle.

  3. 03

    Mit 4 Milliarden Parametern soll das Modell effizienter als größere offene Modelle sein.

  4. 04

    Eine Datensynthese-Pipeline erzeugt vielfältige und großskalige Trainingsdaten.

  5. 05

    Code, Daten und Trainingsstrategie werden offen bereitgestellt.

VORGEHEN

  • I3D-ViT für räumlich-zeitliche Featureextraktion
  • Adaptive Frame-Auflösung für Streaming-Videos
  • Datensynthese-Pipeline
  • Offene Bereitstellung von Modell, Daten und Trainingsstrategie

PRAKTISCHE ANKNÜPFUNGSPUNKTE

  • Die offene Trainingspipeline auf repräsentativen eigenen Videoaufgaben evaluieren.
  • Adaptive Frame-Auflösung als Effizienzhebel in Streaming-Workflows testen.
  • I3D-ViT-Komponenten in bestehende Video-MLLM-Projekte integrieren.
  • Die Datenpipeline um domänenspezifische Videobeispiele erweitern und Generalisierung getrennt messen.

VON DER EINORDNUNG ZUR UMSETZUNG

Was bedeutet das für Ihr Unternehmen?