... multimodale Experten“ https://yimuwangcs.github.io/projects/emnlp25_leo-mini/index.html Die Redundanz visueller Token in multimodalen großen Sprachmodellen (MLLMs) verringert deren Recheneffizienz erheblich. Neuere Ansätze wie Resampler und Summierer haben versucht, die Anzahl visueller Token zu reduzieren, jedoch auf Kosten der Fähigkeit zum visuellen Denken. Um dieses Problem anzugehen, schlagen wir LEO-Mini vor, einen Roman MLLM, das die Anzahl visueller Token erheblich reduziert und gleichzeitig die visuellen Denkfähigkeiten steigert, enthält CoTR, ein neuartiges Token-Reduktionsmodul, um eine große Anzahl visueller Token in einem kleineren Satz von Token zu konsolidieren und dabei die Ähnlichkeit zwischen visuellen Token, Text-Token und einer kompakten lernbaren Abfrage zu nutzen Das Modul „Multimodale Experten“ verwendet eine Reihe von LoRA-Experten mit einem neuartigen Router, um auf der Grundlage des eingegebenen Texts und der visuellen Token zu wechseln. MMoE umfasst außerdem einen allgemeinen LoRA-Experten, der immer aktiviert ist, um umfassendere visuelle Funktionen zu extrahieren. Um die verbesserte Effizienz und Leistung von LEO-Mini zu demonstrieren, werten wir es aus verschiedene Benchmark-Vision-Sprachaufgaben.
Die bereitgestellten Informationen stellen keine Handelsberatung dar. kdj.com übernimmt keine Verantwortung für Investitionen, die auf der Grundlage der in diesem Artikel bereitgestellten Informationen getätigt werden. Kryptowährungen sind sehr volatil und es wird dringend empfohlen, nach gründlicher Recherche mit Vorsicht zu investieren!
Wenn Sie glauben, dass der auf dieser Website verwendete Inhalt Ihr Urheberrecht verletzt, kontaktieren Sie uns bitte umgehend (info@kdj.com) und wir werden ihn umgehend löschen.