Capitalisation boursière: $2.2043T 0.58%
Volume(24h): $56.8553B 3.76%
  • Capitalisation boursière: $2.2043T 0.58%
  • Volume(24h): $56.8553B 3.76%
  • Indice de peur et de cupidité:
  • Capitalisation boursière: $2.2043T 0.58%
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
Top nouvelles
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
bitcoin
bitcoin

$87959.907984 USD

1.34%

ethereum
ethereum

$2920.497338 USD

3.04%

tether
tether

$0.999775 USD

0.00%

xrp
xrp

$2.237324 USD

8.12%

bnb
bnb

$860.243768 USD

0.90%

solana
solana

$138.089498 USD

5.43%

usd-coin
usd-coin

$0.999807 USD

0.01%

tron
tron

$0.272801 USD

-1.53%

dogecoin
dogecoin

$0.150904 USD

2.96%

cardano
cardano

$0.421635 USD

1.97%

hyperliquid
hyperliquid

$32.152445 USD

2.23%

bitcoin-cash
bitcoin-cash

$533.301069 USD

-1.94%

chainlink
chainlink

$12.953417 USD

2.68%

unus-sed-leo
unus-sed-leo

$9.535951 USD

0.73%

zcash
zcash

$521.483386 USD

-2.87%

Articles d’actualité sur les crypto-monnaies

FastSwitch : un système de service LLM soucieux de l'équité qui corrige les inefficacités dans le changement de contexte

Dec 01, 2024 at 06:30 pm

Les grands modèles linguistiques (LLM) ont transformé les applications d'IA, exécutant des tâches telles que la traduction linguistique, les assistants virtuels et la génération de code.

FastSwitch : un système de service LLM soucieux de l'équité qui corrige les inefficacités dans le changement de contexte

Large language models (LLMs) have revolutionized AI applications, powering diverse tasks such as language translation, virtual assistants, and code generation. These models are deployed on resource-intensive infrastructure, typically comprising GPUs with high-bandwidth memory, to handle their immense computational demands. However, delivering high-quality service to numerous users concurrently poses significant challenges. Efficiently allocating these limited resources is critical to meeting service level objectives (SLOs) for time-sensitive metrics, ensuring the system can cater to more users without compromising performance.

Les grands modèles linguistiques (LLM) ont révolutionné les applications d'IA, exécutant diverses tâches telles que la traduction linguistique, les assistants virtuels et la génération de code. Ces modèles sont déployés sur une infrastructure gourmande en ressources, comprenant généralement des GPU dotés d'une mémoire à large bande passante, pour gérer leurs immenses demandes de calcul. Cependant, fournir simultanément un service de haute qualité à de nombreux utilisateurs pose des défis importants. L'allocation efficace de ces ressources limitées est essentielle pour atteindre les objectifs de niveau de service (SLO) pour les mesures urgentes, garantissant ainsi que le système peut répondre à davantage d'utilisateurs sans compromettre les performances.

A persistent issue in LLM serving systems is achieving fair resource distribution while maintaining efficiency. Existing systems often prioritize throughput, neglecting fairness requirements such as balancing latency among users. Preemptive scheduling mechanisms, which dynamically adjust request priorities, address this. However, these mechanisms introduce context-switching overheads, such as GPU idleness and inefficient I/O utilization, which degrade key performance indicators like Time to First Token (TTFT) and Time Between Tokens (TBT). For instance, the stall time caused by preemption in high-stress scenarios can reach up to 59.9% of P99 latency, leading to a significant decline in user experience.

Un problème persistant dans les systèmes de service LLM est de parvenir à une répartition équitable des ressources tout en maintenant l'efficacité. Les systèmes existants donnent souvent la priorité au débit, négligeant les exigences d'équité telles que l'équilibrage de la latence entre les utilisateurs. Les mécanismes de planification préemptive, qui ajustent dynamiquement les priorités des requêtes, résolvent ce problème. Cependant, ces mécanismes introduisent des surcharges de changement de contexte, telles que l'inactivité du GPU et l'utilisation inefficace des E/S, qui dégradent les indicateurs de performances clés tels que le délai d'obtention du premier jeton (TTFT) et le temps entre les jetons (TBT). Par exemple, le temps de blocage provoqué par la préemption dans des scénarios de stress élevé peut atteindre jusqu'à 59,9 % de la latence P99, entraînant une baisse significative de l'expérience utilisateur.

Current solutions, such as vLLM, rely on paging-based memory management to address GPU memory constraints by swapping data between GPU and CPU memory. While these approaches improve throughput, they face limitations. Issues such as fragmented memory allocation, low I/O bandwidth utilization, and redundant data transfers during multi-turn conversations persist, undermining their effectiveness. For example, vLLM’s fixed block size of 16 tokens results in suboptimal granularity, which reduces PCIe bandwidth efficiency and increases latency during preemptive context switching.

Les solutions actuelles, telles que vLLM, s'appuient sur une gestion de la mémoire basée sur la pagination pour répondre aux contraintes de mémoire du GPU en échangeant les données entre la mémoire du GPU et celle du CPU. Bien que ces approches améliorent le débit, elles se heurtent à des limites. Des problèmes tels que l'allocation de mémoire fragmentée, la faible utilisation de la bande passante d'E/S et les transferts de données redondants lors de conversations à plusieurs tours persistent, compromettant leur efficacité. Par exemple, la taille de bloc fixe de 16 jetons de vLLM entraîne une granularité sous-optimale, ce qui réduit l'efficacité de la bande passante PCIe et augmente la latence lors du changement de contexte préemptif.

To address these inefficiencies, researchers from Purdue University, Shanghai Qi Zhi Institute, and Tsinghua University developed FastSwitch, a fairness-aware LLM serving system that introduces three core optimizations: a dynamic block group manager, a multithreading swap manager, and a KV cache reuse mechanism. These innovations synergize to improve I/O utilization, reduce GPU idleness, and minimize redundant data transfers. The system’s design builds on vLLM but focuses on coarse-grained memory allocation and asynchronous operations to enhance resource management.

Pour remédier à ces inefficacités, des chercheurs de l'Université Purdue, de l'Institut Qi Zhi de Shanghai et de l'Université Tsinghua ont développé FastSwitch, un système de service LLM soucieux de l'équité qui introduit trois optimisations de base : un gestionnaire de groupe de blocs dynamique, un gestionnaire d'échange multithread et une réutilisation du cache KV. mécanisme. Ces innovations s'associent pour améliorer l'utilisation des E/S, réduire l'inactivité du GPU et minimiser les transferts de données redondants. La conception du système s'appuie sur vLLM mais se concentre sur une allocation de mémoire grossière et des opérations asynchrones pour améliorer la gestion des ressources.

FastSwitch’s dynamic block group manager optimizes memory allocation by grouping contiguous blocks, increasing transfer granularity. This approach reduces latency by up to 3.11x compared to existing methods. The multithreading swap manager enhances token generation efficiency by enabling asynchronous swapping, mitigating GPU idle time. It incorporates fine-grained synchronization to avoid conflicts between ongoing and new requests, ensuring seamless operation during overlapping processes. Meanwhile, the KV cache reuse mechanism preserves partially valid data in CPU memory, reducing preemption latency by avoiding redundant KV cache transfers. These components collectively address key challenges and improve the overall performance of LLM serving systems.

Le gestionnaire de groupes de blocs dynamiques de FastSwitch optimise l'allocation de mémoire en regroupant des blocs contigus, augmentant ainsi la granularité du transfert. Cette approche réduit la latence jusqu'à 3,11x par rapport aux méthodes existantes. Le gestionnaire d'échange multithread améliore l'efficacité de la génération de jetons en permettant l'échange asynchrone, atténuant ainsi le temps d'inactivité du GPU. Il intègre une synchronisation fine pour éviter les conflits entre les demandes en cours et les nouvelles, garantissant ainsi un fonctionnement transparent pendant les processus qui se chevauchent. Parallèlement, le mécanisme de réutilisation du cache KV préserve les données partiellement valides dans la mémoire du processeur, réduisant ainsi la latence de préemption en évitant les transferts de cache KV redondants. Ces composants répondent collectivement aux principaux défis et améliorent les performances globales des systèmes de desserte LLM.

The researchers evaluated FastSwitch using the LLaMA-8B and Qwen-32B models on GPUs such as NVIDIA A10 and A100. Testing scenarios included high-frequency priority updates and multi-turn conversations derived from the ShareGPT dataset, which averages 5.5 turns per conversation. FastSwitch outperformed vLLM across various metrics. It achieved speedups of 4.3-5.8x in P95 TTFT and 3.6-11.2x in P99.9 TBT for different models and workloads. Furthermore, FastSwitch improved throughput by up to 1.44x, demonstrating its ability to handle complex workloads efficiently. The system also substantially reduced context-switching overhead, improving I/O utilization by 1.3x and GPU by 1.42x compared to vLLM.

Les chercheurs ont évalué FastSwitch en utilisant les modèles LLaMA-8B et Qwen-32B sur des GPU tels que NVIDIA A10 et A100. Les scénarios de test comprenaient des mises à jour prioritaires à haute fréquence et des conversations à plusieurs tours dérivées de l'ensemble de données ShareGPT, qui représentent en moyenne 5,5 tours par conversation. FastSwitch a surpassé vLLM dans diverses mesures. Il a atteint des accélérations de 4,3 à 5,8x en P95 TTFT et de 3,6 à 11,2x en P99.9 TBT pour différents modèles et charges de travail. De plus, FastSwitch a multiplié par 1,44 le débit, démontrant ainsi sa capacité à gérer efficacement des charges de travail complexes. Le système a également considérablement réduit la surcharge de changement de contexte, améliorant l'utilisation des E/S de 1,3x et celle du GPU de 1,42x par rapport au vLLM.

FastSwitch’s optimizations resulted in tangible benefits. For example, its KV cache reuse mechanism reduced swap-out blocks by 53%, significantly lowering latency. The multithreading swap manager enhanced token generation efficiency, achieving a 21.8% improvement at P99 latency compared to baseline systems. The dynamic block group manager maintained granularity by allocating memory in larger chunks, balancing efficiency and utilization. These advancements highlight FastSwitch’s capacity to maintain fairness and efficiency in high-demand environments.

Les optimisations de FastSwitch ont abouti à des avantages tangibles. Par exemple, son mécanisme de réutilisation du cache KV a réduit les blocs de swap de 53 %, réduisant ainsi considérablement la latence. Le gestionnaire d'échange multithread a amélioré l'efficacité de la génération de jetons, atteignant une amélioration de 21,8 % de la latence P99 par rapport aux systèmes de base. Le gestionnaire de groupe de blocs dynamique a maintenu la granularité en allouant la mémoire en blocs plus grands, en équilibrant l'efficacité et l'utilisation. Ces avancées mettent en évidence la capacité de FastSwitch à maintenir l'équité et l'efficacité dans des environnements à forte demande.

The research team’s key takeaways include the following:

Les principaux points à retenir de l’équipe de recherche sont les suivants :

In conclusion, FastSwitch addresses fundamental inefficiencies in LLM serving by introducing innovative optimizations that balance fairness and efficiency. Reducing context-switching overheads and enhancing resource utilization ensure scalable, high-quality service delivery for multi-user environments. These advancements make it a transformative solution for modern LLM deployments.

En conclusion, FastSwitch corrige les inefficacités fondamentales du service LLM en introduisant des optimisations innovantes qui équilibrent équité et efficacité. La réduction des frais de changement de contexte et l'amélioration de l'utilisation des ressources garantissent une fourniture de services évolutive et de haute qualité pour les environnements multi-utilisateurs. Ces avancées en font une solution transformatrice pour les déploiements LLM modernes.

Source primaire:marktechpost

Clause de non-responsabilité:info@kdj.com

Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!

Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.

Autres articles publiés sur Aug 10, 2026