|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Articles d’actualité sur les crypto-monnaies
FastSwitch : un système de service LLM soucieux de l'équité qui corrige les inefficacités dans le changement de contexte
Dec 01, 2024 at 06:30 pm
Les grands modèles linguistiques (LLM) ont transformé les applications d'IA, exécutant des tâches telles que la traduction linguistique, les assistants virtuels et la génération de code.

Large language models (LLMs) have revolutionized AI applications, powering diverse tasks such as language translation, virtual assistants, and code generation. These models are deployed on resource-intensive infrastructure, typically comprising GPUs with high-bandwidth memory, to handle their immense computational demands. However, delivering high-quality service to numerous users concurrently poses significant challenges. Efficiently allocating these limited resources is critical to meeting service level objectives (SLOs) for time-sensitive metrics, ensuring the system can cater to more users without compromising performance.
Les grands modèles linguistiques (LLM) ont révolutionné les applications d'IA, exécutant diverses tâches telles que la traduction linguistique, les assistants virtuels et la génération de code. Ces modèles sont déployés sur une infrastructure gourmande en ressources, comprenant généralement des GPU dotés d'une mémoire à large bande passante, pour gérer leurs immenses demandes de calcul. Cependant, fournir simultanément un service de haute qualité à de nombreux utilisateurs pose des défis importants. L'allocation efficace de ces ressources limitées est essentielle pour atteindre les objectifs de niveau de service (SLO) pour les mesures urgentes, garantissant ainsi que le système peut répondre à davantage d'utilisateurs sans compromettre les performances.
A persistent issue in LLM serving systems is achieving fair resource distribution while maintaining efficiency. Existing systems often prioritize throughput, neglecting fairness requirements such as balancing latency among users. Preemptive scheduling mechanisms, which dynamically adjust request priorities, address this. However, these mechanisms introduce context-switching overheads, such as GPU idleness and inefficient I/O utilization, which degrade key performance indicators like Time to First Token (TTFT) and Time Between Tokens (TBT). For instance, the stall time caused by preemption in high-stress scenarios can reach up to 59.9% of P99 latency, leading to a significant decline in user experience.
Un problème persistant dans les systèmes de service LLM est de parvenir à une répartition équitable des ressources tout en maintenant l'efficacité. Les systèmes existants donnent souvent la priorité au débit, négligeant les exigences d'équité telles que l'équilibrage de la latence entre les utilisateurs. Les mécanismes de planification préemptive, qui ajustent dynamiquement les priorités des requêtes, résolvent ce problème. Cependant, ces mécanismes introduisent des surcharges de changement de contexte, telles que l'inactivité du GPU et l'utilisation inefficace des E/S, qui dégradent les indicateurs de performances clés tels que le délai d'obtention du premier jeton (TTFT) et le temps entre les jetons (TBT). Par exemple, le temps de blocage provoqué par la préemption dans des scénarios de stress élevé peut atteindre jusqu'à 59,9 % de la latence P99, entraînant une baisse significative de l'expérience utilisateur.
Current solutions, such as vLLM, rely on paging-based memory management to address GPU memory constraints by swapping data between GPU and CPU memory. While these approaches improve throughput, they face limitations. Issues such as fragmented memory allocation, low I/O bandwidth utilization, and redundant data transfers during multi-turn conversations persist, undermining their effectiveness. For example, vLLM’s fixed block size of 16 tokens results in suboptimal granularity, which reduces PCIe bandwidth efficiency and increases latency during preemptive context switching.
Les solutions actuelles, telles que vLLM, s'appuient sur une gestion de la mémoire basée sur la pagination pour répondre aux contraintes de mémoire du GPU en échangeant les données entre la mémoire du GPU et celle du CPU. Bien que ces approches améliorent le débit, elles se heurtent à des limites. Des problèmes tels que l'allocation de mémoire fragmentée, la faible utilisation de la bande passante d'E/S et les transferts de données redondants lors de conversations à plusieurs tours persistent, compromettant leur efficacité. Par exemple, la taille de bloc fixe de 16 jetons de vLLM entraîne une granularité sous-optimale, ce qui réduit l'efficacité de la bande passante PCIe et augmente la latence lors du changement de contexte préemptif.
To address these inefficiencies, researchers from Purdue University, Shanghai Qi Zhi Institute, and Tsinghua University developed FastSwitch, a fairness-aware LLM serving system that introduces three core optimizations: a dynamic block group manager, a multithreading swap manager, and a KV cache reuse mechanism. These innovations synergize to improve I/O utilization, reduce GPU idleness, and minimize redundant data transfers. The system’s design builds on vLLM but focuses on coarse-grained memory allocation and asynchronous operations to enhance resource management.
Pour remédier à ces inefficacités, des chercheurs de l'Université Purdue, de l'Institut Qi Zhi de Shanghai et de l'Université Tsinghua ont développé FastSwitch, un système de service LLM soucieux de l'équité qui introduit trois optimisations de base : un gestionnaire de groupe de blocs dynamique, un gestionnaire d'échange multithread et une réutilisation du cache KV. mécanisme. Ces innovations s'associent pour améliorer l'utilisation des E/S, réduire l'inactivité du GPU et minimiser les transferts de données redondants. La conception du système s'appuie sur vLLM mais se concentre sur une allocation de mémoire grossière et des opérations asynchrones pour améliorer la gestion des ressources.
FastSwitch’s dynamic block group manager optimizes memory allocation by grouping contiguous blocks, increasing transfer granularity. This approach reduces latency by up to 3.11x compared to existing methods. The multithreading swap manager enhances token generation efficiency by enabling asynchronous swapping, mitigating GPU idle time. It incorporates fine-grained synchronization to avoid conflicts between ongoing and new requests, ensuring seamless operation during overlapping processes. Meanwhile, the KV cache reuse mechanism preserves partially valid data in CPU memory, reducing preemption latency by avoiding redundant KV cache transfers. These components collectively address key challenges and improve the overall performance of LLM serving systems.
Le gestionnaire de groupes de blocs dynamiques de FastSwitch optimise l'allocation de mémoire en regroupant des blocs contigus, augmentant ainsi la granularité du transfert. Cette approche réduit la latence jusqu'à 3,11x par rapport aux méthodes existantes. Le gestionnaire d'échange multithread améliore l'efficacité de la génération de jetons en permettant l'échange asynchrone, atténuant ainsi le temps d'inactivité du GPU. Il intègre une synchronisation fine pour éviter les conflits entre les demandes en cours et les nouvelles, garantissant ainsi un fonctionnement transparent pendant les processus qui se chevauchent. Parallèlement, le mécanisme de réutilisation du cache KV préserve les données partiellement valides dans la mémoire du processeur, réduisant ainsi la latence de préemption en évitant les transferts de cache KV redondants. Ces composants répondent collectivement aux principaux défis et améliorent les performances globales des systèmes de desserte LLM.
The researchers evaluated FastSwitch using the LLaMA-8B and Qwen-32B models on GPUs such as NVIDIA A10 and A100. Testing scenarios included high-frequency priority updates and multi-turn conversations derived from the ShareGPT dataset, which averages 5.5 turns per conversation. FastSwitch outperformed vLLM across various metrics. It achieved speedups of 4.3-5.8x in P95 TTFT and 3.6-11.2x in P99.9 TBT for different models and workloads. Furthermore, FastSwitch improved throughput by up to 1.44x, demonstrating its ability to handle complex workloads efficiently. The system also substantially reduced context-switching overhead, improving I/O utilization by 1.3x and GPU by 1.42x compared to vLLM.
Les chercheurs ont évalué FastSwitch en utilisant les modèles LLaMA-8B et Qwen-32B sur des GPU tels que NVIDIA A10 et A100. Les scénarios de test comprenaient des mises à jour prioritaires à haute fréquence et des conversations à plusieurs tours dérivées de l'ensemble de données ShareGPT, qui représentent en moyenne 5,5 tours par conversation. FastSwitch a surpassé vLLM dans diverses mesures. Il a atteint des accélérations de 4,3 à 5,8x en P95 TTFT et de 3,6 à 11,2x en P99.9 TBT pour différents modèles et charges de travail. De plus, FastSwitch a multiplié par 1,44 le débit, démontrant ainsi sa capacité à gérer efficacement des charges de travail complexes. Le système a également considérablement réduit la surcharge de changement de contexte, améliorant l'utilisation des E/S de 1,3x et celle du GPU de 1,42x par rapport au vLLM.
FastSwitch’s optimizations resulted in tangible benefits. For example, its KV cache reuse mechanism reduced swap-out blocks by 53%, significantly lowering latency. The multithreading swap manager enhanced token generation efficiency, achieving a 21.8% improvement at P99 latency compared to baseline systems. The dynamic block group manager maintained granularity by allocating memory in larger chunks, balancing efficiency and utilization. These advancements highlight FastSwitch’s capacity to maintain fairness and efficiency in high-demand environments.
Les optimisations de FastSwitch ont abouti à des avantages tangibles. Par exemple, son mécanisme de réutilisation du cache KV a réduit les blocs de swap de 53 %, réduisant ainsi considérablement la latence. Le gestionnaire d'échange multithread a amélioré l'efficacité de la génération de jetons, atteignant une amélioration de 21,8 % de la latence P99 par rapport aux systèmes de base. Le gestionnaire de groupe de blocs dynamique a maintenu la granularité en allouant la mémoire en blocs plus grands, en équilibrant l'efficacité et l'utilisation. Ces avancées mettent en évidence la capacité de FastSwitch à maintenir l'équité et l'efficacité dans des environnements à forte demande.
The research team’s key takeaways include the following:
Les principaux points à retenir de l’équipe de recherche sont les suivants :
In conclusion, FastSwitch addresses fundamental inefficiencies in LLM serving by introducing innovative optimizations that balance fairness and efficiency. Reducing context-switching overheads and enhancing resource utilization ensure scalable, high-quality service delivery for multi-user environments. These advancements make it a transformative solution for modern LLM deployments.
En conclusion, FastSwitch corrige les inefficacités fondamentales du service LLM en introduisant des optimisations innovantes qui équilibrent équité et efficacité. La réduction des frais de changement de contexte et l'amélioration de l'utilisation des ressources garantissent une fourniture de services évolutive et de haute qualité pour les environnements multi-utilisateurs. Ces avancées en font une solution transformatrice pour les déploiements LLM modernes.
Clause de non-responsabilité:info@kdj.com
Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!
Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.
-
-
- Consensus 2026 Miami : Web3, Blockchain, Crypto-monnaie, NFT, Metaverse, conférence, 5 mai — Là où Wall Street rencontre la frontière numérique
- May 01, 2026 at 11:27 pm
- Miami vibre à l'approche du Consensus 2026 le 5 mai, mettant en avant le Web3, la blockchain, la crypto, les NFT et le passage du métaverse du battage médiatique à la réalité institutionnelle et durable.
-
- La Fed maintient ses taux stables, déclenchant une baisse du prix du Bitcoin dans un contexte de tensions géopolitiques
- May 01, 2026 at 04:04 am
- La décision de la Réserve fédérale de maintenir les taux d'intérêt, associée au conflit au Moyen-Orient, a un impact sur le prix du Bitcoin. Analyse des tendances récentes et des réactions du marché.
-
- Les mineurs de Bitcoin électrifient le réseau : l'acquisition d'une usine à gaz dans l'Ohio ouvre une nouvelle ère pour l'or numérique
- Apr 30, 2026 at 10:38 pm
- L’industrie minière du Bitcoin connaît une transformation significative, avec des acteurs majeurs développant de manière agressive leurs opérations et acquérant stratégiquement des actifs énergétiques comme les usines à gaz de l’Ohio pour solidifier leur avenir dans l’économie numérique.
-
- Le jeton MEGA de MegaETH arrive dans la Big Apple : définition de nouveaux critères de performance pour la blockchain en temps réel
- Apr 30, 2026 at 09:11 pm
- Le MEGA Token de MegaETH a été officiellement lancé, validant sa vision de la blockchain « en temps réel » avec un modèle de distribution axé sur les performances et une adoption rapide du stablecoin USDM.
-
- La pente glissante de Solana : les prévisions de prix indiquent une perte de résistance et de nouvelles baisses potentielles
- Apr 30, 2026 at 09:08 pm
- Solana a du mal à briser la résistance clé, signalant un potentiel de baisse. Des refus répétés entre 86 et 88 dollars, associés à une tendance à court terme brisée, laissent présager des objectifs aussi bas que 67 dollars, voire 40 dollars, alors que les vendeurs gardent le contrôle. Les investisseurs doivent surveiller de près les niveaux de support critiques.
-
- BTC, pétrole, bénéfices : la géopolitique alimente le brut, le dérapage des cryptos, les triomphes et les essais de la technologie
- Apr 30, 2026 at 04:51 pm
- Les marchés mondiaux sont en tourbillon : le BTC chute alors que le pétrole atteint des sommets pluriannuels en raison des tensions géopolitiques, tandis que les géants de la technologie affichent des bénéfices mitigés, révélant un paysage financier complexe.
-
- Le nouveau rythme de New York : les systèmes de jalonnement, l'USD1 et la gouvernance conduisent la prochaine vague de crypto
- Apr 30, 2026 at 03:02 pm
- Des événements lucratifs générant 1 USD aux modèles de gouvernance robustes, la sphère crypto regorge d'innovations qui remodèlent la façon dont nous interagissons avec les actifs numériques, en nous concentrant sur l'engagement à long terme et l'utilité du stablecoin.
-
- OKX dévoile le protocole de paiement des agents : inaugurant une nouvelle ère de transactions IA
- Apr 30, 2026 at 02:53 pm
- OKX lance son Agent Payments Protocol (APP), une norme ouverte pour le commerce piloté par l'IA, permettant aux agents de gérer des cycles économiques complets. Explorez les implications pour les transactions IA et les paiements agents.

































