|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Nachrichtenartikel zu Kryptowährungen
FastSwitch: Ein fairnessbewusstes LLM-Bereitstellungssystem, das Ineffizienzen beim Kontextwechsel behebt
Dec 01, 2024 at 06:30 pm
Große Sprachmodelle (LLMs) haben KI-Anwendungen verändert und Aufgaben wie Sprachübersetzung, virtuelle Assistenten und Codegenerierung ermöglicht.

Large language models (LLMs) have revolutionized AI applications, powering diverse tasks such as language translation, virtual assistants, and code generation. These models are deployed on resource-intensive infrastructure, typically comprising GPUs with high-bandwidth memory, to handle their immense computational demands. However, delivering high-quality service to numerous users concurrently poses significant challenges. Efficiently allocating these limited resources is critical to meeting service level objectives (SLOs) for time-sensitive metrics, ensuring the system can cater to more users without compromising performance.
Große Sprachmodelle (LLMs) haben KI-Anwendungen revolutioniert und vielfältige Aufgaben wie Sprachübersetzung, virtuelle Assistenten und Codegenerierung ermöglicht. Diese Modelle werden auf einer ressourcenintensiven Infrastruktur bereitgestellt, die typischerweise GPUs mit Speicher mit hoher Bandbreite umfasst, um ihren immensen Rechenbedarf zu bewältigen. Die gleichzeitige Bereitstellung hochwertiger Dienste für zahlreiche Benutzer stellt jedoch erhebliche Herausforderungen dar. Die effiziente Zuweisung dieser begrenzten Ressourcen ist entscheidend für die Erfüllung der Service Level Objectives (SLOs) für zeitkritische Metriken und stellt sicher, dass das System mehr Benutzer bedienen kann, ohne die Leistung zu beeinträchtigen.
A persistent issue in LLM serving systems is achieving fair resource distribution while maintaining efficiency. Existing systems often prioritize throughput, neglecting fairness requirements such as balancing latency among users. Preemptive scheduling mechanisms, which dynamically adjust request priorities, address this. However, these mechanisms introduce context-switching overheads, such as GPU idleness and inefficient I/O utilization, which degrade key performance indicators like Time to First Token (TTFT) and Time Between Tokens (TBT). For instance, the stall time caused by preemption in high-stress scenarios can reach up to 59.9% of P99 latency, leading to a significant decline in user experience.
Ein anhaltendes Problem bei LLM-Bereitstellungssystemen besteht darin, eine gerechte Ressourcenverteilung bei gleichzeitiger Aufrechterhaltung der Effizienz zu erreichen. Bestehende Systeme priorisieren häufig den Durchsatz und vernachlässigen Fairnessanforderungen wie den Ausgleich der Latenz zwischen Benutzern. Abhilfe schaffen präventive Planungsmechanismen, die die Anforderungsprioritäten dynamisch anpassen. Allerdings führen diese Mechanismen zu kontextwechselbedingten Overheads wie GPU-Leerlauf und ineffizienter I/O-Nutzung, die wichtige Leistungsindikatoren wie Time to First Token (TTFT) und Time Between Tokens (TBT) verschlechtern. Beispielsweise kann die durch Preemption verursachte Verzögerungszeit in Szenarien mit hohem Stress bis zu 59,9 % der P99-Latenz erreichen, was zu einer erheblichen Verschlechterung der Benutzererfahrung führt.
Current solutions, such as vLLM, rely on paging-based memory management to address GPU memory constraints by swapping data between GPU and CPU memory. While these approaches improve throughput, they face limitations. Issues such as fragmented memory allocation, low I/O bandwidth utilization, and redundant data transfers during multi-turn conversations persist, undermining their effectiveness. For example, vLLM’s fixed block size of 16 tokens results in suboptimal granularity, which reduces PCIe bandwidth efficiency and increases latency during preemptive context switching.
Aktuelle Lösungen wie vLLM basieren auf einer Paging-basierten Speicherverwaltung, um GPU-Speicherbeschränkungen zu begegnen, indem Daten zwischen GPU- und CPU-Speicher ausgetauscht werden. Obwohl diese Ansätze den Durchsatz verbessern, stoßen sie an Grenzen. Probleme wie fragmentierte Speicherzuweisung, geringe I/O-Bandbreitenauslastung und redundante Datenübertragungen während Multi-Turn-Konversationen bestehen weiterhin und beeinträchtigen ihre Wirksamkeit. Beispielsweise führt die feste Blockgröße von vLLM von 16 Token zu einer suboptimalen Granularität, was die PCIe-Bandbreiteneffizienz verringert und die Latenz während des präemptiven Kontextwechsels erhöht.
To address these inefficiencies, researchers from Purdue University, Shanghai Qi Zhi Institute, and Tsinghua University developed FastSwitch, a fairness-aware LLM serving system that introduces three core optimizations: a dynamic block group manager, a multithreading swap manager, and a KV cache reuse mechanism. These innovations synergize to improve I/O utilization, reduce GPU idleness, and minimize redundant data transfers. The system’s design builds on vLLM but focuses on coarse-grained memory allocation and asynchronous operations to enhance resource management.
Um diese Ineffizienzen zu beheben, haben Forscher der Purdue University, des Shanghai Qi Zhi Institute und der Tsinghua University FastSwitch entwickelt, ein fairness-bewusstes LLM-Serving-System, das drei Kernoptimierungen einführt: einen dynamischen Blockgruppenmanager, einen Multithreading-Swap-Manager und eine KV-Cache-Wiederverwendung Mechanismus. Diese Innovationen wirken synergetisch zusammen, um die I/O-Auslastung zu verbessern, die GPU-Leerlaufzeit zu reduzieren und redundante Datenübertragungen zu minimieren. Das Design des Systems basiert auf vLLM, konzentriert sich jedoch auf eine grobkörnige Speicherzuweisung und asynchrone Vorgänge, um das Ressourcenmanagement zu verbessern.
FastSwitch’s dynamic block group manager optimizes memory allocation by grouping contiguous blocks, increasing transfer granularity. This approach reduces latency by up to 3.11x compared to existing methods. The multithreading swap manager enhances token generation efficiency by enabling asynchronous swapping, mitigating GPU idle time. It incorporates fine-grained synchronization to avoid conflicts between ongoing and new requests, ensuring seamless operation during overlapping processes. Meanwhile, the KV cache reuse mechanism preserves partially valid data in CPU memory, reducing preemption latency by avoiding redundant KV cache transfers. These components collectively address key challenges and improve the overall performance of LLM serving systems.
Der dynamische Blockgruppenmanager von FastSwitch optimiert die Speicherzuweisung durch die Gruppierung zusammenhängender Blöcke und erhöht so die Übertragungsgranularität. Dieser Ansatz reduziert die Latenz im Vergleich zu bestehenden Methoden um das bis zu 3,11-fache. Der Multithreading-Swap-Manager verbessert die Effizienz der Token-Generierung, indem er asynchrones Swapping ermöglicht und so die GPU-Leerlaufzeit verkürzt. Es umfasst eine feinkörnige Synchronisierung, um Konflikte zwischen laufenden und neuen Anforderungen zu vermeiden und einen reibungslosen Betrieb bei überlappenden Prozessen sicherzustellen. Unterdessen behält der KV-Cache-Wiederverwendungsmechanismus teilweise gültige Daten im CPU-Speicher bei und reduziert so die Vorkaufslatenz durch die Vermeidung redundanter KV-Cache-Übertragungen. Diese Komponenten bewältigen gemeinsam wichtige Herausforderungen und verbessern die Gesamtleistung von LLM-Bereitstellungssystemen.
The researchers evaluated FastSwitch using the LLaMA-8B and Qwen-32B models on GPUs such as NVIDIA A10 and A100. Testing scenarios included high-frequency priority updates and multi-turn conversations derived from the ShareGPT dataset, which averages 5.5 turns per conversation. FastSwitch outperformed vLLM across various metrics. It achieved speedups of 4.3-5.8x in P95 TTFT and 3.6-11.2x in P99.9 TBT for different models and workloads. Furthermore, FastSwitch improved throughput by up to 1.44x, demonstrating its ability to handle complex workloads efficiently. The system also substantially reduced context-switching overhead, improving I/O utilization by 1.3x and GPU by 1.42x compared to vLLM.
Die Forscher bewerteten FastSwitch mit den Modellen LLaMA-8B und Qwen-32B auf GPUs wie NVIDIA A10 und A100. Zu den Testszenarien gehörten hochfrequente Prioritätsaktualisierungen und Gespräche mit mehreren Runden, die aus dem ShareGPT-Datensatz abgeleitet wurden, der durchschnittlich 5,5 Runden pro Gespräch umfasst. FastSwitch übertraf vLLM bei verschiedenen Kennzahlen. Es wurden Geschwindigkeitssteigerungen von 4,3–5,8x im P95 TTFT und 3,6–11,2x im P99.9 TBT für verschiedene Modelle und Arbeitslasten erreicht. Darüber hinaus verbesserte FastSwitch den Durchsatz um das bis zu 1,44-fache und demonstrierte damit seine Fähigkeit, komplexe Arbeitslasten effizient zu bewältigen. Das System reduzierte außerdem den Aufwand für den Kontextwechsel erheblich und verbesserte die I/O-Auslastung um das 1,3-fache und die GPU um das 1,42-fache im Vergleich zu vLLM.
FastSwitch’s optimizations resulted in tangible benefits. For example, its KV cache reuse mechanism reduced swap-out blocks by 53%, significantly lowering latency. The multithreading swap manager enhanced token generation efficiency, achieving a 21.8% improvement at P99 latency compared to baseline systems. The dynamic block group manager maintained granularity by allocating memory in larger chunks, balancing efficiency and utilization. These advancements highlight FastSwitch’s capacity to maintain fairness and efficiency in high-demand environments.
Die Optimierungen von FastSwitch führten zu greifbaren Vorteilen. Beispielsweise reduzierte der KV-Cache-Wiederverwendungsmechanismus die Auslagerungsblöcke um 53 %, was die Latenz deutlich senkte. Der Multithreading-Swap-Manager verbesserte die Effizienz der Token-Generierung und erreichte eine Verbesserung der P99-Latenz um 21,8 % im Vergleich zu Basissystemen. Der dynamische Blockgruppenmanager behielt die Granularität bei, indem er Speicher in größeren Blöcken zuwies und so Effizienz und Auslastung ausbalancierte. Diese Fortschritte unterstreichen die Fähigkeit von FastSwitch, Fairness und Effizienz in Umgebungen mit hoher Nachfrage aufrechtzuerhalten.
The research team’s key takeaways include the following:
Zu den wichtigsten Erkenntnissen des Forschungsteams gehören die folgenden:
In conclusion, FastSwitch addresses fundamental inefficiencies in LLM serving by introducing innovative optimizations that balance fairness and efficiency. Reducing context-switching overheads and enhancing resource utilization ensure scalable, high-quality service delivery for multi-user environments. These advancements make it a transformative solution for modern LLM deployments.
Zusammenfassend lässt sich sagen, dass FastSwitch grundlegende Ineffizienzen bei der LLM-Bereitstellung behebt, indem es innovative Optimierungen einführt, die Fairness und Effizienz in Einklang bringen. Die Reduzierung des Kontextwechsel-Overheads und die Verbesserung der Ressourcennutzung gewährleisten eine skalierbare, qualitativ hochwertige Servicebereitstellung für Mehrbenutzerumgebungen. Diese Fortschritte machen es zu einer transformativen Lösung für moderne LLM-Implementierungen.
Haftungsausschluss:info@kdj.com
Die bereitgestellten Informationen stellen keine Handelsberatung dar. kdj.com übernimmt keine Verantwortung für Investitionen, die auf der Grundlage der in diesem Artikel bereitgestellten Informationen getätigt werden. Kryptowährungen sind sehr volatil und es wird dringend empfohlen, nach gründlicher Recherche mit Vorsicht zu investieren!
Wenn Sie glauben, dass der auf dieser Website verwendete Inhalt Ihr Urheberrecht verletzt, kontaktieren Sie uns bitte umgehend (info@kdj.com) und wir werden ihn umgehend löschen.
-
-
- Konsens 2026 Miami: Web3, Blockchain, Kryptowährung, NFTs, Metaverse, Konferenz, 5. Mai – Wo die Wall Street auf die digitale Grenze trifft
- May 01, 2026 at 11:27 pm
- In Miami herrscht Aufregung, während sich am 5. Mai der Konsens 2026 nähert, der Web3, Blockchain, Krypto, NFTs und den Wandel des Metaversums vom Hype zur institutionellen und nachhaltigen Realität hervorhebt.
-
- Die Fed hält die Zinsen stabil, was inmitten geopolitischer Spannungen einen Bitcoin-Preisverfall auslöst
- May 01, 2026 at 04:04 am
- Die Entscheidung der Federal Reserve, die Zinssätze beizubehalten, wirkt sich in Verbindung mit dem Nahostkonflikt auf den Preis von Bitcoin aus. Analyse aktueller Trends und Marktreaktionen.
-
- Bitcoin-Miner elektrifizieren das Netz: Der Erwerb eines Gaskraftwerks in Ohio läutet eine neue Ära für digitales Gold ein
- Apr 30, 2026 at 10:38 pm
- Die Bitcoin-Mining-Branche befindet sich in einem erheblichen Wandel, wobei große Akteure ihre Aktivitäten aggressiv ausweiten und strategisch Energieanlagen wie Gaskraftwerke in Ohio erwerben, um ihre Zukunft in der digitalen Wirtschaft zu festigen.
-
- Der MEGA-Token von MegaETH erreicht den Big Apple: Er setzt neue Leistungsmaßstäbe für Echtzeit-Blockchain
- Apr 30, 2026 at 09:11 pm
- Der MEGA-Token von MegaETH wurde offiziell eingeführt und bestätigt seine „Echtzeit“-Blockchain-Vision mit einem leistungsorientierten Verteilungsmodell und einer schnellen USDM-Stablecoin-Einführung.
-
- Solanas rutschiger Abhang: Die Preisprognose deutet auf einen Widerstandsverlust und mögliche weitere Rückgänge hin
- Apr 30, 2026 at 09:08 pm
- Solana kämpft darum, wichtige Widerstände zu durchbrechen, was auf einen möglichen Abwärtstrend hindeutet. Wiederholte Ablehnungen bei 86 bis 88 US-Dollar, gepaart mit einem unterbrochenen kurzfristigen Muster, deuten auf Ziele von nur 67 US-Dollar oder sogar 40 US-Dollar hin, da die Verkäufer die Kontrolle behalten. Anleger sollten die kritischen Unterstützungsniveaus genau beobachten.
-
- BTC, Öl, Gewinne: Geopolitik treibt Rohöl an, Kryptos rutschen ab, Triumphe und Prüfungen der Technologie
- Apr 30, 2026 at 04:51 pm
- Die globalen Märkte sind ein Wirbelsturm: BTC sinkt, während der Ölpreis aufgrund geopolitischer Spannungen Mehrjahreshöchststände erreicht, während Technologiegiganten gemischte Gewinne verbuchen, was ein Zeichen für eine komplexe Finanzlandschaft ist.
-
- New York Citys neuer Trend: Abstecksysteme, USD1 und Governance treiben die nächste Welle von Krypto voran
- Apr 30, 2026 at 03:02 pm
- Von lukrativen 1-Dollar-Verdienstveranstaltungen bis hin zu robusten Governance-Modellen wimmelt es im Kryptobereich von Innovationen, die die Art und Weise, wie wir mit digitalen Vermögenswerten umgehen, neu gestalten und sich dabei auf langfristiges Engagement und den Nutzen stabiler Münzen konzentrieren.
-
- OKX stellt Agent Payments Protocol vor: läutet eine neue Ära der KI-Transaktionen ein
- Apr 30, 2026 at 02:53 pm
- OKX führt sein Agent Payments Protocol (APP) ein, einen offenen Standard für KI-gesteuerten Handel, der es Agenten ermöglicht, komplette Geschäftszyklen zu verwalten. Entdecken Sie die Auswirkungen auf KI-Transaktionen und Agentenzahlungen.

































