Marktkapitalisierung: $2.2026T 0.80%
Volumen (24h): $38.3583B -35.30%
  • Marktkapitalisierung: $2.2026T 0.80%
  • Volumen (24h): $38.3583B -35.30%
  • Angst- und Gier-Index:
  • Marktkapitalisierung: $2.2026T 0.80%
Kryptos
Themen
Cryptospedia
Nachricht
Cryptostopics
Videos
Top -Nachrichten
Kryptos
Themen
Cryptospedia
Nachricht
Cryptostopics
Videos
bitcoin
bitcoin

$87959.907984 USD

1.34%

ethereum
ethereum

$2920.497338 USD

3.04%

tether
tether

$0.999775 USD

0.00%

xrp
xrp

$2.237324 USD

8.12%

bnb
bnb

$860.243768 USD

0.90%

solana
solana

$138.089498 USD

5.43%

usd-coin
usd-coin

$0.999807 USD

0.01%

tron
tron

$0.272801 USD

-1.53%

dogecoin
dogecoin

$0.150904 USD

2.96%

cardano
cardano

$0.421635 USD

1.97%

hyperliquid
hyperliquid

$32.152445 USD

2.23%

bitcoin-cash
bitcoin-cash

$533.301069 USD

-1.94%

chainlink
chainlink

$12.953417 USD

2.68%

unus-sed-leo
unus-sed-leo

$9.535951 USD

0.73%

zcash
zcash

$521.483386 USD

-2.87%

Nachrichtenartikel zu Kryptowährungen

NVIDIA hilft Apple dabei, ein schnelleres und besseres KI-Erlebnis zu schaffen

Dec 20, 2024 at 07:52 pm

Wenn Sie über einen BGR-Link kaufen, verdienen wir möglicherweise eine Affiliate-Provision und unterstützen so unsere fachkundigen Produktlabore. Apple und NVIDIA teilten Details einer Zusammenarbeit mit

NVIDIA hilft Apple dabei, ein schnelleres und besseres KI-Erlebnis zu schaffen

Tech giants Apple and NVIDIA have joined forces to enhance the performance of Large Language Models (LLMs) by introducing a new text generation technique for AI.

Die Technologiegiganten Apple und NVIDIA haben sich zusammengetan, um die Leistung von Large Language Models (LLMs) durch die Einführung einer neuen Textgenerierungstechnik für KI zu verbessern.

According to Apple, accelerating LLM inference is a crucial ML research problem. This is because auto-regressive token generation is computationally expensive and relatively slow. As a result, improving inference efficiency can reduce latency for users.

Laut Apple ist die Beschleunigung der LLM-Inferenz ein entscheidendes Problem der ML-Forschung. Dies liegt daran, dass die automatische Token-Generierung rechenintensiv und relativ langsam ist. Infolgedessen kann eine Verbesserung der Inferenzeffizienz die Latenz für Benutzer verringern.

In addition to ongoing efforts to accelerate inference on Apple silicon, the company has recently made significant progress in accelerating LLM inference for the NVIDIA GPUs widely used for production applications across the industry, the company writes in a research paper.

Zusätzlich zu den laufenden Bemühungen, die Inferenz auf Apple-Silizium zu beschleunigen, hat das Unternehmen kürzlich erhebliche Fortschritte bei der Beschleunigung der LLM-Inferenz für die NVIDIA-GPUs gemacht, die branchenweit häufig für Produktionsanwendungen verwendet werden, schreibt das Unternehmen in einem Forschungspapier.

Earlier this year, Apple published and open-sourced Recurrent Drafter (ReDrafter), which is a novel approach to speculative decoding that “achieves state of the art performance.”

Anfang dieses Jahres veröffentlichte Apple den Open-Source-Recurrent Drafter (ReDrafter), einen neuartigen Ansatz zur spekulativen Dekodierung, der „eine Leistung auf dem neuesten Stand der Technik erreicht“.

According to the company, ReDrafter uses an RNN draft model, and combines beam search with dynamic tree attention to speed up LLM token generation by up to 3.5 tokens per generation step for open source models, surpassing the performance of prior speculative decoding techniques.

Nach Angaben des Unternehmens verwendet ReDrafter ein RNN-Entwurfsmodell und kombiniert Strahlsuche mit dynamischer Baumaufmerksamkeit, um die LLM-Token-Generierung um bis zu 3,5 Token pro Generierungsschritt für Open-Source-Modelle zu beschleunigen und damit die Leistung früherer spekulativer Decodierungstechniken zu übertreffen.

“In benchmarking a tens-of-billions parameter production model on NVIDIA GPUs, using the NVIDIA TensorRT-LLM inference acceleration framework with ReDrafter, we have seen 2.7x speed-up in generated tokens per second for greedy decoding,” Apple papers show.

„Beim Benchmarking eines Produktionsmodells mit mehreren zehn Milliarden Parametern auf NVIDIA-GPUs unter Verwendung des NVIDIA TensorRT-LLM-Inferenzbeschleunigungs-Frameworks mit ReDrafter haben wir eine 2,7-fache Beschleunigung der generierten Token pro Sekunde für gierige Dekodierung festgestellt“, zeigen Apple-Papiere.

With that, this technology could signifanctly reduce latency users may experience, while also using fewer GPUs and consuming less power.

Damit könnte diese Technologie die Latenz, die Benutzer möglicherweise erleben, erheblich reduzieren und gleichzeitig weniger GPUs verbrauchen und weniger Strom verbrauchen.

Originalquelle:bgr

Haftungsausschluss:info@kdj.com

Die bereitgestellten Informationen stellen keine Handelsberatung dar. kdj.com übernimmt keine Verantwortung für Investitionen, die auf der Grundlage der in diesem Artikel bereitgestellten Informationen getätigt werden. Kryptowährungen sind sehr volatil und es wird dringend empfohlen, nach gründlicher Recherche mit Vorsicht zu investieren!

Wenn Sie glauben, dass der auf dieser Website verwendete Inhalt Ihr Urheberrecht verletzt, kontaktieren Sie uns bitte umgehend (info@kdj.com) und wir werden ihn umgehend löschen.

Weitere Artikel veröffentlicht am Jul 27, 2026