Capitalisation boursière: $2.1753T 0.52%
Volume(24h): $38.8228B -29.97%
  • Capitalisation boursière: $2.1753T 0.52%
  • Volume(24h): $38.8228B -29.97%
  • Indice de peur et de cupidité:
  • Capitalisation boursière: $2.1753T 0.52%
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
Top nouvelles
Cryptos
Les sujets
Cryptospedia
Nouvelles
Cryptosopique
Vidéos
bitcoin
bitcoin

$87959.907984 USD

1.34%

ethereum
ethereum

$2920.497338 USD

3.04%

tether
tether

$0.999775 USD

0.00%

xrp
xrp

$2.237324 USD

8.12%

bnb
bnb

$860.243768 USD

0.90%

solana
solana

$138.089498 USD

5.43%

usd-coin
usd-coin

$0.999807 USD

0.01%

tron
tron

$0.272801 USD

-1.53%

dogecoin
dogecoin

$0.150904 USD

2.96%

cardano
cardano

$0.421635 USD

1.97%

hyperliquid
hyperliquid

$32.152445 USD

2.23%

bitcoin-cash
bitcoin-cash

$533.301069 USD

-1.94%

chainlink
chainlink

$12.953417 USD

2.68%

unus-sed-leo
unus-sed-leo

$9.535951 USD

0.73%

zcash
zcash

$521.483386 USD

-2.87%

Articles d’actualité sur les crypto-monnaies

VibeVoice-ASR se lance dans l'audio de longue durée, changeant le jeu de la synthèse vocale

Jan 23, 2026 at 05:11 am

VibeVoice-ASR de Microsoft bouleverse la conversion parole-texte, en gérant une heure d'audio en une seule fois, apportant contexte et clarté à la transcription longue durée. Cela change vraiment la donne.

VibeVoice-ASR se lance dans l'audio de longue durée, changeant le jeu de la synthèse vocale

Well, folks, it looks like Microsoft just dropped something that could make life a whole lot easier for anyone staring down an hour of recorded speech. We're talking about VibeVoice-ASR, the latest entry in their open-source VibeVoice family, and it's aiming squarely at the complexities of long-form audio transcription.

Eh bien, les amis, il semble que Microsoft vient de sortir quelque chose qui pourrait rendre la vie beaucoup plus facile à quiconque regarde une heure de discours enregistré. Nous parlons de VibeVoice-ASR, la dernière entrée de leur famille open source VibeVoice, et elle vise carrément les complexités de la transcription audio longue durée.

A Fresh Take on Long-Form Speech-to-Text

Une nouvelle approche de la synthèse vocale longue durée

For years, the standard drill for automatic speech recognition (ASR) systems tackling lengthy recordings involved a rather choppy approach: slice the audio into bite-sized segments, then try to piece together who said what, when, and in what context. It worked, mostly, but often felt like trying to solve a jigsaw puzzle where half the pieces were missing or upside down. Enter VibeVoice-ASR, which decides to throw out the scissors entirely.

Pendant des années, l'exercice standard pour les systèmes de reconnaissance automatique de la parole (ASR) s'attaquant aux longs enregistrements impliquait une approche plutôt saccadée : découper l'audio en petits segments, puis essayer de reconstituer qui a dit quoi, quand et dans quel contexte. Cela fonctionnait pour la plupart, mais cela ressemblait souvent à essayer de résoudre un puzzle dont la moitié des pièces manquaient ou étaient à l'envers. Entrez VibeVoice-ASR, qui décide de jeter complètement les ciseaux.

This new model is designed to process up to sixty minutes of continuous audio in a single pass. That's right, sixty minutes. In one go. What's the big deal, you ask? Everything. By keeping a global representation of the entire session, VibeVoice-ASR can actually maintain speaker identity and topic context throughout the whole hour. No more awkward moments where the system forgets who's talking halfway through a sentence, or completely loses the thread of a conversation. It's a unified approach that simplifies the entire transcription pipeline, meaning less post-processing headache for the rest of us.

Ce nouveau modèle est conçu pour traiter jusqu'à soixante minutes d'audio continu en un seul passage. C'est vrai, soixante minutes. En une seule fois. Quel est le problème, demandez-vous ? Tout. En conservant une représentation globale de l'ensemble de la session, VibeVoice-ASR peut réellement conserver l'identité de l'orateur et le contexte du sujet tout au long de l'heure. Fini les moments gênants où le système oublie qui parle au milieu d'une phrase, ou perd complètement le fil d'une conversation. Il s'agit d'une approche unifiée qui simplifie l'ensemble du pipeline de transcription, ce qui signifie moins de problèmes de post-traitement pour le reste d'entre nous.

Hotwords and Rich Transcriptions: Precision and Purpose

Mots clés et transcriptions riches : précision et objectif

Now, if you've ever tried to transcribe a technical discussion or a meeting full of proprietary jargon, you know the pain of ASR systems getting those crucial terms wrong. VibeVoice-ASR introduces a neat trick here: Customized Hotwords. You can feed the model specific terms—product names, company lingo, even unique proper nouns—and it uses them to guide its recognition process. This means more accurate transcriptions for domain-specific content without needing to retrain the entire model. It’s a clever way to bias the system towards what matters most to your particular use case, and for those who need deeper specialization, there’s also LoRA-based fine-tuning available. Talk about having your cake and eating it too.

Maintenant, si vous avez déjà essayé de transcrire une discussion technique ou une réunion pleine de jargon propriétaire, vous connaissez la difficulté des systèmes ASR à se tromper sur ces termes cruciaux. VibeVoice-ASR introduit ici une astuce intéressante : les mots clés personnalisés. Vous pouvez alimenter le modèle en termes spécifiques (noms de produits, jargon de l'entreprise, voire noms propres uniques) et il les utilise pour guider son processus de reconnaissance. Cela signifie des transcriptions plus précises pour le contenu spécifique à un domaine sans avoir besoin de recycler l'intégralité du modèle. C'est un moyen intelligent d'orienter le système vers ce qui compte le plus pour votre cas d'utilisation particulier, et pour ceux qui ont besoin d'une spécialisation plus approfondie, un réglage fin basé sur LoRA est également disponible. Parlez d'avoir le gâteau et de le manger aussi.

Beyond just getting the words right, VibeVoice-ASR also delivers what Microsoft calls "Rich Transcription." This isn't just a jumble of text; it's a structured output that tells you precisely who said what and when. It jointly handles ASR, speaker diarization (who's speaking), and timestamping. Imagine a transcript that's essentially a time-aligned event log—perfect for summarizing meetings, extracting action items, or feeding into analytics dashboards. It's about turning raw audio into truly actionable intelligence, not just text on a screen.

Au-delà de la simple formulation des mots, VibeVoice-ASR propose également ce que Microsoft appelle une « transcription riche ». Il ne s'agit pas simplement d'un fouillis de texte ; c'est une sortie structurée qui vous indique précisément qui a dit quoi et quand. Il gère conjointement l'ASR, la diarisation du locuteur (qui parle) et l'horodatage. Imaginez une transcription qui est essentiellement un journal d'événements aligné dans le temps, parfait pour résumer les réunions, extraire des éléments d'action ou alimenter des tableaux de bord analytiques. Il s'agit de transformer l'audio brut en une intelligence véritablement exploitable, et pas seulement en texte sur un écran.

The Bigger Picture: A Nod to Cohesion

Vue d’ensemble : un clin d’œil à la cohésion

From where we're sitting, VibeVoice-ASR represents a significant architectural evolution in speech-to-text. The decision to move away from segmented processing towards a single, global context for long-form audio directly addresses a major pain point that has plagued ASR systems for years. This isn't just a minor tweak; it’s a fundamental shift that acknowledges the way human conversations flow, with continuity and interconnectedness. By baking in contextual understanding from the get-go, VibeVoice-ASR sets itself up as a more intelligent, more reliable partner for tackling everything from lengthy lectures to marathon conference calls.

De notre point de vue, VibeVoice-ASR représente une évolution architecturale significative dans le domaine de la synthèse vocale. La décision de s’éloigner du traitement segmenté vers un contexte unique et global pour l’audio de longue durée répond directement à un problème majeur qui tourmente les systèmes ASR depuis des années. Il ne s’agit pas seulement d’une modification mineure ; il s'agit d'un changement fondamental qui reconnaît la manière dont les conversations humaines se déroulent, avec continuité et interconnexion. En intégrant dès le départ une compréhension contextuelle, VibeVoice-ASR s'impose comme un partenaire plus intelligent et plus fiable pour aborder tout, des longues conférences aux conférences téléphoniques marathon.

So, for anyone who's ever dreaded transcribing an hour-long meeting, or perhaps even a podcast, it looks like VibeVoice-ASR might just be your new best friend. Microsoft, it seems, has managed to give us a tool that not only listens but actually understands the bigger picture. Go figure.

Ainsi, pour tous ceux qui ont déjà redouté de transcrire une réunion d'une heure, ou peut-être même un podcast, il semble que VibeVoice-ASR pourrait bien être votre nouveau meilleur ami. Microsoft, semble-t-il, a réussi à nous fournir un outil qui non seulement écoute mais comprend réellement la situation dans son ensemble. Allez comprendre.

Source primaire:marktechpost

Clause de non-responsabilité:info@kdj.com

Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!

Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.

Autres articles publiés sur Aug 02, 2026