|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Articles d’actualité sur les crypto-monnaies
Sécuriser les tokeniseurs de grands modèles de langage pour protéger les applications d'IA
Jun 28, 2024 at 08:10 pm
Dans un récent article de blog, l'équipe AI Red Team de NVIDIA a mis en lumière les vulnérabilités potentielles des tokenizers Large Language Model (LLM) et a fourni des stratégies pour atténuer ces risques.

Large language models (LLMs) have rapidly gained prominence in various AI applications. However, ensuring their security is crucial, as vulnerabilities can arise at different stages of the LLM pipeline. One critical component that often goes overlooked is the tokenizer, which plays a pivotal role in preparing input strings for LLM processing. If not adequately secured, tokenizers can introduce potential risks that might go unnoticed.
Les grands modèles de langage (LLM) ont rapidement pris de l'importance dans diverses applications d'IA. Cependant, garantir leur sécurité est crucial, car des vulnérabilités peuvent survenir à différentes étapes du pipeline LLM. Un composant essentiel qui est souvent négligé est le tokenizer, qui joue un rôle central dans la préparation des chaînes d'entrée pour le traitement LLM. S’ils ne sont pas correctement sécurisés, les tokeniseurs peuvent introduire des risques potentiels qui pourraient passer inaperçus.
In a recent blog post, NVIDIA's AI Red Team sheds light on these vulnerabilities and provides strategies to mitigate them. Here's a summary of their findings and recommendations.
Dans un récent article de blog, l'AI Red Team de NVIDIA met en lumière ces vulnérabilités et propose des stratégies pour les atténuer. Voici un résumé de leurs conclusions et recommandations.
Understanding the Vulnerability
Comprendre la vulnérabilité
Most LLMs, such as those from OpenAI and NVIDIA, share a common architecture, consisting of a tokenizer, encoder, decoder, and loss function. Among these components, the tokenizer is typically reused across multiple models and is usually stored as a plaintext .json file in the model directory.
La plupart des LLM, tels que ceux d'OpenAI et de NVIDIA, partagent une architecture commune, composée d'un tokenizer, d'un encodeur, d'un décodeur et d'une fonction de perte. Parmi ces composants, le tokenizer est généralement réutilisé sur plusieurs modèles et est généralement stocké sous forme de fichier .json en texte brut dans le répertoire du modèle.
This design makes sense from a practical standpoint, as it eliminates the need to re-tokenize data for each model and reduces overall model size. However, it also introduces a vulnerability, as anyone with sufficient privileges can access and modify the tokenizer configuration.
Cette conception est logique d'un point de vue pratique, car elle élimine le besoin de retokeniser les données pour chaque modèle et réduit la taille globale du modèle. Cependant, cela introduit également une vulnérabilité, car toute personne disposant de privilèges suffisants peut accéder et modifier la configuration du tokenizer.
An attacker could potentially alter the tokenizer's mapping of strings to token IDs, creating discrepancies between the user's input and the model's interpretation. For example, they could change the mapping of the word “deny” to the token ID associated with “allow.”
Un attaquant pourrait potentiellement modifier le mappage des chaînes du tokenizer avec les ID de jeton, créant ainsi des écarts entre l'entrée de l'utilisateur et l'interprétation du modèle. Par exemple, ils pourraient modifier le mappage du mot « refuser » avec l'ID de jeton associé à « autoriser ».
As a result, when a user inputs a string containing the word “deny,” the tokenizer would assign it the token ID for “allow,” fundamentally changing the meaning of the input. This scenario exemplifies an encoding attack, where the model processes an altered version of the user's intended input.
En conséquence, lorsqu'un utilisateur saisit une chaîne contenant le mot « refuser », le tokenizer lui attribue l'ID de jeton pour « autoriser », modifiant fondamentalement la signification de l'entrée. Ce scénario illustre une attaque de codage, dans laquelle le modèle traite une version modifiée de l'entrée prévue de l'utilisateur.
Attack Vectors and Exploitation
Vecteurs d’attaque et exploitation
There are several attack vectors that can be used to target tokenizers. One method involves placing a script in the Jupyter startup directory to modify the tokenizer before the pipeline initializes. This approach would enable an attacker to alter the tokenizer configuration without directly accessing the model code.
Il existe plusieurs vecteurs d’attaque qui peuvent être utilisés pour cibler les tokenizers. Une méthode consiste à placer un script dans le répertoire de démarrage de Jupyter pour modifier le tokenizer avant l'initialisation du pipeline. Cette approche permettrait à un attaquant de modifier la configuration du tokenizer sans accéder directement au code du modèle.
Another strategy could involve modifying tokenizer files during the container build process, facilitating a supply chain attack. For instance, an attacker might introduce a backdoor into the tokenizer by adding a custom mapping that assigns a unique token ID to a specific string.
Une autre stratégie pourrait impliquer de modifier les fichiers du tokenizer pendant le processus de création du conteneur, facilitant ainsi une attaque de la chaîne d'approvisionnement. Par exemple, un attaquant pourrait introduire une porte dérobée dans le tokenizer en ajoutant un mappage personnalisé qui attribue un ID de token unique à une chaîne spécifique.
This backdoor could then be used to trigger a particular behavior or response from the model, even if the input string is modified by other parties. Such techniques highlight the importance of maintaining a secure and controlled build environment.
Cette porte dérobée pourrait ensuite être utilisée pour déclencher un comportement ou une réponse particulière de la part du modèle, même si la chaîne d'entrée est modifiée par d'autres parties. De telles techniques soulignent l’importance de maintenir un environnement de construction sécurisé et contrôlé.
Moreover, attackers might attempt to exploit cache behaviors by directing the system to use a cache directory under their control, enabling them to inject malicious configurations. These actions emphasize the need for runtime integrity verifications to complement static configuration checks.
De plus, les attaquants pourraient tenter d'exploiter les comportements du cache en demandant au système d'utiliser un répertoire de cache sous leur contrôle, leur permettant ainsi d'injecter des configurations malveillantes. Ces actions soulignent la nécessité de vérifications de l'intégrité d'exécution pour compléter les vérifications de configuration statique.
Mitigation Strategies
Stratégies d'atténuation
To counter these threats, NVIDIA recommends several mitigation strategies.
Pour contrer ces menaces, NVIDIA recommande plusieurs stratégies d'atténuation.
1. Strong Versioning and Auditing:
1. Gestion des versions et audit solides :
When tokenizers are inherited as upstream dependencies, their versions should be explicitly specified and audited to ensure they align with the intended model configuration. This practice helps prevent inheriting outdated or compromised tokenizer versions.
Lorsque les tokenizers sont hérités en tant que dépendances en amont, leurs versions doivent être explicitement spécifiées et auditées pour garantir qu'elles correspondent à la configuration du modèle prévue. Cette pratique permet d’éviter d’hériter de versions de tokenizer obsolètes ou compromises.
2. Runtime Integrity Checks:
2. Vérifications de l'intégrité d'exécution :
Implementing runtime integrity checks can help detect unauthorized modifications to the tokenizer at runtime. These checks can verify the integrity of the tokenizer file and its contents, ensuring that it operates as intended and has not been tampered with during execution.
La mise en œuvre de contrôles d'intégrité à l'exécution peut aider à détecter les modifications non autorisées du tokenizer au moment de l'exécution. Ces contrôles peuvent vérifier l'intégrité du fichier tokenizer et de son contenu, garantissant qu'il fonctionne comme prévu et n'a pas été falsifié pendant l'exécution.
3. Logging Practices:
3. Pratiques d'exploitation forestière :
Logging practices can aid in forensic analysis by providing a clear record of input and output strings, helping to identify any anomalies resulting from tokenizer manipulation. Logs should capture both the original input string and the tokenized output, enabling investigators to quickly pinpoint any discrepancies.
Les pratiques de journalisation peuvent faciliter l'analyse médico-légale en fournissant un enregistrement clair des chaînes d'entrée et de sortie, aidant ainsi à identifier toute anomalie résultant de la manipulation du tokenizer. Les journaux doivent capturer à la fois la chaîne d'entrée d'origine et la sortie tokenisée, permettant aux enquêteurs d'identifier rapidement toute anomalie.
Conclusion
Conclusion
The security of LLM tokenizers is paramount to maintaining the integrity of AI applications. Malicious modifications to tokenizer configurations can lead to severe discrepancies between user intent and model interpretation, undermining the reliability of LLMs.
La sécurité des tokeniseurs LLM est primordiale pour maintenir l’intégrité des applications d’IA. Des modifications malveillantes apportées aux configurations du tokenizer peuvent entraîner de graves écarts entre l'intention de l'utilisateur et l'interprétation du modèle, compromettant ainsi la fiabilité des LLM.
By adopting robust security measures, including version control, auditing, and runtime verification, organizations can safeguard their AI systems against such vulnerabilities. For more insights on AI security and to stay updated on the latest developments, consider exploring the upcoming NVIDIA Deep Learning Institute course on Adversarial Machine Learning.
En adoptant des mesures de sécurité robustes, notamment le contrôle des versions, l'audit et la vérification de l'exécution, les organisations peuvent protéger leurs systèmes d'IA contre de telles vulnérabilités. Pour plus d’informations sur la sécurité de l’IA et pour rester informé des derniers développements, envisagez d’explorer le prochain cours du NVIDIA Deep Learning Institute sur l’apprentissage automatique contradictoire.
Clause de non-responsabilité:info@kdj.com
Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!
Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.
-
-
- Consensus 2026 Miami : Web3, Blockchain, Crypto-monnaie, NFT, Metaverse, conférence, 5 mai — Là où Wall Street rencontre la frontière numérique
- May 01, 2026 at 11:27 pm
- Miami vibre à l'approche du Consensus 2026 le 5 mai, mettant en avant le Web3, la blockchain, la crypto, les NFT et le passage du métaverse du battage médiatique à la réalité institutionnelle et durable.
-
- La Fed maintient ses taux stables, déclenchant une baisse du prix du Bitcoin dans un contexte de tensions géopolitiques
- May 01, 2026 at 04:04 am
- La décision de la Réserve fédérale de maintenir les taux d'intérêt, associée au conflit au Moyen-Orient, a un impact sur le prix du Bitcoin. Analyse des tendances récentes et des réactions du marché.
-
- Les mineurs de Bitcoin électrifient le réseau : l'acquisition d'une usine à gaz dans l'Ohio ouvre une nouvelle ère pour l'or numérique
- Apr 30, 2026 at 10:38 pm
- L’industrie minière du Bitcoin connaît une transformation significative, avec des acteurs majeurs développant de manière agressive leurs opérations et acquérant stratégiquement des actifs énergétiques comme les usines à gaz de l’Ohio pour solidifier leur avenir dans l’économie numérique.
-
- Le jeton MEGA de MegaETH arrive dans la Big Apple : définition de nouveaux critères de performance pour la blockchain en temps réel
- Apr 30, 2026 at 09:11 pm
- Le MEGA Token de MegaETH a été officiellement lancé, validant sa vision de la blockchain « en temps réel » avec un modèle de distribution axé sur les performances et une adoption rapide du stablecoin USDM.
-
- La pente glissante de Solana : les prévisions de prix indiquent une perte de résistance et de nouvelles baisses potentielles
- Apr 30, 2026 at 09:08 pm
- Solana a du mal à briser la résistance clé, signalant un potentiel de baisse. Des refus répétés entre 86 et 88 dollars, associés à une tendance à court terme brisée, laissent présager des objectifs aussi bas que 67 dollars, voire 40 dollars, alors que les vendeurs gardent le contrôle. Les investisseurs doivent surveiller de près les niveaux de support critiques.
-
- BTC, pétrole, bénéfices : la géopolitique alimente le brut, le dérapage des cryptos, les triomphes et les essais de la technologie
- Apr 30, 2026 at 04:51 pm
- Les marchés mondiaux sont en tourbillon : le BTC chute alors que le pétrole atteint des sommets pluriannuels en raison des tensions géopolitiques, tandis que les géants de la technologie affichent des bénéfices mitigés, révélant un paysage financier complexe.
-
- Le nouveau rythme de New York : les systèmes de jalonnement, l'USD1 et la gouvernance conduisent la prochaine vague de crypto
- Apr 30, 2026 at 03:02 pm
- Des événements lucratifs générant 1 USD aux modèles de gouvernance robustes, la sphère crypto regorge d'innovations qui remodèlent la façon dont nous interagissons avec les actifs numériques, en nous concentrant sur l'engagement à long terme et l'utilité du stablecoin.
-
- OKX dévoile le protocole de paiement des agents : inaugurant une nouvelle ère de transactions IA
- Apr 30, 2026 at 02:53 pm
- OKX lance son Agent Payments Protocol (APP), une norme ouverte pour le commerce piloté par l'IA, permettant aux agents de gérer des cycles économiques complets. Explorez les implications pour les transactions IA et les paiements agents.

































