Un modèle mondial causal sous-jacent à la prédiction du jetons suivants: Explorer GPT dans un environnement contrôlé Raanan Y. Rohekar, Yaniv Gurwicz, Sungduk Yu, Estelle Aflalo, Vasudev Lal do Génératifs de transformateurs (GPT), formées pour prédire le prochain temps, apprenez-vous implicitement un modèle mondial? Nous abordons cette question en dérivant une interprétation causale du mécanisme d'attention dans le GPT et en suggérant un modèle mondial causal qui découle de cette interprétation. De plus, nous proposons que les modèles GPT, au moment de l'inférence, puissent être utilisés pour l'apprentissage de la structure causale à tirs zéro pour les séquences d'entrée et présenter un score de confiance. L'évaluation empirique est effectuée dans un environnement contrôlé en utilisant la configuration et les règles des jeux d'othello et d'échecs. Un GPT, pré-formé sur les jeux du monde réel joué avec l'intention de gagner, est testé sur des données synthétiques hors distribution comprenant des séquences de mouvements juridiques aléatoires. Nous constatons que le modèle GPT est susceptible de générer des mouvements légaux des séquences hors distribution pour lesquelles une structure causale est codée dans le mécanisme d'attention avec une confiance élevée. Dans les cas pour lesquels le modèle GPT génère des mouvements illégaux, il ne parvient pas non plus à capturer une structure causale.
Les informations fournies ne constituent pas des conseils commerciaux. kdj.com n’assume aucune responsabilité pour les investissements effectués sur la base des informations fournies dans cet article. Les crypto-monnaies sont très volatiles et il est fortement recommandé d’investir avec prudence après une recherche approfondie!
Si vous pensez que le contenu utilisé sur ce site Web porte atteinte à vos droits d’auteur, veuillez nous contacter immédiatement (info@kdj.com) et nous le supprimerons dans les plus brefs délais.