|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Meta AI とアムステルダム大学による最新の研究では、一般的なニューラル ネットワーク アーキテクチャであるトランスフォーマーが、最新のコンピューター ビジョン モデルに存在する局所性誘導バイアスに依存せずに、画像の個々のピクセルに対して直接動作できることが示されました。
![]()
Meta AI and researchers from the University of Amsterdam have demonstrated that transformers, a popular neural network architecture, can operate directly on individual pixels of an image, without relying on the locality inductive bias present in most modern computer vision models.
メタ AI とアムステルダム大学の研究者は、一般的なニューラル ネットワーク アーキテクチャであるトランスフォーマーが、最新のコンピューター ビジョン モデルに存在する局所性誘導バイアスに依存せずに、画像の個々のピクセルに対して直接動作できることを実証しました。
Their study, titled "Transformers on Individual Pixels," challenges the long-held belief that locality – the notion that neighboring pixels are more related than distant ones – is a fundamental requirement for vision tasks.
「個々のピクセルのトランスフォーマー」と題された彼らの研究は、局所性、つまり隣接するピクセルが遠くのピクセルよりも関連性が高いという概念が視覚タスクの基本的な要件であるという長年の信念に疑問を投げかけています。
Traditionally, computer vision architectures like Convolutional Neural Networks (ConvNets) and Vision Transformers (ViTs) have incorporated locality bias through techniques such as convolutional kernels, pooling operations, and patchification, assuming neighboring pixels are more related.
従来、畳み込みニューラル ネットワーク (ConvNets) やビジョン トランスフォーマー (ViTs) などのコンピューター ビジョン アーキテクチャには、隣接するピクセルの関連性が高いと仮定して、畳み込みカーネル、プーリング操作、パッチ化などの技術を通じて局所性バイアスが組み込まれてきました。
In contrast, the researchers introduced Pixel Transformers (PiTs), which treat each pixel as an individual token, removing any assumptions about the 2D grid structure of images. Surprisingly, PiTs achieved highly performant results across various tasks.
対照的に、研究者らは、各ピクセルを個別のトークンとして扱うピクセル トランスフォーマー (PiT) を導入し、画像の 2D グリッド構造に関するあらゆる仮定を取り除きました。驚くべきことに、PiT はさまざまなタスクにわたって高いパフォーマンスの結果を達成しました。
For instance, when PiTs were applied to image generation tasks using latent token spaces from VQGAN, they outperformed their locality-biased counterparts on quality metrics like Fréchet Inception Distance (FID) and Inception Score (IS).
たとえば、VQGAN の潜在トークン空間を使用して PiT を画像生成タスクに適用した場合、Fréchet インセプション ディスタンス (FID) やインセプション スコア (IS) などの品質指標で、局所性に偏った対応物よりも優れたパフォーマンスを示しました。
While PiTs, operating on the lines of Perceiver IO Transformers, can be computationally expensive due to longer sequences, they challenge the need for locality bias in vision models. As advances in handling large sequence lengths are made, PiTs may become more practical.
PiT は、Perceiver IO Transformer のラインで動作し、シーケンスが長いため計算コストが高くなる可能性がありますが、ビジョン モデルにおける局所性バイアスの必要性に課題を抱えています。長いシーケンス長の処理が進歩するにつれて、PiT がより実用的になる可能性があります。
The study ultimately highlights the potential benefits of reducing inductive biases in neural architectures, which could lead to more versatile and capable systems for diverse vision tasks and data modalities.
この研究は最終的に、ニューラル アーキテクチャにおける誘導バイアスを削減することの潜在的な利点を強調しており、これにより、多様な視覚タスクやデータ モダリティに対応する、より多用途で有能なシステムが実現する可能性があります。
免責事項:info@kdj.com
提供される情報は取引に関するアドバイスではありません。 kdj.com は、この記事で提供される情報に基づいて行われた投資に対して一切の責任を負いません。暗号通貨は変動性が高いため、十分な調査を行った上で慎重に投資することを強くお勧めします。
このウェブサイトで使用されているコンテンツが著作権を侵害していると思われる場合は、直ちに当社 (info@kdj.com) までご連絡ください。速やかに削除させていただきます。

































