bitcoin
bitcoin

$75771.540085 USD

-1.86%

ethereum
ethereum

$2399.709795 USD

-3.26%

tether
tether

$0.999204 USD

-0.06%

bnb
bnb

$712.217256 USD

-0.77%

xrp
xrp

$1.292312 USD

-7.62%

usd-coin
usd-coin

$0.999959 USD

0.00%

solana
solana

$97.051620 USD

-3.70%

tron
tron

$0.334571 USD

-0.90%

zcash
zcash

$1186.253570 USD

3.75%

hyperliquid
hyperliquid

$77.520171 USD

-1.88%

dogecoin
dogecoin

$0.079968 USD

-3.28%

monero
monero

$508.293198 USD

-1.02%

unus-sed-leo
unus-sed-leo

$8.883426 USD

-0.86%

chainlink
chainlink

$10.791602 USD

-5.36%

cardano
cardano

$0.194877 USD

-4.63%

暗号通貨ニュースビデオ

DeepSeek-V4.1-Flash はオンラインです: 1M トークン コンテキスト、グローバル KV キャッシュをサポートし、トークンごとに 890 バイト

2026/09/11 02:20 easyvibecoding

DeepSeek-V4.1-Flash はオンラインです: 1M トークン コンテキスト、トークンあたり 890 バイトのグローバル KV キャッシュをサポートします。リリースのハイライト DeepSeek は、2026 年 9 月 10 日に DeepSeek-V4.1-Flash を発表しました。これは、新しいアーキテクチャ ファミリの最小モデルとして位置付けられ、ネイティブの画像およびテキスト処理をサポートし、より大きなモデルに対する機能、推論速度、スループット、およびスケーラビリティが向上していると主張しています。モデルは DeepSeek API で起動されました。ネイティブ マルチモーダル サポートを使用するには、モデルをディープシーク フラッシュに設定します。アーキテクチャと効率 DeepSeek-V4.1-Flash は、552B バックボーン パラメータを備えたマルチモーダル MoE で、最大 1M のトークン コンテキストをサポートします。その Causal Encoder-Decoder (CED) アーキテクチャは、20 層の因果エンコーダーと 20 層のデコーダーで構成されています。各入力プレフィル トークンは 8B パラメータを有効にし、出力デコードは 16B パラメータを有効にします。モデルの MoE の各レイヤーは 1 人の共有エキスパートと 384 人のルーティングされたエキスパートを使用し、各トークンにより 6 人のルーティングされたエキスパートが有効になります。モデルは 45T トークンのマルチモーダル データを使用して最初からトレーニングされ、最初に 64K シーケンス長でスパース アテンションがトレーニングされ、次にコンテキストが 34T トークンで 1M トークンに拡張されます。 Compressed Sparse Attender 2 (CSA2)、Hierarchical Sparse Indexer、および FP4 メイン KV キャッシュは、グローバル KV キャッシュをトークンあたり 890 バイトに圧縮します。これは、DeepSeek-V4-Flash の約 1/4 です。 SWA Bounded Replay は最新の n_win トークンのみを再構築し、永続的な KV キャッシュを DeepSeek-V4-Flash の約 1/8 に削減します。この発表では、HBM 要件が前世代の 1/4、SSD ストレージ要件が 1/8 であると要約されています。推論制御およびエージェントのワークロード モデルは、推論コストと精度の間のトレードオフを継続的に調整するために、1 から 100 までの整数の推論作業を提供します。当局者は、KV キャッシュの圧縮をエージェントのコストに関連付けており、キャッシュヒットのコストがエージェントのコストの大部分を占めることが多いため、キャッシュを縮小することでロングコンテキストのワークロードのサービスコストを削減できると指摘しています。このモデルには、Engram 条件付きメモリ、DSpark 投機的デコーディング、シングルパス mHC などのコンポーネントも統合されています。トレーニング後のトレーニングは、SFT → RL → ポリシーに基づく蒸留プロセスに従います。主な変更点は、エージェントのタスク、環境、ロールアウト データ パイプラインの自動合成に焦点を当てています。評価結果と条件は、DeepSeek の内部フレームワークで同じ評価設定の下でベース モデルと公式に比較されます。 0.3 以内のスコア差は同等とみなされます。 DeepSeek-V4.1-Flash-Base のスコアは、MMLU-Pro で 74.1、BigCodeBench Pass@1 で 60.6、HumanEval Pass@1 で 79.4、GSM8K で 93.0 でした。これらの結果と DeepSeek-V4-Flash-Base および DeepSeek-V4-Pro-Base との比較は、すべて内部フレームワークの評価です。エージェント スキャフォールド テストでは、すべての設定で Linux コンテナー、温度 = 1.0、topp = 0.95、1M トークン コンテキスト制限、maxsteps = 500、および最大推論労力を使用しました。 DeepSWE v1.1 はタスクごとに N=8 を使用し、ターミナルベンチ 2.1 は N=3 を使用しました。後者はネットワークを提供しませんでした。 DeepSeek-V4.1-Flash と DSH Minimal の組み合わせは、DeepSWE v1.1 で 72.6、ターミナルベンチ 2.1 Pass@1 で 90.6 のスコアを獲得しました。 mini-SWE-agent のスコアはそれぞれ 74.2 と 90.3 でした。 DeepSeek-V4.1-Flash は、DeepSWE v1.1 (74.2)、Cyber​​Gym (88.1)、および Automation-Bench (54.8) のスコアで他のモデルをリードしていますが、ターミナルベンチ 3.0 (30.0) では Opus5 および GPT5.6-Sol に遅れをとっています。 API、互換性、および展開 V4-Flash および V4-Flash-Vision-Exp は廃止されました。 deepseek-v4-flash および deepseek-v4-flash-vision-exp は現在、一時的にのみ V4.1-Flash にルーティングされます。この互換性ルートは恒久的な取り決めではありません。読み取りソース スニペットは、API の価格がピーク/オフピーク価格で設定されており、オフピーク価格はピーク価格の 50% であることを示しています。全額の価格はまだ確認されていません。 DeepSeek はまた、オープンソース コミュニティと協力して、V4.1-Flash 推論のサポートとより多くの導入オプションを促進すると述べました。現在、エンコーディング フォルダーとディープシーク レシピは、プロンプト エンコーディングと API 形式変換ツールを提供しますが、モデルの推論、ツールの実行、および HTTP トランスポートは依然として呼び出し元の責任です。原文: https://easyvibecoding.app/curated/3303-deepseek-releases-deepseek-v4-1-flash-1m-token-context-kv
ビデオソース:Youtube

免責事項:info@kdj.com

提供される情報は取引に関するアドバイスではありません。 kdj.com は、この記事で提供される情報に基づいて行われた投資に対して一切の責任を負いません。暗号通貨は変動性が高いため、十分な調査を行った上で慎重に投資することを強くお勧めします。

このウェブサイトで使用されているコンテンツが著作権を侵害していると思われる場合は、直ちに当社 (info@kdj.com) までご連絡ください。速やかに削除させていただきます。

2026年09月17日 他の動画も公開されています