DeepSeek-V4.1-Flash는 온라인입니다. 1M 토큰 컨텍스트, 글로벌 KV 캐시 토큰당 890바이트를 지원합니다. 릴리스 하이라이트 DeepSeek은 2026년 9월 10일에 새로운 아키텍처 제품군에서 가장 작은 모델로 자리잡은 DeepSeek-V4.1-Flash를 발표했습니다. 이 모델은 기본 이미지 및 텍스트 처리를 지원하며 향상된 기능, 추론 속도, 처리량 및 더 큰 모델에 대한 확장성을 제공한다고 주장합니다. 이 모델은 DeepSeek API에서 출시되었습니다. 기본 다중 모드 지원을 사용하려면 모델을 deepseek-flash로 설정하세요. 아키텍처 및 효율성 DeepSeek-V4.1-Flash는 552B 백본 매개변수를 갖춘 다중 모드 MoE이며 최대 1M 토큰 컨텍스트를 지원합니다. CED(인과 인코더-디코더) 아키텍처는 인과 인코더 20개 레이어와 디코더 20개 레이어로 구성됩니다. 각 입력 사전 채우기 토큰은 8B 매개변수를 활성화하고 출력 디코드는 16B 매개변수를 활성화합니다. 모델의 MoE 각 계층은 1명의 공유 전문가와 384명의 라우팅 전문가를 사용하며, 각 토큰은 6명의 라우팅 전문가를 가능하게 합니다. 모델은 45T 토큰의 다중 모드 데이터로 처음부터 훈련되고, 먼저 64K 시퀀스 길이로 희소 주의가 훈련된 다음 컨텍스트가 34T 토큰에서 100만 토큰으로 확장됩니다. CSA2(Compressed Sparse Attention 2), Hierarchical Sparse Indexer 및 FP4 기본 KV 캐싱은 글로벌 KV 캐시를 토큰당 890바이트로 압축합니다. 이는 DeepSeek-V4-Flash의 약 1/4입니다. SWA Bounded Replay는 최신 n_win 토큰만 재구축하여 영구 KV 캐시를 DeepSeek-V4-Flash의 약 1/8로 줄입니다. 발표 내용에 따르면 HBM 요구 사항은 이전 세대의 1/4이고 SSD 스토리지 요구 사항은 1/8입니다. 추론 제어 및 에이전트 워크로드 모델은 추론 비용과 정확성 간의 균형을 지속적으로 조정하기 위해 1에서 100까지의 정수 추론 노력을 제공합니다. 관계자들은 KV 캐시 압축을 에이전트 비용과 연결하고 캐시 적중 비용이 에이전트 비용의 상당 부분을 차지하는 경우가 많으므로 캐시를 축소하면 긴 컨텍스트 워크로드에 대한 서비스 비용을 줄일 수 있다는 점을 지적합니다. 이 모델은 또한 Engram 조건부 메모리, DSpark 추측 디코딩 및 단일 패스 mHC와 같은 구성 요소를 통합합니다. 사후 훈련은 SFT → RL → 정책 증류 프로세스를 따릅니다. 주요 변경 사항은 에이전트 작업, 환경 및 롤아웃 데이터 파이프라인을 자동으로 합성하는 데 중점을 둡니다. 평가 결과 및 조건은 DeepSeek 내부 프레임워크 및 동일한 평가 설정 하에서 기본 모델과 공식적으로 비교됩니다. 0.3 이내의 점수 차이는 동등한 것으로 간주됩니다. DeepSeek-V4.1-Flash-Base는 MMLU-Pro에서 74.1점, BigCodeBench Pass@1에서 60.6점, HumanEval Pass@1에서 79.4점, GSM8K에서 93.0점을 기록했습니다. 이러한 결과를 DeepSeek-V4-Flash-Base 및 DeepSeek-V4-Pro-Base와 비교하는 것은 모두 내부 프레임워크 평가입니다. 에이전트 스캐폴드 테스트에서 모든 설정은 Linux 컨테이너, 온도=1.0, topp=0.95, 1M 토큰 컨텍스트 제한, maxsteps=500 및 최대 추론 노력을 사용했습니다. DeepSWE v1.1은 작업당 N=8을 사용했고, Terminal-Bench 2.1은 N=3을 사용했으며 후자는 네트워크를 제공하지 않았습니다. DSH Minimal과 결합된 DeepSeek-V4.1-Flash는 DeepSWE v1.1에서 72.6점, Terminal-Bench 2.1 Pass@1에서 90.6점을 기록했습니다. mini-SWE-agent는 각각 74.2점과 90.3점을 받았습니다. DeepSeek-V4.1-Flash는 DeepSWE v1.1(74.2), CyberGym(88.1) 및 Automation-Bench(54.8) 점수에서 다른 모델을 앞서지만 Terminal-Bench 3.0(30.0)에서는 Opus5 및 GPT5.6-Sol보다 뒤처집니다. API, 호환성 및 배포 V4-Flash 및 V4-Flash-Vision-Exp는 폐기되었습니다. deepseek-v4-flash 및 deepseek-v4-flash-vision-exp는 현재 임시적으로만 V4.1-Flash로 라우팅됩니다. 이 호환성 경로는 영구적인 방식이 아닙니다. 읽기 소스 조각은 API 가격이 피크/비피크 가격으로 책정되고 비피크 가격은 피크 가격의 50%임을 보여줍니다. 전체 가격은 아직 확인되지 않았습니다. DeepSeek은 또한 V4.1-Flash 추론 지원 및 더 많은 배포 옵션을 홍보하기 위해 오픈 소스 커뮤니티와 협력할 것이라고 밝혔습니다. 현재 인코딩 폴더와 deepseek-recipe는 신속한 인코딩 및 API 형식 변환 도구를 제공하지만 모델 추론, 도구 실행 및 HTTP 전송은 여전히 호출자의 책임입니다. 원문: https://easyvibecoding.app/curated/3303-deepseek-releases-deepseek-v4-1-flash-1m-token-context-kv