본문 바로가기

AI/Paper Review

DeepSeek-V4.1- Flash: Pushing the Limits of KV Cache Compression

TL;DR (요약)
딥시크가 공개한 DeepSeek-V4.1-Flash 기술 보고서를 심층 분석합니다. Causal Encoder-Decoder(8B 프리필 vs 16B 디코드), CSA2의 레이어 간 KV/인덱스 재사용, 계층적 희소 인덱서, FP4 메인 KV 캐시 양자화, 그리고 영속 스토리지 점유율을 1/8로 낮춘 SWA Bounded Replay 메커니즘을 상세히 해부합니다.
💡원문 연구 메타 정보

1. 서론: 에이전트 시대가 마주한 'KV 캐시 메모리 벽'

초장문 컨텍스트(Ultra-Long Context)와 복잡한 자율 에이전트(Autonomous Agent) 워크플로우가 본격화되면서, 대형 언어 모델 배포 환경은 근본적인 전환점을 맞이했습니다. 다단계 추론과 연속적인 도구 호출(Tool Calling), 코드베이스 전체를 탐색하는 작업 특성상 모델이 처리해야 하는 입력 토큰(Input Tokens)의 비중이 출력 토큰 대비 압도적으로 커지는 입력 편중(Input-heavy) 부하가 일상화되었기 때문입니다.

이러한 환경에서 엔지니어링 팀을 가로막는 가장 큰 암초는 단순한 FLOPs 연산량이 아닙니다. 바로 KV 캐시(Key-Value Cache)가 유발하는 고대역폭 메모리(HBM) 및 SSD 용량 고갈, 그리고 노드 간 통신 대역폭 병목입니다. 시퀀스 길이가 100만 토큰(1M tokens)에 이르면, 기존 방식의 KV 캐시는 단 하나의 세션만으로도 수십 기가바이트의 GPU HBM을 집어삼킵니다.

2026년 9월, 딥시크(DeepSeek-AI)가 공개한 DeepSeek-V4.1-Flash 기술 보고서는 이 메모리 벽을 정면으로 돌파한 아키텍처적 해법을 담고 있습니다. 총 552B 파라미터(Engram 조건부 메모리 196B 별도)를 갖춘 이 멀티모달 MoE 모델은 100만 토큰 컨텍스트 지원과 함께, 상주 KV 캐시 용량을 토큰당 단 890바이트(Bytes) 수준으로 압축하는 데 성공했습니다.

Figure 1: Agentic 벤치마크 성능 및 세대별 토큰당 글로벌 KV 캐시 용량 추이
Figure 1(b)에 나타난 세대별 KV 캐시 크기 변화는 딥시크 연구팀이 거쳐온 집요한 최적화 궤적을 명확히 보여줍니다:
  • DeepSeek-V1 (2023.11): 토큰당 389,120 바이트 (약 389 KB)
  • DeepSeek-V3.2 (2025.12): 토큰당 48,068 바이트 (약 48 KB, 8.1배 압축)
  • DeepSeek-V4-Flash (2026.04): 토큰당 3,514 바이트 (약 3.5 KB, 13.7배 압축)
  • DeepSeek-V4.1-Flash (2026.09): 토큰당 890 바이트 (약 0.89 KB, 전작 대비 3.9배 추가 압축, V1 대비 437배 압축)

더욱 인상적인 사실은 캐시 용량을 1/4로 줄이고 영속 스토리지 점유율을 1/8로 축소했음에도 불구하고, DeepSWE v1.1(74.2% Resolved), Terminal-Bench 2.1(90.6% Pass@1) 등 핵심 소프트웨어 엔지니어링 및 에이전트 벤치마크에서 상위 폐쇄형 프론티어 모델들과 대등하거나 이를 앞서는 성능을 기록했다는 점입니다. 딥시크는 과연 어떤 아키텍처와 시스템 엔지니어링을 통해 이 불가능해 보이는 트레이드오프를 달성했을까요? 핵심 메커니즘을 상세히 해부해 보겠습니다.


2. Causal Encoder-Decoder (CED): 프리필과 디코드의 비대칭 분리

전통적인 트랜스포머 디코더 온리(Decoder-Only) 구조는 프리필(Prefill) 단계와 디코드(Decode) 단계에서 동일한 레이어 깊이와 파라미터를 활성화합니다. 하지만 에이전트 세션은 긴 시스템 프롬프트, 도구 출력 로그, 이전 턴의 히스토리를 매 턴마다 다시 읽어들이는 프리필 부하가 전체 연산의 80% 이상을 차지합니다.

DeepSeek-V4.1-Flash는 마이크로소프트의 YoCo(You Only Cache Once) 개념에서 영감을 얻어, 트랜스포머 40개 레이어를 절반으로 쪼갠 Causal Encoder-Decoder (CED) 아키텍처를 전격 도입했습니다.

Figure 2: DeepSeek-V4.1-Flash 전체 아키텍처 개요
Figure 2: DeepSeek-V4.1-Flash 전체 아키텍처 개요

8B 프리필 vs 16B 디코드의 비대칭 라우팅

Figure 2에서 보듯, 전체 40개 트랜스포머 레이어는 하위 20개 레이어의 Causal Encoder와 상위 20개 레이어의 Decoder로 구조화되어 있습니다:

  1. 프리필(Prefill) 단계: 입력 프롬프트 토큰들은 오직 하위 20개 인코더 레이어만 통과합니다. 따라서 토큰당 활성화 파라미터는 8B에 불과합니다.
  2. 글로벌 KV 생성의 단일 사상: 상위 20개 디코더 레이어는 자신만의 히든 스테이트로부터 글로벌 KV를 일일이 계산하지 않습니다. 대신, 인코더의 마지막 출력인 20번째 히든 스테이트(H_20)로부터 레이어별 선형 가중치 행렬(W_l_KV, W_l_Z)을 곱해 직접 글로벌 KV 엔트리(C_l)와 압축 가중치(Z_l)를 즉각 투영(Projection)합니다.
  3. 디코드(Decode) 단계: 생성 단계에서는 40개 레이어 전체의 연산 경로를 순차 통과하며 토큰당 16B 파라미터를 활성화하여 심층적인 언어 모델링 표현력을 온전히 발휘합니다.
[수학적 메커니즘: 글로벌 KV 투영 공식]
C_l = H_(L/2) * W_l_KV   (l > L/2)
Z_l = H_(L/2) * W_l_Z    (l > L/2)

이 설계 덕분에 시퀀스 길이 N이 슬라이딩 윈도우 크기 n_win보다 훨씬 큰 실제 환경(N >> n_win)에서, 프리필 계산 복잡도는 기존 O(NL)에서 O(NL/2 + n_win * L/2) ≈ O(NL/2)로 정확히 절반 수준으로 절감됩니다.

Figure 3: 컨텍스트 길이에 따른 단일 토큰 디코딩 연산량(FLOPs) 추이
Figure 3은 컨텍스트 길이가 4K에서 1024K(1M)로 256배 늘어날 때, 세대별 모델의 단일 토큰 디코드 FLOPs 변화를 비교한 결과입니다. 전통적인 밀집 어텐션 기반의 DeepSeek-V1이 150 GFLOPs에서 3,000 GFLOPs 이상으로 치솟고 전작인 V4-Flash 역시 256K 이후 가파른 상승 곡선을 그리는 반면, DeepSeek-V4.1-Flash는 4K(약 20 GFLOPs)부터 1M(약 25 GFLOPs)까지 거의 완벽한 수평선(Flat Profile)을 유지합니다. 256배의 컨텍스트 확장에도 디코드 연산 비용 증가는 25% 미만에 불과합니다.

3. CSA2: 레이어 간 KV 캐시 및 인덱스 재사용 메커니즘

어텐션 비용과 KV 캐시 점유율을 낮추기 위해 학계와 업계는 세 가지 축에서 압축을 시도해 왔습니다:

  1. 엔트리 축(Entry dimension): MQA, GQA, MLA처럼 헤드 수를 줄이거나 잠재 벡터를 공유하는 방식.
  2. 시퀀스 축(Sequence dimension): 이전 DeepSeek-V4의 CSA/HCA처럼 m개 토큰을 하나의 엔트리로 압축하는 방식.
  3. 레이어 축(Layer dimension): 특정 레이어의 KV 캐시나 희소 라우팅 선택 결과를 다른 레이어가 공유하는 방식.

DeepSeek-V4.1-Flash의 Compressed Sparse Attention 2 (CSA2)는 이 세 축을 동시에 엮어냈습니다. 특히 기존 DeepSeek-V4의 복잡했던 CSA와 HCA 하이브리드 구조를 순수 CSA2 단일 파이프라인으로 전면 개편하고, 압축 블록 간 오버랩(Overlap)과 절대 위치 임베딩을 제거하여 구현과 학습 복잡도를 대폭 단순화했습니다.

Figure 4: CSA2의 3가지 동작 모드 (Full, Reindex, Reuse)
Figure 4: CSA2의 3가지 동작 모드 (Full, Reindex, Reuse)

CSA2의 3가지 정적 동작 모드

Figure 4는 CSA2 레이어가 배치되는 3가지 모드의 데이터 흐름을 명확히 보여줍니다:

  1. Full Mode (완전 생성 모드):

    • 해당 레이어 고유의 Main KV와 Indexer Q를 직접 연산합니다.
    • Main KV로부터 Indexer K를 선형 사상으로 도출하고, Indexer Q와 K 간의 스코어링을 거쳐 신규 Top-K 인덱스를 선출합니다.
    • 완전한 CSA2 연산 경로를 수행하는 루트 노드 역할을 담당합니다.
  2. Reindex Mode (재인덱싱 모드):

    • 이전 Full Mode 레이어가 계산해 둔 Main KV와 Indexer K를 100% 재사용(공유)합니다. 별도의 메인 KV 메모리를 할당하지 않습니다.
    • 단, 해당 레이어 자체의 Indexer Q를 계산하여 공유된 Indexer K와 다시 스코어링을 수행함으로써, 레이어 특성에 맞는 새로운 독립적인 Top-K 인덱스를 뽑아냅니다.
    • 캐시 메모리 할당은 0으로 억제하면서 레이어별 어텐션 영역의 다양성을 확보합니다.
  3. Reuse Mode (완전 재사용 모드):

    • 직전 레이어에서 계산된 Main KV와 Indexer K뿐만 아니라, 이미 선출된 Top-K 인덱스까지 통째로 재사용합니다.
    • Indexer Q 계산이나 스코어링 평가 연산 자체가 완전히 생략되며, 이미 선택된 슬롯의 Main KV를 곧바로 읽어와 코어 어텐션을 수행합니다.

실제 40개 레이어에서 이 모드들은 정교하게 안배되어 있습니다:

  • 인코더 20개 레이어: 첫 2개 레이어는 로컬 SWA 전용. 나머지 18개 레이어는 압축률 m=2의 CSA2가 6개 레이어씩 3개 그룹으로 묶이며, 각 그룹의 첫 번째 레이어만 Full Mode이고 나머지 5개 레이어는 모두 Reuse Mode로 동작합니다.
  • 디코더 20개 레이어: 압축률 m=1의 CSA2가 4개 레이어씩 5개 그룹으로 묶입니다. 첫 번째 그룹의 첫 레이어는 Full Mode, 나머지 4개 그룹의 첫 레이어는 Reindex Mode, 그리고 모든 그룹의 나머지 3개 레이어는 Reuse Mode로 동작합니다.

결과적으로 전체 모델에서 신규 Main KV를 생성하여 HBM에 적재하는 레이어는 손에 꼽을 정도로 최소화됩니다.

Figure 5: 계층적 희소 인덱서 (Hierarchical Sparse Indexer)의 동작 원리
Figure 5: 계층적 희소 인덱서 (Hierarchical Sparse Indexer)의 동작 원리

Hierarchical Sparse Indexer: 초장문 검색 복잡도의 상수화

Reindex Mode 레이어들이 독자적인 Top-K를 선별하더라도, 100만 토큰에 달하는 전체 컨텍스트를 매번 스캔한다면 인덱싱 연산 비용이 컨텍스트 길이에 비례해 선형(Linear)으로 증가합니다.

이를 해결하기 위해 디코더에는 계층적 희소 인덱서(Hierarchical Sparse Indexer)가 도입되었습니다(Figure 5):

  1. 디코더의 첫 번째 Full Mode 레이어가 전체 인과적(Causal) 컨텍스트를 스캔하여 자신의 Top-512 인덱스를 선출함과 동시에, 블록 단위 후보군 풀(Shared Candidate Pool)을 구축합니다.
  2. 8개 포지션으로 구성된 블록 중 최대 인덱서 점수가 높은 상위 2,048개 블록을 선별하여, 총 16,384개 포지션의 후보군 풀을 만듭니다.
  3. 이후 등장하는 모든 Reindex Mode 레이어들은 100만 토큰 전체를 탐색하지 않고, 오직 이 16,384개 후보 포지션 내부에서만 점수를 매겨 자신의 Top-512를 선출합니다.

이로써 후속 인덱서들의 쿼리당 계산량은 컨텍스트 길이가 10만 토큰이든 100만 토큰이든 상관없이 완전한 상수(O(1))로 고정됩니다. 이 메커니즘은 사후 튜닝(Post-training) 단계에서 학습과 추론에 동일하게 적용되어 모델이 후보군 풀 제약 환경에 완벽히 적응하도록 훈련되었습니다.


4. 메모리 계층 혁신: FP4 KV 양자화와 SWA Bounded Replay

CSA2가 레이어 차원의 중복을 제거했다면, 물리적인 데이터 표현과 저장 계층에서는 두 가지 극단적인 최적화가 적용되었습니다.

1) 메인 KV 캐시의 FP4 (E2M1) 양자화

DeepSeek-V4.1-Flash는 메인 KV 캐시에 MXFP4 표준 E2M1 포맷(16채널당 1개의 E4M3 스케일 factor)을 적용한 QAT(Quantization-Aware Training)를 단행했습니다.

흥미로운 엔지니어링 결정은 NVFP4 규격에 존재하는 2단계 글로벌 스케일(Second-level global scale)을 과감히 생략했다는 점입니다:

  • RMSNorm 가중치의 최대 절댓값이 대략 1 수준으로 제어됩니다.
  • 512 채널의 KV 잠재 벡터는 정규화 후 L2 노름이 최대 약 22.6 (sqrt(512)) 수준으로 묶입니다.
  • RoPE(회전 위치 임베딩)는 벡터의 L2 노름을 완벽히 보존(Isometry)하므로, 회전 후에도 채널별 최댓값은 22.6을 넘지 않습니다. 실제 훈련 중 관측된 최댓값은 10 내외였습니다.
  • E2M1 포맷은 E4M3 스케일과 결합 시 최대 448 * 6 = 2,688까지의 동적 범위를 커버하므로, 2차 글로벌 스케일이 없어도 언더플로우나 오버플로우가 전혀 발생하지 않습니다.

이 단순화된 FP4 레이아웃을 통해 메인 KV 캐시의 메모리 점유율은 FP8 대비 정확히 절반으로 줄어들었습니다. 반면 극도의 수치 민감도를 가진 로컬 SWA KV 캐시는 안전하게 FP8 정밀도를 유지했습니다.

2) SWA Bounded Replay: 1/8 영속 캐시 절감의 비밀

에이전트 서빙 인프라에서 프리픽스 캐싱(Prefix Caching)은 필수적입니다. 이전 턴의 KV 캐시를 SSD나 호스트 DRAM에 영구 보존(Persistent Cache)해 두어야 다음 턴에 즉각적으로 컨텍스트를 이어받을 수 있기 때문입니다.

DeepSeek-V4에서는 로컬 슬라이딩 윈도우 어텐션(SWA, 윈도우 크기 n_win=128) 상태를 복원하기 위해 막대한 SSD 용량을 소모하거나, 전체 L개 레이어에 걸쳐 L * n_win 토큰 전체를 다시 포워드 연산해야 하는 극단적인 비용 딜레마에 부딪혔습니다.

딥시크는 실제 세션 분석을 통해 결정적인 인사이트를 얻었습니다:

  • 글로벌 KV는 롱테일 재사용 패턴을 보이므로 최소 72시간 이상 영속 SSD 스토리지에 보관할 가치가 충분합니다.
  • SWA KV는 활성 세션 내부의 수 분(Minute-scale) 단위 좁은 윈도우에서만 재사용되며, 세션이 끝나면 즉시 쓰레기 데이터(Dead state)로 전락합니다.
[DeepSeek-V4.1-Flash의 영속 캐시 2단계 개편]
1. SWA KV의 영속 SSD 저장 완전 배제:
   - SSD에는 오직 1/4로 압축된 글로벌 KV만 72시간 보증 저장.
   - SWA KV는 호스트 DRAM의 10% 공간을 활용한 단기 메모리 풀(TTL 수 분)에만 임시 캐싱.
2. 캐시 미스 시 SWA Bounded Replay:
   - SWA KV가 메모리 풀에서 증발하더라도, 과거 L * n_win 토큰을 재연산하지 않음.
   - 오직 프롬프트의 가장 마지막 n_win(128) 토큰만 다시 흘려보내(Bounded Replay)
     근사적인 SWA KV를 초저비용으로 복원!

수학적으로 엄밀한 상태와 완벽히 일치하지는 않지만, 어텐션의 유효 수용 영역(Effective Receptive Field)이 국소적이라는 특성 덕분에 벤치마크 정확도 하락은 측정 불가능할 정도로 미미했습니다. 이로써 영속 스토리지(SSD/Host RAM)의 KV 캐시 점유율은 전작 대비 1/8로 수직 낙하했습니다.


5. 인프라와 커널 최적화: Single-Pass mHC, Engram, DSpark

딥시크는 모델 구조의 변경에 발맞추어 하드웨어 실행 효율을 극대화하는 커널 수준 최적화를 완비했습니다.

Single-Pass mHC와 Mega-mHC 융합 커널

DeepSeek-V4에서 도입되었던 다중 잔차 연결 구조 mHC(multi-head residual connections)는 레이어 간 n개의 잔차 스트림을 유지하여 표현력을 높였지만, 잔차 갱신과 믹싱 계수 계산, 입력 믹싱이 순차적으로 실행되며 이상적인 메모리 하한선(Lower bound: (2n + 2)d)의 두 배에 달하는 (4n + 4)d의 활성화 메모리 트래픽(Activation memory traffic)을 유발했습니다.

DeepSeek-V4.1-Flash는 입력 믹싱 계수를 1개 블록 시프트(A_(l-1))하여 데이터 의존성을 끊어내는 Single-Pass mHC를 고안했습니다. 배포 시에는 단일 Mega-mHC 커널로 융합되어, 입력을 단 한 번 읽고 한 번 쓰는 이론적 하한선 (2n + 2)d를 완벽히 달성하고 활성화 메모리 트래픽을 절반으로 절감했습니다.

196B Engram 조건부 메모리와 Sinkhorn 최적화

지식 암기를 연산 파라미터와 분리하기 위해 196B 규모의 Engram 모듈(N-gram 차수 2, 3, 4, 8개 해시 헤드, 16M 엔트리 소수 크기 테이블)을 1번과 14번 레이어에 배치했습니다.

  • 대규모 임베딩 테이블에 일반적인 Adam을 적용하면 옵티마이저 상태 메모리가 폭발하므로, 딥시크는 Nesterov 모멘텀과 싱크혼 밸런싱(Sinkhorn balancing, K=11 반복)을 결합한 독자적인 행-열 RMS 정규화 업데이트 알고리즘을 적용하여 메모리를 아끼면서도 Adam을 능가하는 수렴 성능을 확보했습니다.

DSpark 투기적 디코딩 (Speculative Decoding)

기존의 다중 토큰 예측(MTP) 대신, 사전 학습 이후 별도로 훈련되는 DSpark 모듈을 도입했습니다. 128 토큰 슬라이딩 윈도우를 가진 3개 트랜스포머 블록이 5개 초안(Draft) 위치의 로짓을 병렬로 생성하고, 경량 마르코프 헤드와 확신도 스케줄러가 시스템 부하에 맞추어 검증 길이를 동적으로 조절하여 서빙 처리량을 극대화합니다.

이 모든 최적화가 집약된 결과, 모델의 대다수를 차지하는 CSA2 Reuse Mode 레이어는 프리필 시 단 15개 커널, 디코드 시 단 11개 커널만으로 하드웨어를 빈틈없이 채우며 고속 파이프라인 실행을 달성합니다.


6. 벤치마크 평가와 지적 정직성: 어디서 이기고, 어디서 한계인가?

DeepSeek-V4.1-Flash의 실전 역량은 과연 어느 수준일까요? 공개된 베이스 모델 및 포스트 트레이닝 평가 결과를 면밀히 살펴보겠습니다.

Figure 6: 프론티어 오픈소스 및 폐쇄형 모델과의 종합 추론 및 에이전트 벤치마크 비교
Figure 6: 프론티어 오픈소스 및 폐쇄형 모델과의 종합 추론 및 에이전트 벤치마크 비교

1) 소프트웨어 엔지니어링 및 에이전트 과업에서의 압도적 성취

Figure 6(Table 3)에 제시된 수치는 에이전트 워크플로우에서 V4.1-Flash가 보여주는 놀라운 효율성을 입증합니다:

  • DeepSWE v1.1 (Resolved): 74.2%를 기록하며 전작인 V4-Flash(54.4%)는 물론 거대 모델인 DeepSeek-V4-Pro(62.7%), 나아가 최고 수준의 폐쇄형 플래그십인 Opus-5 (74.0%)와 GPT-5.6 Sol (73.0%)을 모두 제치고 1위를 차지했습니다.
  • Terminal-Bench 2.1 (Pass@1): 90.6%로 전체 비교 모델 중 유일하게 90% 선을 돌파했습니다 (Opus-5 89.1%, GPT-5.6 Sol 88.8%, Kimi-K3 88.3%).
  • Codeforces Rating: 3,471점이라는 경이적인 점수를 획득하며 V4-Pro(3,348)와 V4-Flash(3,289)를 가볍게 따돌리고 그랜드마스터급의 코딩 문제 해결력을 과시했습니다.
  • Automation-Bench (54.8%) 및 Agents' Last Exam (31.8%): 오픈소스 경쟁작인 Kimi-K3(46.7% / 27.6%)와 GLM-5.3(48.8% / 28.5%)을 여유 있게 앞섰습니다.

2) 냉정한 한계점과 실패 경계 (Intellectual Honesty)

그러나 기술 보고서의 결론부(Section 6)와 벤치마크 세부 데이터는 명확한 한계선 또한 솔직하게 고백하고 있습니다:

  • 초고난도 전문 과학 에이전트 과업의 격차: 박사급 과학 지식과 극한의 도메인 추론을 요구하는 Terminal-Bench 4.0에서 DeepSeek-V4.1-Flash는 31.2%에 그쳐, 거대 폐쇄형 모델인 Opus-5 (51.8%) 및 GPT-5.6 Sol (39.9%)과 상당한 격차를 드러냈습니다.
  • Humanity's Last Exam (HLE Pass@1): 도구 없는 순수 추론에서 36.8%(텍스트 39.1%)를 기록하여 Opus-5(56.3%)나 GPT-5.6 Sol(44.5%)에 미치지 못했습니다.
  • 희소 검색과 근사 복원의 엣지 케이스: CSA2의 희소 인덱서 선택 오류나 SWA Bounded Replay의 근사 상태 복원은 95% 이상의 일반적인 시나리오에서는 문제를 일으키지 않지만, 극단적인 경계 조건(Edge cases)이나 초장문 희소 검색 상황에서 잠재적인 성능 왜곡을 유발할 가능성이 남아 있습니다.

딥시크 연구진이 스스로 짚었듯, 일상적인 엔지니어링 및 사무 자동화 과업의 95% 이상을 완벽히 소화하면서도 배포 비용을 획기적으로 낮춘 실용적 타협점이라는 평가가 가장 정확합니다.


7. 운영 제어와 테스트 타임 확장 전략

DeepSeek-V4.1-Flash는 실제 프로덕션 서빙과 배포 유연성을 위해 두 가지 강력한 확장 메커니즘을 지원합니다.

Figure 7: 추론 노력(Reasoning Effort 25에서 100) 조절에 따른 성능과 토큰 비용 트레이드오프
Figure 7: 추론 노력(Reasoning Effort 25에서 100) 조절에 따른 성능과 토큰 비용 트레이드오프

1) 가변 추론 노력 (Controllable Reasoning Effort: 1부터 100)

강화학습 단계에서 시스템 프롬프트에 Reasoning Effort: {effort}를 스칼라 값(1부터 100)으로 주입하고, 요청된 노력 수준에 따라 토큰 길이 페널티를 지수 함수적으로 차등 부여하는 RL 목적 함수를 설계했습니다.

Figure 7에 나타난 결과는 매우 흥미로운 파레토 프론티어(Pareto Frontier)를 보여줍니다:

  • 추론 노력을 25에서 100으로 올리면 주요 추론 벤치마크의 평균 Pass@1이 67.1%에서 76.3%로, DeepSWE v1.1이 66.0%에서 74.2%로 꾸준히 우상향합니다.
  • 그러나 성능 향상의 대부분은 60에서 80 구간에서 이미 달성되며, 80에서 100으로 넘어가는 마지막 구간은 출력 토큰 수가 1.6배에서 1.8배 급증하는 반면 성능 이득은 점진적(Diminishing returns)입니다.
  • 공식 API에서는 이를 low (50), high (75), max (100) 세 가지 티어로 단순화하여 노출하므로, 서비스 제공자는 지연 시간과 비용 예산에 맞춰 최적의 운영 포인트를 자유롭게 선택할 수 있습니다.
Figure 8: Agent Team 모드에서의 테스트 타임 컴퓨트 확장 (벽시계 마감시간별 성능 추이)
Figure 8: Agent Team 모드에서의 테스트 타임 컴퓨트 확장 (벽시계 마감시간별 성능 추이)

2) 멀티 에이전트(Agent Team) 테스트 타임 확장

복잡한 소프트웨어 엔지니어링 과업을 단일 에이전트 혼자 장시간 푸는 것보다, 여러 에이전트가 역할을 나누어 협업하는 멀티 에이전트 팀이 테스트 타임 연산량(Test-Time Compute)을 스케일링하는 데 훨씬 유리합니다.

Figure 8은 ProgramBench와 FrontierSWE v2에서 벽시계 시간(1시간부터 20시간까지)을 투입함에 따라 단일 에이전트와 멀티 에이전트 팀의 성능 차이를 추적한 결과입니다:

  • ProgramBench (Almost@1): 8시간 마감 기준 단일 에이전트가 20.39%에 머문 반면, 멀티 에이전트 팀은 30.04%를 달성했습니다.
  • FrontierSWE v2 (Mean@5): 20시간 마감 기준 단일 에이전트의 28.20% 대비 멀티 에이전트 팀은 32.90%로 지속적인 성능 우위를 증명했습니다.
  • 피어 메일박스(send_message), 작업 보드 도구, 그리고 비동기 팀원 생성(spawn_teammate)을 통해 서빙 지연에 구애받지 않고 DAG 기반의 임계 경로를 효율적으로 단축했습니다.

8. 결론: 에이전트 인프라 설계자를 위한 핵심 교훈

DeepSeek-V4.1-Flash는 오픈 가중치(Open Weights) 생태계에 또 하나의 거대한 이정표를 세웠습니다. 무작정 모델 크기를 키우거나 어텐션 행렬을 거대 GPU 클러스터로 밀어붙이는 대신, 철저한 워크로드 분석에 기반한 아키텍처적 비대칭(CED)과 수학적 근거를 갖춘 캐시 압축(CSA2, FP4, Bounded Replay)을 통해 실전 에이전트 서빙의 경제성을 재정의했습니다.

⚡아키텍처 및 시스템 엔지니어링 핵심 요약
  1. 비대칭 활성화의 미학 (CED): 인풋이 지배적인 에이전트 세션에서는 굳이 프리필에서 전체 파라미터를 돌릴 필요가 없습니다. 인코더 8B 프리필과 디코더 16B 디코드의 비대칭 분리는 긴 프롬프트 비용을 절반으로 잘라냅니다.
  2. 3차원 복합 압축 (CSA2 + FP4): 엔트리(FP4), 시퀀스(블록 압축), 레이어(Full/Reindex/Reuse) 차원을 동시에 압축하고 계층적 인덱서로 탐색 공간을 고정하여, 토큰당 890바이트라는 경이적인 HBM 상주 캐시를 달성했습니다.
  3. 영속 캐시의 패러다임 전환 (Bounded Replay): 수명이 극히 짧은 로컬 SWA 캐시를 굳이 SSD에 영구 보존할 이유가 없습니다. 과감히 버리고 필요할 때 최근 128토큰만 바운디드 리플레이로 복원하는 설계가 스토리지 비용을 1/8로 날려버렸습니다.

지능을 높이는 경쟁만큼이나, 그 지능을 현실 세계의 제품과 서비스에 합리적인 비용으로 녹여내는 인프라 엔지니어링이 얼마나 강력한 무기인지 DeepSeek-V4.1-Flash는 증명하고 있습니다.