arrow_back 전체 글
DeepSeek V4.1 Flash 출시: 달라진 점과 가격
deepseek v4.1 flashdeepseek 새 모델deepseek 가격deepseek-flash저렴한 코딩 모델ai 코딩 에이전트 모델

DeepSeek V4.1 Flash 출시: 달라진 점과 가격

9월 10일 DeepSeek가 V4.1 Flash를 공개했습니다. 552B MoE에 입력 8B·출력 16B만 활성화하는 새 비대칭 아키텍처, 네이티브 비전, 1M 컨텍스트, 그리고 절반으로 떨어진 오프피크 단가까지 — 코딩 에이전트 관점에서 달라진 것을 정리합니다.

Dana Cho · Product Engineer · 2026년 9월 14일 · 6 분 읽기

DeepSeek가 2026년 9월 10일 DeepSeek-V4.1-Flash를 공개했습니다. V4-Flash 세대의 단순한 마이너 업그레이드가 아니라, 새 아키텍처 계열의 첫 모델입니다 — 입력과 출력에 서로 다른 수의 활성 파라미터를 쓰는 비대칭 구조, 네이티브 시각 이해, 그리고 이전 세대의 4분의 1로 줄어든 KV 캐시가 핵심입니다. API 모델 이름은 deepseek-flash이며, 공개 즉시 DeepSeek API에서 사용할 수 있습니다.

meshcode에서도 DeepSeek V4.1 Flash를 바로 쓸 수 있습니다. 모델이 출시된 지 며칠 안에 카탈로그를 새 이름과 새 단가에 맞춰 정리해 두었습니다 — 앱에서 확인하는 방법은 아래에서 다시 다루겠습니다.

새 아키텍처: 552B MoE, 활성 파라미터는 8B·16B

V4.1 Flash의 구조는 공식 발표 기준으로 이렇습니다:

  • 552B 파라미터 MoE — 전체는 크지만 토큰마다 활성화되는 파라미터는 극히 일부입니다.
  • Causal Encoder–Decoder 구조 — 입력 처리에는 8B, 출력 생성에는 16B의 활성 파라미터를 사용합니다. 입력과 출력에 서로 다른 예산을 배정하는 비대칭 설계로, 긴 컨텍스트를 읽는 비용과 토큰을 쓰는 비용을 따로 최적화한 형태입니다.
  • 네이티브 멀티모달 — 별도의 비전 변형 없이 한 모델이 이미지를 이해합니다. V4 세대에서 별도 모델(Vision-Exp)으로 나뉘어 있던 부분이 통합되었습니다.
  • 1M 컨텍스트, 최대 384K 출력 — thinking/non-thinking 모드를 모두 지원하며 기본값은 thinking 모드입니다.

DeepSeek는 새 사전학습 방법과 대규모 RL 후학습을 통해 벤치마크에서 플래그십 모델(V4-Pro 포함)을 앞선다고 발표했습니다. 다만 이는 제조사의 공식 발표에 근거한 수치이며, meshcode는 특정 모델에 자체 역량 등급이나 순위를 부여하지 않습니다 — 어떤 모델이 어떤 작업에 맞는지는 오케스트레이터가 실제 위임 실적과 사용자의 선택에 따라 판단하도록 설계되어 있습니다.

DeepSeek V4.1 Flash 출시: 달라진 점과 가격

쓰던 Claude·Codex를 그대로 연결하고, 나머지는 몇십 분의 일 가격의 워커가 처리합니다.

meshcode 다운로드 →

KV 캐시 4분의 1: 에이전트 비용에 직접 영향

에이전트 코딩의 특징은 같은 컨텍스트를 반복해서 읽는다는 점입니다. 긴 시스템 프롬프트, 코드베이스 스냅샷, 이전 턴의 도구 호출 결과가 매 요청마다 다시 들어가고, 이때 캐시 히트 여부가 비용을 좌우합니다. DeepSeek의 캐시 히트 요율은 캐시 미스 요율의 50분의 1 수준이라, 캐시를 많이 타는 워크로드일수록 캐시 비용이 청구서의 큰 몫을 차지합니다.

V4.1 Flash는 이전 세대 대비 KV 캐시가 HBM은 4분의 1, SSD 저장 공간은 8분의 1로 줄었다고 발표했습니다. 단순한 서버 비용 절감이 아니라, 캐시 적재·유지 비용이 큰 비중을 차지하는 에이전트 워크로드의 총비용을 낮추는 구조적 변화입니다. DeepSeek가 이 아키텍처로 더 낮은 가격을 제공할 수 있다고 설명하는 근거이기도 합니다.

가격: 피크/오프피크 2배 차이

V4.1 Flash와 함께 새 요율이 9월 10일부터 적용되었습니다. 100만 토큰당 요율(공식 가격 페이지 기준, 2026-09-14 조회):

입력 (캐시 히트) 입력 (캐시 미스) 출력
피크 $0.006 $0.30 $1.20
오프피크 $0.003 $0.15 $0.60

오프피크는 피크의 정확히 50%입니다. 피크 시간은 UTC 기준 월금 01:00–04:00과 06:00–10:00이며, 그 외는 모두 오프피크입니다 — 한국 시간(KST, UTC+9)으로 환산하면 평일 오전 10시오후 1시와 오후 3시~오후 7시가 피크이고, 그 밖의 시간(심야·이른 아침·주말)에는 절반 가격에 동일한 모델을 씁니다. 유연하게 미뤄둘 수 있는 대량 작업 — 리팩터링 배치, 테스트 생성, 문서화 — 을 오프피크로 옮기는 것만으로 토큰 비용이 절반됩니다.

캐시 히트 입력이 피크 기준 $0.006이라는 점도 주목할 만합니다. 캐시를 잘 타는 긴 에이전트 세션에서는 대부분의 입력이 이 요율로 처리되어, 실효 입력 비용이 표면 단가보다 훨씬 낮게 나옵니다.

기존 모델 이름은 어떻게 되나

DeepSeek의 모델 이름 정리도 함께 확인해 두면 좋습니다 (공식 문서 기준, 2026-09-14 조회):

  • deepseek-v4-flash, deepseek-v4-flash-vision-exp는 폐지되었습니다. 호환을 위해 이름은 남아 있지만 요청은 모두 V4.1 Flash가 처리하며 V4.1 Flash 요율로 과금됩니다.
  • deepseek-v4-pro는 그대로 유지됩니다. 당초 9월 14일부터 V4.1 Flash로 라우팅될 예정이었으나, DeepSeek는 사용자 요구에 따라 V4-Pro API 서비스를 계속 제공하고 과금 방식도 유지한다고 공지했습니다(변경 시 별도 공지 예정).

즉 새 프로젝트는 deepseek-flash를 쓰면 되고, 기존에 deepseek-v4-flash를 쓰던 코드는 수정 없이 그대로 V4.1 Flash를 받게 됩니다. V4.1-Pro는 추후 별도 출시 예정입니다.

오픈가중치와 자체 배포

V4.1 Flash는 HuggingFace에 가중치가 공개되며(deepseek-ai/DeepSeek-V4.1-Flash), 기술 리포트도 함께 공개되었습니다. DeepSeek는 오픈소스 커뮤니티와의 추론(inference) 지원 협업과 더 넓은 배포 옵션을 예고했습니다. 셀프호스팅 관점에서 KV 캐시 축소는 메모리 요구사항 감소를 의미하므로, 이전 세대 대비 더 적은 하드웨어로 같은 컨텍스트 길이를 서빙할 수 있다는 뜻이기도 합니다.

meshcode에서 바로 쓸 수 있습니다

DeepSeek V4.1 Flash는 현재 meshcode에서 지원됩니다. 앱의 Account → Models에서 사용 가능한 모델 목록과 현재 적용 단가를 확인할 수 있습니다 — 모델 카탈로그와 요율은 계속 갱신되므로 최신 상태는 앱 안에서 보는 것이 정확합니다.

meshcode에서 DeepSeek를 쓰는 방식은 크게 두 가지입니다:

  • 자체 모델 스택으로 — meshcode의 pay-as-you-go 크레딧($1부터 충전)으로 토큰을 그대로 씁니다. 저비용 모델에 대량 작업을 맡기고 비싼 모델은 판단이 필요한 작업에만 쓰는 패턴이 자연스럽습니다.
  • 여러 패널에서 동시에 — 한 패널에서 DeepSeek로 리팩터링을 돌리는 동안 다른 패널에서 다른 모델로 리뷰를 돌릴 수 있습니다. 모델을 하나 고르는 것이 아니라 작업마다 나누는 방식입니다.

V4 세대의 비용 구조를 Claude Code 정액제와 직접 비교한 글은 DeepSeek V4 vs Claude Code, 뭐가 더 저렴할까?에서 다루었고, 토큰 종량제와 정액제의 계산 방식 자체는 AI 코딩 에이전트 토큰 비용 비교 2026을 참고하세요.

정리

V4.1 Flash가 코딩 워크로드에 의미하는 지점은 세 가지입니다. 첫째, 비대칭 활성 파라미터(입력 8B·출력 16B)로 "읽는 비용"과 "쓰는 비용"을 분리해 최적화한 새 아키텍처의 첫 모델입니다. 둘째, KV 캐시 4분의 1 축소는 캐시 히트 의존도가 높은 에이전트 세션의 비용 구조에 직접 영향을 줍니다. 셋째, 오프피크 50% 정책이 유지되어 작업을 시간대에 따라 배치하는 것만으로 실비용이 절반으로 움직입니다.

요율과 모델 이름은 계속 바뀝니다 — 중요한 결정 전에는 위 표보다 항상 공식 가격 페이지와 meshcode 앱 안의 Models 목록을 기준으로 하세요.

👉 meshcode 다운로드 — Mac·Windows