
DeepSeek V4.1 Flash 출시: 달라진 점과 가격
9월 10일 DeepSeek가 V4.1 Flash를 공개했습니다. 552B MoE에 입력 8B·출력 16B만 활성화하는 새 비대칭 아키텍처, 네이티브 비전, 1M 컨텍스트, 그리고 절반으로 떨어진 오프피크 단가까지 — 코딩 에이전트 관점에서 달라진 것을 정리합니다.
DeepSeek가 2026년 9월 10일 DeepSeek-V4.1-Flash를 공개했습니다. V4-Flash 세대의 단순한 마이너 업그레이드가 아니라, 새 아키텍처 계열의 첫 모델입니다 — 입력과 출력에 서로 다른 수의 활성 파라미터를 쓰는 비대칭 구조, 네이티브 시각 이해, 그리고 이전 세대의 4분의 1로 줄어든 KV 캐시가 핵심입니다. API 모델 이름은 deepseek-flash이며, 공개 즉시 DeepSeek API에서 사용할 수 있습니다.
meshcode에서도 DeepSeek V4.1 Flash를 바로 쓸 수 있습니다. 모델이 출시된 지 며칠 안에 카탈로그를 새 이름과 새 단가에 맞춰 정리해 두었습니다 — 앱에서 확인하는 방법은 아래에서 다시 다루겠습니다.
새 아키텍처: 552B MoE, 활성 파라미터는 8B·16B
V4.1 Flash의 구조는 공식 발표 기준으로 이렇습니다:
- 552B 파라미터 MoE — 전체는 크지만 토큰마다 활성화되는 파라미터는 극히 일부입니다.
- Causal Encoder–Decoder 구조 — 입력 처리에는 8B, 출력 생성에는 16B의 활성 파라미터를 사용합니다. 입력과 출력에 서로 다른 예산을 배정하는 비대칭 설계로, 긴 컨텍스트를 읽는 비용과 토큰을 쓰는 비용을 따로 최적화한 형태입니다.
- 네이티브 멀티모달 — 별도의 비전 변형 없이 한 모델이 이미지를 이해합니다. V4 세대에서 별도 모델(Vision-Exp)으로 나뉘어 있던 부분이 통합되었습니다.
- 1M 컨텍스트, 최대 384K 출력 — thinking/non-thinking 모드를 모두 지원하며 기본값은 thinking 모드입니다.
DeepSeek는 새 사전학습 방법과 대규모 RL 후학습을 통해 벤치마크에서 플래그십 모델(V4-Pro 포함)을 앞선다고 발표했습니다. 다만 이는 제조사의 공식 발표에 근거한 수치이며, meshcode는 특정 모델에 자체 역량 등급이나 순위를 부여하지 않습니다 — 어떤 모델이 어떤 작업에 맞는지는 오케스트레이터가 실제 위임 실적과 사용자의 선택에 따라 판단하도록 설계되어 있습니다.
쓰던 Claude·Codex를 그대로 연결하고, 나머지는 몇십 분의 일 가격의 워커가 처리합니다.
meshcode 다운로드 →KV 캐시 4분의 1: 에이전트 비용에 직접 영향
에이전트 코딩의 특징은 같은 컨텍스트를 반복해서 읽는다는 점입니다. 긴 시스템 프롬프트, 코드베이스 스냅샷, 이전 턴의 도구 호출 결과가 매 요청마다 다시 들어가고, 이때 캐시 히트 여부가 비용을 좌우합니다. DeepSeek의 캐시 히트 요율은 캐시 미스 요율의 50분의 1 수준이라, 캐시를 많이 타는 워크로드일수록 캐시 비용이 청구서의 큰 몫을 차지합니다.
V4.1 Flash는 이전 세대 대비 KV 캐시가 HBM은 4분의 1, SSD 저장 공간은 8분의 1로 줄었다고 발표했습니다. 단순한 서버 비용 절감이 아니라, 캐시 적재·유지 비용이 큰 비중을 차지하는 에이전트 워크로드의 총비용을 낮추는 구조적 변화입니다. DeepSeek가 이 아키텍처로 더 낮은 가격을 제공할 수 있다고 설명하는 근거이기도 합니다.
가격: 피크/오프피크 2배 차이
V4.1 Flash와 함께 새 요율이 9월 10일부터 적용되었습니다. 100만 토큰당 요율(공식 가격 페이지 기준, 2026-09-14 조회):
| 입력 (캐시 히트) | 입력 (캐시 미스) | 출력 | |
|---|---|---|---|
| 피크 | $0.006 | $0.30 | $1.20 |
| 오프피크 | $0.003 | $0.15 | $0.60 |
오프피크는 피크의 정확히 50%입니다. 피크 시간은 UTC 기준 월금 01:00–04:00과 06:00–10:00이며, 그 외는 모두 오프피크입니다 — 한국 시간(KST, UTC+9)으로 환산하면 평일 오전 10시오후 1시와 오후 3시~오후 7시가 피크이고, 그 밖의 시간(심야·이른 아침·주말)에는 절반 가격에 동일한 모델을 씁니다. 유연하게 미뤄둘 수 있는 대량 작업 — 리팩터링 배치, 테스트 생성, 문서화 — 을 오프피크로 옮기는 것만으로 토큰 비용이 절반됩니다.
캐시 히트 입력이 피크 기준 $0.006이라는 점도 주목할 만합니다. 캐시를 잘 타는 긴 에이전트 세션에서는 대부분의 입력이 이 요율로 처리되어, 실효 입력 비용이 표면 단가보다 훨씬 낮게 나옵니다.
기존 모델 이름은 어떻게 되나
DeepSeek의 모델 이름 정리도 함께 확인해 두면 좋습니다 (공식 문서 기준, 2026-09-14 조회):
deepseek-v4-flash,deepseek-v4-flash-vision-exp는 폐지되었습니다. 호환을 위해 이름은 남아 있지만 요청은 모두 V4.1 Flash가 처리하며 V4.1 Flash 요율로 과금됩니다.deepseek-v4-pro는 그대로 유지됩니다. 당초 9월 14일부터 V4.1 Flash로 라우팅될 예정이었으나, DeepSeek는 사용자 요구에 따라 V4-Pro API 서비스를 계속 제공하고 과금 방식도 유지한다고 공지했습니다(변경 시 별도 공지 예정).
즉 새 프로젝트는 deepseek-flash를 쓰면 되고, 기존에 deepseek-v4-flash를 쓰던 코드는 수정 없이 그대로 V4.1 Flash를 받게 됩니다. V4.1-Pro는 추후 별도 출시 예정입니다.
오픈가중치와 자체 배포
V4.1 Flash는 HuggingFace에 가중치가 공개되며(deepseek-ai/DeepSeek-V4.1-Flash), 기술 리포트도 함께 공개되었습니다. DeepSeek는 오픈소스 커뮤니티와의 추론(inference) 지원 협업과 더 넓은 배포 옵션을 예고했습니다. 셀프호스팅 관점에서 KV 캐시 축소는 메모리 요구사항 감소를 의미하므로, 이전 세대 대비 더 적은 하드웨어로 같은 컨텍스트 길이를 서빙할 수 있다는 뜻이기도 합니다.
meshcode에서 바로 쓸 수 있습니다
DeepSeek V4.1 Flash는 현재 meshcode에서 지원됩니다. 앱의 Account → Models에서 사용 가능한 모델 목록과 현재 적용 단가를 확인할 수 있습니다 — 모델 카탈로그와 요율은 계속 갱신되므로 최신 상태는 앱 안에서 보는 것이 정확합니다.
meshcode에서 DeepSeek를 쓰는 방식은 크게 두 가지입니다:
- 자체 모델 스택으로 — meshcode의 pay-as-you-go 크레딧($1부터 충전)으로 토큰을 그대로 씁니다. 저비용 모델에 대량 작업을 맡기고 비싼 모델은 판단이 필요한 작업에만 쓰는 패턴이 자연스럽습니다.
- 여러 패널에서 동시에 — 한 패널에서 DeepSeek로 리팩터링을 돌리는 동안 다른 패널에서 다른 모델로 리뷰를 돌릴 수 있습니다. 모델을 하나 고르는 것이 아니라 작업마다 나누는 방식입니다.
V4 세대의 비용 구조를 Claude Code 정액제와 직접 비교한 글은 DeepSeek V4 vs Claude Code, 뭐가 더 저렴할까?에서 다루었고, 토큰 종량제와 정액제의 계산 방식 자체는 AI 코딩 에이전트 토큰 비용 비교 2026을 참고하세요.
정리
V4.1 Flash가 코딩 워크로드에 의미하는 지점은 세 가지입니다. 첫째, 비대칭 활성 파라미터(입력 8B·출력 16B)로 "읽는 비용"과 "쓰는 비용"을 분리해 최적화한 새 아키텍처의 첫 모델입니다. 둘째, KV 캐시 4분의 1 축소는 캐시 히트 의존도가 높은 에이전트 세션의 비용 구조에 직접 영향을 줍니다. 셋째, 오프피크 50% 정책이 유지되어 작업을 시간대에 따라 배치하는 것만으로 실비용이 절반으로 움직입니다.
요율과 모델 이름은 계속 바뀝니다 — 중요한 결정 전에는 위 표보다 항상 공식 가격 페이지와 meshcode 앱 안의 Models 목록을 기준으로 하세요.
👉 meshcode 다운로드 — Mac·Windows
다른 글 더 보기
DeepSeek V4 vs Claude Code, 뭐가 더 저렴할까?
DeepSeek의 V4 세대는 프론티어에 근접한 코딩 품질과 Anthropic보다 한참 낮은 토큰 단가를 함께 제공합니다. 비용을 직접 비교하고 — 오픈가중치 모델이 이기는 지점, Claude Code 정액이 여전히 이기는 지점, 그리고 둘 다 굴리는 법을 정리했습니다.
Kimi vs Claude Code, 뭐가 더 저렴할까?
문샷AI의 Kimi는 매우 싼 토큰 단가에 긴 컨텍스트 윈도우, 그리고 선택적 정액 구독을 갖췄습니다. 월 약 20달러 Claude Code와 비교해서 실제로 더 싼 쪽은 사용 패턴에 따라 갈립니다.
AI 코딩 ROI 측정법: 구독료를 본전 뽑았는지 확인하는 4단계 방법
AI 코딩에 쓰는 돈이 성과로 돌아오고 있는지 확인하려면 체감이 아니라 계산이 필요합니다. 비용 항목 4개(구독·토큰 초과·재작업·유지보수)를 정리하고, PR 리드타임과 재작업률로 회수율을 계산하는 4단계 프레임을 정리했습니다.