주간복기라이브테크경제국제롱제비티
MYOSU
구독
구독멤버십

묘수의 관점테크경제국제롱제비티

주간 복기라이브 자료AI 대화록팟캐스트

투자의 묘수

투자유형검사글로벌 메가캡

묘수의 관점 · 투자 매거진

묘수의 관점

혼란스러운 세상의 변화를 이해하고 싶습니다. 매일의 라이브, 매주의 복기, 매일의 매거진.

콘텐츠주간 복기라이브팟캐스트
투자의 묘수투자유형검사글로벌 메가캡
멤버멤버십로그인
정책개인정보처리방침이용약관

MYOSU VIEW

본 콘텐츠는 정보 제공·교육 목적이며, 특정 종목의 매매를 권유하는 투자 자문이 아닙니다. 투자 판단과 그 결과의 책임은 이용자 본인에게 있습니다.

© 2026 묘수의 관점. All rights reserved.

핵심은 무료로, 전문은 멤버에게.

← 테크

원글2026.08.15

딥시크가 API 요금을 시간대별로 나눴습니다

글쓴이오레놀 대덕2026.08.15

딥시크가 8월 13일 새 모델 V4 프로를 공개하면서 API 요금제를 피크와 오프피크로 나누고 가격을 올렸습니다. 같은 주 구글과 오픈AI는 주요 모델의 가격을 내렸습니다.

데이터센터의 서버 랙. 이미지: Carl Lender / Wikimedia Commons (CC BY 2.0)
데이터센터의 서버 랙. 이미지: Carl Lender / Wikimedia Commons (CC BY 2.0)

새 요금표는 하루를 피크 시간과 오프피크 시간으로 나눕니다. 인상폭은 구간에 따라 50%에서 최대 1,100%입니다. 출력 100만 토큰 기준으로 V4 플래시는 균일가 0.28달러에서 피크 1.32달러로, V4 프로는 0.87달러에서 3.96달러로 오릅니다. 오프피크 가격은 피크의 절반입니다. 새 요금은 16일 발효합니다.

같은 주 미국 업체들은 반대 방향으로 움직였습니다. 구글은 3.6 플래시를 낸 지 3주 만에 3.7 플래시를 내놓으며 출력 가격을 절반인 3.75달러로 내렸고, 오픈AI는 GPT-5.6 루나 가격을 낮췄습니다.

같은 달, 반대로 움직인 추론 가격. 자료: 각사 공시 가격
같은 달, 반대로 움직인 추론 가격. 자료: 각사 공시 가격

두 흐름을 설비 사정의 차이로 읽는 해석이 많습니다. 미국 업체는 연산 자원에 여유가 있고, 중국 업체는 수출통제로 칩 확보가 어렵다는 것입니다. 딥시크의 요금표에서 따로 눈에 띄는 부분은 인상폭이 시간대에 따라 갈렸다는 점인데, 이는 추론 서비스의 원가가 시간에 따라 달라지는 구조와 맞물려 있습니다.

출력 토큰의 원가 구조

추론 요금이 입력과 출력으로 나뉘고 출력이 몇 배 비싼 것은 두 단계가 기계에게 서로 다른 작업이기 때문입니다.

질문을 읽는 프리필 단계는 프롬프트 전체를 한꺼번에 병렬로 처리합니다. 연산 장치가 쉬지 않고 도는 구간으로, 반도체가 잘하는 일입니다. 답을 쓰는 디코드 단계는 토큰을 하나 내놓을 때마다 모델 가중치 전체를 메모리에서 다시 읽어 옵니다. 순서대로만 진행되며, 이 단계의 병목은 메모리 대역폭에서 생깁니다. 연산 장치에 여유가 있어도 가중치를 읽어 오는 속도가 처리량을 정합니다.

이 때문에 디코드의 토큰당 원가는 프리필의 수백 배까지 벌어집니다. 격차를 줄이는 방법으로 쓰이는 것이 같은 왕복에 여러 요청을 함께 실어 보내는 배치입니다.

한 번에 몇 명을 태우느냐가 단가를 정합니다. 자료: 추론 서빙 연구
한 번에 몇 명을 태우느냐가 단가를 정합니다. 자료: 추론 서빙 연구

단가는 GPU 한 장의 값이나 모델의 크기보다 한 번 돌릴 때 몇 건의 요청을 함께 처리했는지에 더 크게 좌우됩니다. 요청이 한 건이든 수십 건이든 한 차례 연산에 들어가는 전력과 시간은 크게 달라지지 않기 때문에, 함께 묶는 요청이 많을수록 건당 원가가 내려갑니다.

동시에 처리할 수 있는 요청 수에는 한도가 있습니다. GPU 메모리에 올려 둘 수 있는 대화 기록의 양이 그 한도를 정하고, 넘어서면 대기열이 생기며 응답이 느려집니다. 이용자가 몰리는 낮에는 대기가 길어지고 밤에는 설비가 놀지만, 쓰이지 않은 GPU 시간은 재고로 쌓이지 않고 그대로 사라집니다.

시간대별 요금을 쓰는 산업들

재고를 쌓을 수 없고 용량이 고정돼 있으며 수요가 시간대에 따라 출렁이는 상품에는 이미 자리 잡은 가격 방식이 있습니다. 전력과 항공, 호텔은 모두 시간대와 시점에 따라 다른 값을 받습니다. 남는 자리를 싸게 넘기는 편이 이익이고, 수요가 몰리는 시간에 값을 올려 이용을 분산시키는 쪽이 설비를 늘리는 것보다 비용이 적게 들기 때문입니다.

시간대별 요금은 재고를 쌓을 수 없는 산업의 오래된 해법입니다. 이미지: Qurren / Wikimedia Commons (CC BY-SA 4.0)
시간대별 요금은 재고를 쌓을 수 없는 산업의 오래된 해법입니다. 이미지: Qurren / Wikimedia Commons (CC BY-SA 4.0)

딥시크가 요금 개편의 이유로 밝힌 것도 "자원을 더 합리적으로 배분하기 위해"였습니다. 오프피크 시간의 값을 피크의 절반으로 매긴 것은 이용 시점을 한산한 시간대로 옮기려는 설계에 해당합니다.

토큰 가격은 그동안 무어의 법칙처럼 한 방향으로 내려가는 곡선으로 다뤄져 왔습니다. 한 벌 더 파는 데 추가 비용이 거의 들지 않는 소프트웨어의 특성 때문입니다. 추론은 요청을 하나 더 처리할 때마다 전기와 메모리 대역폭을 실제로 소모하며, 한계비용이 0이 아닌 상품은 용량과 시점에 따라 값이 달라지는 요금 구조로 옮겨 갑니다.

한계와 눈여겨볼 대목

새 요금이 이용자의 실제 지출을 얼마나 바꾸는지는 16일 적용 이후에 드러납니다. 시간대와 캐시 적중 여부, 약정 물량에 따라 실효 단가가 갈리면 표시 가격만으로 서비스를 견주기 어려워지고, 실제 부담은 청구서 단계에서 확인됩니다.

토큰 단가와 과업당 비용이 같은 방향으로 움직인다는 보장도 없습니다. 구글이 3.6 플래시에서 내세운 지표 가운데 하나는 같은 일을 하는 데 출력 토큰을 17% 덜 쓴다는 것이었는데, 이는 회사가 직접 제시한 수치입니다. 단가가 반으로 내려도 추론 모델과 에이전트가 토큰을 열 배 더 쓰면 청구서는 올라갑니다.

이번 요금표에서 눈여겨볼 대목은 인상폭보다 가격을 가르는 기준입니다. 하루를 둘로 나눠 값을 매긴다는 것은 공급자가 설비 가동률을 가격으로 조절하겠다는 뜻이고, 전력과 항공이 오래 써 온 방식이기도 합니다. 미국 업체와 딥시크가 서로 다른 방향으로 움직인 것도 같은 원가 구조 위에서 다른 선택을 한 결과로 볼 수 있습니다. 자원에 여유가 있는 쪽은 값을 낮춰 이용을 늘렸고, 빠듯한 쪽은 값으로 사용 시점을 분산시켰습니다.

재고가 남지 않고 값이 시간에 따라 변하는 상품에는 선도 계약과 헤지가 따라붙어 왔습니다. 전력과 항공유가 그런 경우입니다. 컴퓨트를 미리 확보해 두는 시장이 열린다면 그 출발점은 이번 같은 시간대별 요금표가 될 가능성이 큽니다. 모델을 고를 때 확인할 항목에 성능과 표시 가격뿐 아니라 그 값이 적용되는 시간대가 더해진 셈입니다.

다음 읽기

  • 2026.08.19스트라이프, AI 라우터 오픈라우터 70억 달러 인수→
  • 2026.07.23TSMC 최대 분기 실적, 마진 가이던스는 하향→
테크 전체 보기 →