순수 완료시간 기준으로는 GPT-5.6 Terra medium이 네 작업 모두 가장 빨랐고, GPT-5.6 Luna medium이 근소한 차이로 뒤를 이었습니다.
- 최고 속도: Terra medium — 평균 시간지수 69
- 속도·추론 균형: Terra high — 평균 시간지수 77, AAII 49
- 품질 중심 기준점: Sol medium — 시간지수 100, AAII 54
- 최고 종합점수: Sol xhigh — AAII 58이지만 평균 4.18배 느림
- DeepSeek: 공식 API의
xhigh는 별도 단계가 아니라max로 매핑되므로 두 행의 결과가 같습니다.
중요하게도 아래 작업시간은 각 모델 API를 직접 실행한 스톱워치 결과가 아닙니다. 공개된 첫 답변 토큰 시간과 출력 처리량 실측값을 동일한 작업 프로파일에 적용한 재현 가능한 산정값입니다. Artificial Analysis 측정은 10,000 입력 토큰, 최근 72시간의 P50이며, 첫 답변 토큰 시간에는 모델의 내부 추론 대기시간이 포함됩니다.
작업 완료시간 비교
각 작업 셀은 **예상 시간(초) / 시간지수**입니다.
- 시간지수는
GPT-5.6 Sol medium = 100 - 낮을수록 빠름
- 평균지수는 네 작업 시간지수의 단순 평균
| 모델·effort | AAII | 첫 답변 토큰 | 출력 tok/s | 일상 질문 | 엔지니어링 검색 | n8n 검증 | 코딩 | 평균지수 |
|---|---|---|---|---|---|---|---|---|
| DeepSeek V4 Flash high | 37 | 12.96초 | 106.5 | 17.7 / 162 | 100.6 / 137 | 65.0 / 145 | 133.3 / 134 | 145 |
| DeepSeek V4 Flash max | 40 | 47.58초 | 121.2 | 51.7 / 475 | 236.8 / 322 | 167.1 / 374 | 303.5 / 305 | 369 |
| DeepSeek V4 Flash xhigh¹ | 40 | 47.58초 | 121.2 | 51.7 / 475 | 236.8 / 322 | 167.1 / 374 | 303.5 / 305 | 369 |
| GPT-5.6 Luna medium | 38 | 3.40초 | 166.8 | 6.4 / 59 | 55.6 / 76 | 31.2 / 70 | 77.0 / 77 | 70 |
| GPT-5.6 Luna xhigh | 49 | 40.36초 | 167.6 | 43.3 / 398 | 203.4 / 277 | 142.0 / 318 | 261.7 / 263 | 314 |
| GPT-5.6 Luna max | 51 | 139.79초 | 198.5 | 142.3 / 1,307 | 599.2 / 815 | 438.9 / 983 | 756.5 / 761 | 966 |
| GPT-5.6 Terra medium | 46 | 1.92초 | 117.1 | 6.2 / 57 | 54.8 / 74 | 30.6 / 68 | 75.9 / 76 | 69 |
| GPT-5.6 Terra high | 49 | 3.30초 | 122.4 | 7.4 / 68 | 59.5 / 81 | 34.2 / 76 | 81.9 / 82 | 77 |
| GPT-5.6 Terra xhigh | 52 | 21.66초 | 120.3 | 25.8 / 237 | 133.3 / 181 | 89.4 / 200 | 174.1 / 175 | 198 |
| GPT-5.6 Sol medium | 54 | 4.13초 | 74.0 | 10.9 / 100 | 73.5 / 100 | 44.7 / 100 | 99.4 / 100 | 100 |
| GPT-5.6 Sol xhigh | 58 | 51.95초 | 69.8 | 59.1 / 543 | 266.5 / 362 | 189.3 / 424 | 340.6 / 343 | 418 |
¹ DeepSeek 공식 API는 high와 max만 구분하며, xhigh 요청은 max로 매핑합니다.
DeepSeek의 속도·지연은 자사 API 기준으로 high가 106.5 tok/s·12.96초, max가 121.2 tok/s·47.58초입니다. Luna는 medium 166.8 tok/s·3.40초, xhigh 167.6 tok/s·40.36초, max 198.5 tok/s·139.79초로 측정됐습니다.
Terra는 medium 117.1 tok/s·1.92초, high 122.4 tok/s·3.30초, xhigh 120.3 tok/s·21.66초입니다. Sol은 medium 74.0 tok/s·4.13초, xhigh 69.8 tok/s·51.95초입니다.
AAII 점수는 DeepSeek high/max 37/40, Luna medium/xhigh/max 38/49/51, Terra medium/high/xhigh 46/49/52, Sol medium/xhigh 54/58입니다. AAII는 코딩만의 점수가 아니라 Terminal-Bench, SciCode, 과학·지식·장문 추론 등을 포함한 종합지수입니다.
작업시간 산정 조건
| 작업 | 모델 호출 횟수 | 총 답변 토큰 | 공통 도구·실행시간 | 가정한 작업 |
|---|---|---|---|---|
| 일상 질문 | 1회 | 500 | 0초 | 일반 설명·비교·질의응답 |
| 엔지니어링 검색 | 4회 | 2,000 | 30초 | 검색 계획, 자료 조회, 교차검증, 최종 정리 |
| n8n workflow 검증 | 3회 | 1,500 | 12초 | JSON 분석, 노드 연결·표현식 점검, 결과 정리 |
| 코딩 | 5회 | 2,500 | 45초 | 분석, 구현, 명령 실행, 테스트, 최종 검토 |
계산식은 다음과 같습니다.
[T_{\text{task}}
T_{\text{공통 도구}}
+
N_{\text{호출}}\times T_{\text{첫 답변}}
+
\frac{\text{총 답변 토큰}}{\text{출력 tok/s}}
]
공통 도구시간은 모델과 무관하게 동일하게 적용했습니다. 따라서 실제 웹사이트 응답, npm 설치, Docker 빌드, 테스트 스위트 실행시간이 길어질수록 모델 간 상대 차이는 축소됩니다.
레이더 차트
레이더 차트는 표의 시간지수를 역수로 바꾼 완료속도 점수입니다.
Sol medium = 100- 높을수록 빠름
- 150은 Sol medium보다 약 1.5배 빠르다는 의미
- 50은 약 절반 속도라는 의미
- 11개 선의 중첩을 피하기 위해 제품군별로 분리했습니다.
사용 사례별 판단
| 사용 사례 | 기본 권장 | 품질 우선 대안 | 판단 |
|---|---|---|---|
| 일상적인 질문 | Terra medium | Sol medium | Terra medium이 약 43% 짧은 시간에 완료 |
| 엔지니어링 검색 | Terra high | Sol medium | Terra high는 19% 빠르면서 AAII 49; 근거 정확도가 특히 중요하면 Sol medium |
| n8n workflow 검증 | Terra high | Sol medium | medium보다 소폭 느리지만 복잡한 분기·표현식 검증에 더 합리적인 effort |
| 일반 코딩 | Terra high | Sol medium | 반복 개발에는 Terra high, 설계·원인분석·대규모 리팩터링에는 Sol medium |
| 고난도 코드·안전 중요 검증 | Sol xhigh | Terra xhigh | 지연을 허용하고 실패 비용이 매우 큰 경우에만 적합 |
| 저비용 오픈웨이트 처리 | DeepSeek high | DeepSeek max | 시간 자체는 Terra/Luna보다 불리하지만 자체 호스팅·비용 측면에서 의미 있음 |
핵심 트레이드오프
Terra medium → high는 평균 시간지수가 69에서 77로 약 12% 증가하지만 AAII가 46에서 49로 올라갑니다. n8n과 일반 코딩에서는 가장 현실적인 균형입니다.
Sol medium → xhigh는 AAII가 54에서 58로 4점 상승하지만 평균 완료시간은 약 4.18배가 됩니다. 따라서 xhigh를 모든 코딩 요청의 기본값으로 쓰기보다는 어려운 버그, 아키텍처 결정, 최종 검증 단계에 한정하는 편이 적절합니다.
Luna medium → xhigh는 AAII가 38에서 49로 크게 상승하지만 평균 완료시간은 약 4.5배가 됩니다. Luna medium의 핵심 장점인 낮은 지연을 사실상 잃습니다.
Luna max는 출력 자체는 가장 빠르지만 답변 전 추론 대기가 약 140초여서, 반복적인 코딩·검색·workflow 검증에는 적합하지 않습니다.
DeepSeek max와 xhigh는 동일 설정이며, 공식 DeepSeek API에서는 Sol medium보다 평균 약 3.69배 느리게 산정됩니다. 다만 호스팅 제공자의 영향이 큽니다. 독립 측정에서 DeepSeek max의 Makora 경로는 첫 답변 24.86초·232 tok/s였고, DeepSeek 자사 API는 47.58초·121.2 tok/s였습니다. OpenRouter 같은 다중 공급자 라우터에서는 표보다 상당히 빨라질 수 있습니다.
권장 기본 라우팅
사용 패턴을 기준으로 한 실용적인 라우팅은 다음과 같습니다.
- 기본 일상 질문: Terra medium
- n8n·일반 코딩·엔지니어링 조사: Terra high
- 중요 설계·복합 디버깅·근거 검증: Sol medium
- 최종 안전검증·고난도 실패 분석: Sol xhigh
- 대량 저비용 백그라운드 처리: DeepSeek high
- Luna medium: 단순·대량·짧은 생성에서 Terra medium의 대안
OpenAI는 GPT-5.6에서 medium을 균형 출발점, high/xhigh를 측정된 품질 개선이 있을 때, max를 가장 어려운 품질 우선 작업에 사용하도록 안내합니다. 또한 다중 턴 코딩에서는 persisted reasoning을 재사용할 수 있어 실제 OpenAI 작업시간이 본 표보다 짧아질 가능성이 있습니다.
마지막으로, 요청하신 DeepSeek V4 Flash 0731이라는 별도 공개 스냅샷은 공식 문서와 독립 측정 페이지에서 검증하지 못했습니다. 따라서 이번 비교는 현재 공개된 DeepSeek V4 Flash high/max 실측값을 사용했습니다. 0731이 특정 라우터의 내부 버전명이라면 해당 공급자의 실행 로그가 있어야 정확히 분리할 수 있습니다.
0 댓글