openclaw에서 사용할 현실적인 llm 모델의 작업시간과 결과평가 조사

순수 완료시간 기준으로는 GPT-5.6 Terra medium이 네 작업 모두 가장 빨랐고, GPT-5.6 Luna medium이 근소한 차이로 뒤를 이었습니다.

  • 최고 속도: Terra medium — 평균 시간지수 69
  • 속도·추론 균형: Terra high — 평균 시간지수 77, AAII 49
  • 품질 중심 기준점: Sol medium — 시간지수 100, AAII 54
  • 최고 종합점수: Sol xhigh — AAII 58이지만 평균 4.18배 느림
  • DeepSeek: 공식 API의 xhigh는 별도 단계가 아니라 max로 매핑되므로 두 행의 결과가 같습니다.

중요하게도 아래 작업시간은 각 모델 API를 직접 실행한 스톱워치 결과가 아닙니다. 공개된 첫 답변 토큰 시간과 출력 처리량 실측값을 동일한 작업 프로파일에 적용한 재현 가능한 산정값입니다. Artificial Analysis 측정은 10,000 입력 토큰, 최근 72시간의 P50이며, 첫 답변 토큰 시간에는 모델의 내부 추론 대기시간이 포함됩니다.


작업 완료시간 비교

각 작업 셀은 **예상 시간(초) / 시간지수**입니다.

  • 시간지수는 GPT-5.6 Sol medium = 100
  • 낮을수록 빠름
  • 평균지수는 네 작업 시간지수의 단순 평균
모델·effort AAII 첫 답변 토큰 출력 tok/s 일상 질문 엔지니어링 검색 n8n 검증 코딩 평균지수
DeepSeek V4 Flash high 37 12.96초 106.5 17.7 / 162 100.6 / 137 65.0 / 145 133.3 / 134 145
DeepSeek V4 Flash max 40 47.58초 121.2 51.7 / 475 236.8 / 322 167.1 / 374 303.5 / 305 369
DeepSeek V4 Flash xhigh¹ 40 47.58초 121.2 51.7 / 475 236.8 / 322 167.1 / 374 303.5 / 305 369
GPT-5.6 Luna medium 38 3.40초 166.8 6.4 / 59 55.6 / 76 31.2 / 70 77.0 / 77 70
GPT-5.6 Luna xhigh 49 40.36초 167.6 43.3 / 398 203.4 / 277 142.0 / 318 261.7 / 263 314
GPT-5.6 Luna max 51 139.79초 198.5 142.3 / 1,307 599.2 / 815 438.9 / 983 756.5 / 761 966
GPT-5.6 Terra medium 46 1.92초 117.1 6.2 / 57 54.8 / 74 30.6 / 68 75.9 / 76 69
GPT-5.6 Terra high 49 3.30초 122.4 7.4 / 68 59.5 / 81 34.2 / 76 81.9 / 82 77
GPT-5.6 Terra xhigh 52 21.66초 120.3 25.8 / 237 133.3 / 181 89.4 / 200 174.1 / 175 198
GPT-5.6 Sol medium 54 4.13초 74.0 10.9 / 100 73.5 / 100 44.7 / 100 99.4 / 100 100
GPT-5.6 Sol xhigh 58 51.95초 69.8 59.1 / 543 266.5 / 362 189.3 / 424 340.6 / 343 418

¹ DeepSeek 공식 API는 highmax만 구분하며, xhigh 요청은 max로 매핑합니다.

DeepSeek의 속도·지연은 자사 API 기준으로 high가 106.5 tok/s·12.96초, max가 121.2 tok/s·47.58초입니다. Luna는 medium 166.8 tok/s·3.40초, xhigh 167.6 tok/s·40.36초, max 198.5 tok/s·139.79초로 측정됐습니다.

Terra는 medium 117.1 tok/s·1.92초, high 122.4 tok/s·3.30초, xhigh 120.3 tok/s·21.66초입니다. Sol은 medium 74.0 tok/s·4.13초, xhigh 69.8 tok/s·51.95초입니다.

AAII 점수는 DeepSeek high/max 37/40, Luna medium/xhigh/max 38/49/51, Terra medium/high/xhigh 46/49/52, Sol medium/xhigh 54/58입니다. AAII는 코딩만의 점수가 아니라 Terminal-Bench, SciCode, 과학·지식·장문 추론 등을 포함한 종합지수입니다.

작업시간 산정 조건

작업 모델 호출 횟수 총 답변 토큰 공통 도구·실행시간 가정한 작업
일상 질문 1회 500 0초 일반 설명·비교·질의응답
엔지니어링 검색 4회 2,000 30초 검색 계획, 자료 조회, 교차검증, 최종 정리
n8n workflow 검증 3회 1,500 12초 JSON 분석, 노드 연결·표현식 점검, 결과 정리
코딩 5회 2,500 45초 분석, 구현, 명령 실행, 테스트, 최종 검토

계산식은 다음과 같습니다.

[
T_{\text{task}}

T_{\text{공통 도구}}
+
N_{\text{호출}}\times T_{\text{첫 답변}}
+
\frac{\text{총 답변 토큰}}{\text{출력 tok/s}}
]

공통 도구시간은 모델과 무관하게 동일하게 적용했습니다. 따라서 실제 웹사이트 응답, npm 설치, Docker 빌드, 테스트 스위트 실행시간이 길어질수록 모델 간 상대 차이는 축소됩니다.


레이더 차트

레이더 차트는 표의 시간지수를 역수로 바꾼 완료속도 점수입니다.

  • Sol medium = 100
  • 높을수록 빠름
  • 150은 Sol medium보다 약 1.5배 빠르다는 의미
  • 50은 약 절반 속도라는 의미
  • 11개 선의 중첩을 피하기 위해 제품군별로 분리했습니다.

사용 사례별 판단

사용 사례 기본 권장 품질 우선 대안 판단
일상적인 질문 Terra medium Sol medium Terra medium이 약 43% 짧은 시간에 완료
엔지니어링 검색 Terra high Sol medium Terra high는 19% 빠르면서 AAII 49; 근거 정확도가 특히 중요하면 Sol medium
n8n workflow 검증 Terra high Sol medium medium보다 소폭 느리지만 복잡한 분기·표현식 검증에 더 합리적인 effort
일반 코딩 Terra high Sol medium 반복 개발에는 Terra high, 설계·원인분석·대규모 리팩터링에는 Sol medium
고난도 코드·안전 중요 검증 Sol xhigh Terra xhigh 지연을 허용하고 실패 비용이 매우 큰 경우에만 적합
저비용 오픈웨이트 처리 DeepSeek high DeepSeek max 시간 자체는 Terra/Luna보다 불리하지만 자체 호스팅·비용 측면에서 의미 있음


핵심 트레이드오프

Terra medium → high는 평균 시간지수가 69에서 77로 약 12% 증가하지만 AAII가 46에서 49로 올라갑니다. n8n과 일반 코딩에서는 가장 현실적인 균형입니다.

Sol medium → xhigh는 AAII가 54에서 58로 4점 상승하지만 평균 완료시간은 약 4.18배가 됩니다. 따라서 xhigh를 모든 코딩 요청의 기본값으로 쓰기보다는 어려운 버그, 아키텍처 결정, 최종 검증 단계에 한정하는 편이 적절합니다.

Luna medium → xhigh는 AAII가 38에서 49로 크게 상승하지만 평균 완료시간은 약 4.5배가 됩니다. Luna medium의 핵심 장점인 낮은 지연을 사실상 잃습니다.

Luna max는 출력 자체는 가장 빠르지만 답변 전 추론 대기가 약 140초여서, 반복적인 코딩·검색·workflow 검증에는 적합하지 않습니다.

DeepSeek max와 xhigh는 동일 설정이며, 공식 DeepSeek API에서는 Sol medium보다 평균 약 3.69배 느리게 산정됩니다. 다만 호스팅 제공자의 영향이 큽니다. 독립 측정에서 DeepSeek max의 Makora 경로는 첫 답변 24.86초·232 tok/s였고, DeepSeek 자사 API는 47.58초·121.2 tok/s였습니다. OpenRouter 같은 다중 공급자 라우터에서는 표보다 상당히 빨라질 수 있습니다.


권장 기본 라우팅

사용 패턴을 기준으로 한 실용적인 라우팅은 다음과 같습니다.

  • 기본 일상 질문: Terra medium
  • n8n·일반 코딩·엔지니어링 조사: Terra high
  • 중요 설계·복합 디버깅·근거 검증: Sol medium
  • 최종 안전검증·고난도 실패 분석: Sol xhigh
  • 대량 저비용 백그라운드 처리: DeepSeek high
  • Luna medium: 단순·대량·짧은 생성에서 Terra medium의 대안

OpenAI는 GPT-5.6에서 medium을 균형 출발점, high/xhigh를 측정된 품질 개선이 있을 때, max를 가장 어려운 품질 우선 작업에 사용하도록 안내합니다. 또한 다중 턴 코딩에서는 persisted reasoning을 재사용할 수 있어 실제 OpenAI 작업시간이 본 표보다 짧아질 가능성이 있습니다.

마지막으로, 요청하신 DeepSeek V4 Flash 0731이라는 별도 공개 스냅샷은 공식 문서와 독립 측정 페이지에서 검증하지 못했습니다. 따라서 이번 비교는 현재 공개된 DeepSeek V4 Flash high/max 실측값을 사용했습니다. 0731이 특정 라우터의 내부 버전명이라면 해당 공급자의 실행 로그가 있어야 정확히 분리할 수 있습니다.


댓글 쓰기 · 수정

0 댓글