본문으로 건너뛰기
AXyNowAX IS NOW

AXyBench · 한국 AI 비즈니스 실무 벤치마크

KOREA · BUSINESS · LLM

종합 점수
전체 평균90.6Claude Opus 4.8· Anthropic
  1. 90.6
    Claude Opus 4.8
  2. 89.9
    GPT-5.5
  3. 87.7
    Gemini 3.1 Pro
  4. 86.6
    Grok 4.5
  5. 86.5
    Claude Sonnet 4.6
  6. 85.6
    Gemini 3.5 Flash
  7. 80.0
    GPT-5.4 Mini
  8. 79.7
    Gemma 4 12B
  9. 79.6
    Qwen 3.7 Max
  10. 79.6
    DeepSeek V4 Pro
  11. 78.9
    MiniMax M3
  12. 78.8
    Gemma 4 31B
  13. 78.7
    GLM 5.2
  14. 78.5
    Gemma 4 26B A4B
  15. 77.9
    Gemini 3.1 Flash Lite
  16. 75.6
    Qwen 3.7 Plus
  17. 75.0
    Tencent Hy3 Preview
  18. 74.9
    Mimo V2.5 Pro
  19. 74.5
    Grok 4.3
  20. 73.4
    DeepSeek V4 Flash
  21. 72.3
    GLM 5.1
  22. 72.2
    Nemotron 3 Ultra 550B
  23. 71.8
    Step 3.7 Flash
  24. 71.3
    Kimi K2.6
  25. 67.8
    Qwen 3.6 27B
  26. 61.7
    EXAONE 4.5 33B
  27. 61.4
    Solar Pro 3
  28. 58.7
    Qwen 3.6 35B A3B
  29. 58.6
    HyperCLOVAX SEED Think 32B
  30. 58.5
    Qwen 3.5 9B
  31. 50.5
    Mistral Small 4
  32. 46.2
    Kanana 2 30B-A3B Thinking
  33. 44.9
    Gemma 4 E2B
  34. 32.2
    HyperCLOVAX SEED 1.5B
  35. 31.0
    LFM2.5 8B-A1B
한국 직무·도메인 · 100점 · 문항당 1회35 / 35 측정

대한민국 비즈니스 AX Benchmark

한국 비즈니스 실무(세무·법무·마케팅·인사·코드·문서·도면 등 총 13개의 과제)에 누가 가장 쓸만한지 측정합니다.

대상 35 모델 · 13 과제·현재 공개 12/13 카테고리·5개 항목 × 100점·측정 방식 →
By Domain

영역별 종합

개인 의사결정 · 사업 운영 · 기술 출력

영역 평균
개인 의사결정91.1GPT-5.5· OpenAI
  1. 91.1
    GPT-5.5
  2. 89.4
    Claude Opus 4.8
  3. 87.7
    Gemini 3.1 Pro
  4. 87.3
    Gemini 3.5 Flash
  5. 85.5
    Claude Sonnet 4.6
  6. 80.5
    DeepSeek V4 Pro
  7. 80.2
    Grok 4.5
  8. 80.0
    GPT-5.4 Mini
  9. 79.5
    Qwen 3.7 Max
  10. 79.1
    Gemma 4 31B
  11. 78.5
    Gemma 4 12B
  12. 76.6
    Gemma 4 26B A4B
  13. 76.5
    Gemini 3.1 Flash Lite
  14. 73.6
    Qwen 3.7 Plus
  15. 73.2
    MiniMax M3
  16. 71.4
    Tencent Hy3 Preview
  17. 71.2
    Grok 4.3
  18. 68.4
    Nemotron 3 Ultra 550B
  19. 68.2
    Mimo V2.5 Pro
  20. 68.0
    DeepSeek V4 Flash
  21. 67.4
    GLM 5.1
  22. 67.0
    Kimi K2.6
  23. 66.8
    Step 3.7 Flash
  24. 64.8
    Qwen 3.6 27B
  25. 59.7
    Solar Pro 3
  26. 56.8
    EXAONE 4.5 33B
  27. 53.8
    HyperCLOVAX SEED Think 32B
  28. 52.6
    Qwen 3.5 9B
  29. 46.2
    Qwen 3.6 35B A3B
  30. 43.0
    Kanana 2 30B-A3B Thinking
  31. 40.6
    Gemma 4 E2B
  32. 39.8
    Mistral Small 4
  33. 32.2
    HyperCLOVAX SEED 1.5B
  34. 27.9
    LFM2.5 8B-A1B
한국 직무·도메인 · 100점 · 문항당 1회34 / 35 측정
영역 평균
사업 운영90.3Grok 4.5· xAI
  1. 90.3
    Grok 4.5
  2. 89.5
    Claude Opus 4.8
  3. 89.4
    GPT-5.5
  4. 87.4
    Claude Sonnet 4.6
  5. 87.2
    Gemini 3.1 Pro
  6. 84.9
    Gemini 3.5 Flash
  7. 81.4
    Gemma 4 12B
  8. 81.2
    Gemma 4 26B A4B
  9. 81.1
    GPT-5.4 Mini
  10. 80.5
    MiniMax M3
  11. 80.2
    Qwen 3.7 Max
  12. 79.9
    Mimo V2.5 Pro
  13. 79.8
    DeepSeek V4 Pro
  14. 79.8
    Gemma 4 31B
  15. 79.3
    Gemini 3.1 Flash Lite
  16. 78.7
    GLM 5.2
  17. 78.2
    DeepSeek V4 Flash
  18. 77.9
    Grok 4.3
  19. 77.4
    Tencent Hy3 Preview
  20. 74.8
    Qwen 3.7 Plus
  21. 74.3
    GLM 5.1
  22. 74.3
    Step 3.7 Flash
  23. 73.2
    Kimi K2.6
  24. 71.9
    Nemotron 3 Ultra 550B
  25. 66.3
    Qwen 3.6 27B
  26. 65.5
    Qwen 3.6 35B A3B
  27. 65.2
    EXAONE 4.5 33B
  28. 64.7
    HyperCLOVAX SEED Think 32B
  29. 59.7
    Qwen 3.5 9B
  30. 59.3
    Solar Pro 3
  31. 51.3
    Mistral Small 4
  32. 48.0
    Gemma 4 E2B
  33. 46.5
    Kanana 2 30B-A3B Thinking
  34. 31.0
    HyperCLOVAX SEED 1.5B
  35. 30.5
    LFM2.5 8B-A1B
한국 직무·도메인 · 100점 · 문항당 1회35 / 35 측정
영역 평균
기술 출력96.0Claude Opus 4.8· Anthropic
  1. 96.0
    Claude Opus 4.8
  2. 95.2
    Grok 4.5
  3. 90.0
    MiniMax M3
  4. 89.0
    Gemini 3.1 Pro
  5. 87.6
    GPT-5.5
  6. 87.5
    Claude Sonnet 4.6
  7. 82.6
    Gemini 3.5 Flash
  8. 82.3
    Nemotron 3 Ultra 550B
  9. 82.2
    Qwen 3.7 Plus
  10. 81.7
    Mimo V2.5 Pro
  11. 80.7
    GLM 5.1
  12. 79.5
    Gemma 4 12B
  13. 79.2
    Step 3.7 Flash
  14. 78.9
    Qwen 3.7 Max
  15. 78.8
    Tencent Hy3 Preview
  16. 78.6
    Gemini 3.1 Flash Lite
  17. 78.2
    Qwen 3.6 27B
  18. 78.1
    Kimi K2.6
  19. 77.7
    GPT-5.4 Mini
  20. 77.7
    Gemma 4 26B A4B
  21. 77.6
    DeepSeek V4 Flash
  22. 76.9
    DeepSeek V4 Pro
  23. 76.4
    Qwen 3.6 35B A3B
  24. 76.4
    Gemma 4 31B
  25. 76.0
    Grok 4.3
  26. 75.8
    Mistral Small 4
  27. 70.8
    Qwen 3.5 9B
  28. 69.9
    Solar Pro 3
  29. 67.0
    EXAONE 4.5 33B
  30. 58.5
    HyperCLOVAX SEED Think 32B
  31. 53.5
    Kanana 2 30B-A3B Thinking
  32. 49.4
    Gemma 4 E2B
  33. 39.4
    LFM2.5 8B-A1B
  34. 34.8
    HyperCLOVAX SEED 1.5B
한국 직무·도메인 · 100점 · 문항당 1회34 / 35 측정
By Model

모델별 종합 점수

카드 클릭 → 모델별 13 카테고리 상세 점수

By Value

어디서 갈리는가 — 가성비

종합 점수는 가운데로 뭉쳐도, 같은 답을 받는 비용은 100배 넘게 벌어진다

24283236404448525660646872768084889296$0.001$0.003$0.01$0.03$0.10쿼리당 비용 (USD, 로그)한국 직무 점수가성비 프런티어Gemini 3.1 Flash Lite · 77.9점 · $0.0017/쿼리 · 114 tok/s · 파라미터 비공개Gemini 3.5 Flash · 85.6점 · $0.016/쿼리 · 98 tok/s · 파라미터 비공개Gemini 3.1 Pro · 87.7점 · $0.018/쿼리 · 41 tok/s · 파라미터 1T+ 추정Claude Sonnet 4.6 · 86.5점 · $0.110/쿼리 · 64 tok/s · 파라미터 비공개Claude Opus 4.8 · 90.6점 · $0.076/쿼리 · 68 tok/s · 파라미터 1T+ 추정GPT-5.4 Mini · 80점 · $0.030/쿼리 · 138 tok/s · 파라미터 비공개GPT-5.5 · 89.9점 · $0.163/쿼리 · 53 tok/s · 파라미터 1T+ 추정DeepSeek V4 Flash · 73.4점 · $0.0010/쿼리 · 77 tok/s · 파라미터 비공개DeepSeek V4 Pro · 79.6점 · $0.0050/쿼리 · 40 tok/s · 파라미터 ≈671B 추정Kimi K2.6 · 71.3점 · $0.030/쿼리 · 40 tok/s · 파라미터 1T+ 추정GLM 5.1 · 72.3점 · $0.021/쿼리 · 42 tok/s · 파라미터 ≈355B 추정GLM 5.2 · 78.7점 · $0.017/쿼리 · 48 tok/s · 파라미터 ≈744B 추정Mimo V2.5 Pro · 74.9점 · $0.0085/쿼리 · 44 tok/s · 파라미터 비공개Grok 4.3 · 74.5점 · $0.0059/쿼리 · 109 tok/s · 파라미터 1T+ 추정MiniMax M3 · 78.9점 · $0.0026/쿼리 · 26 tok/s · 파라미터 ≈456B 추정Tencent Hy3 Preview · 75점 · $0.0006/쿼리 · 76 tok/s · 파라미터 비공개Step 3.7 Flash · 71.8점 · $0.0028/쿼리 · 120 tok/s · 파라미터 비공개Nemotron 3 Ultra 550B · 72.2점 · $0.0098/쿼리 · 16 tok/s · 파라미터 550BNQwen 3.6 35B A3B · 58.7점 · $0.0052/쿼리 · 86 tok/s · 파라미터 35BQwen 3.7 Max · 79.6점 · $0.035/쿼리 · 61 tok/s · 파라미터 1T+ 추정Qwen 3.7 Plus · 75.6점 · $0.0062/쿼리 · 53 tok/s · 파라미터 비공개Qwen 3.6 27B · 67.8점 · $0 · 74 tok/s · 파라미터 27BGemma 4 26B A4B · 78.5점 · $0.0009/쿼리 · 81 tok/s · 파라미터 26BGemma 4 31B · 78.8점 · $0.0009/쿼리 · 14 tok/s · 파라미터 31BMistral Small 4 · 50.5점 · $0.0030/쿼리 · 130 tok/s · 파라미터 ≈24B 추정EXAONE 4.5 33B · 61.7점 · $0 · 49 tok/s · 파라미터 33BKanana 2 30B-A3B Thinking · 46.2점 · $0 · 44 tok/s · 파라미터 30BHyperCLOVAX SEED Think 32B · 58.6점 · $0 · 24 tok/s · 파라미터 32BSolar Pro 3 · 61.4점 · $0.0022/쿼리 · 79 tok/s · 파라미터 ≈31B 추정LFM2.5 8B-A1B · 31점 · $0 · 59 tok/s · 파라미터 8BHyperCLOVAX SEED 1.5B · 32.2점 · $0 · 22 tok/s · 파라미터 1.5BGemma 4 E2B · 44.9점 · $0 · 24 tok/s · 파라미터 2BGemini 3.1 Flash LiteGemini 3.5 FlashGemini 3.1 ProClaude Sonnet 4.6Claude Opus 4.8GPT-5.4 MiniGPT-5.5DeepSeek V4 FlashDeepSeek V4 ProKimi K2.6GLM 5.1GLM 5.2Mimo V2.5 ProGrok 4.3MiniMax M3Tencent Hy3 PreviewStep 3.7 FlashNNemotron 3 Ultra 550BQwen 3.6 35B A3BQwen 3.7 MaxQwen 3.7 PlusQwen 3.6 27BGemma 4 26B A4BGemma 4 31BMistral Small 4EXAONE 4.5 33BKanana 2 30B-A3B ThinkingHyperCLOVAX SEED Think 32BSolar Pro 3LFM2.5 8B-A1BHyperCLOVAX SEED 1.5BGemma 4 E2B

점선 = 가성비 프런티어. 같은 비용에 더 좋은 선택지가 없는 모델들을 이은 선으로, 이 선 위(좌상단 방향)일수록 가성비 우위. 점 위에 올리면 점수·비용·속도. 비용·속도는 정보 표시값이지 채점 축이 아닙니다. 속도 = 초당 출력 토큰(완성 토큰 ÷ 벽시계, 추론 토큰 포함). 측정 시점 서버·라우팅 노이즈가 있어 방향성만 참고.

가격대비 성능: 모델별 한국 직무 점수 · 쿼리당 비용 · 초당 출력 토큰 · 총 파라미터
모델한국 직무 점수쿼리당 비용초당 출력 토큰총 파라미터
Claude Opus 4.890.6점$0.076/쿼리68 tok/s1T+ 추정
GPT-5.589.9점$0.163/쿼리53 tok/s1T+ 추정
Gemini 3.1 Pro87.7점$0.018/쿼리41 tok/s1T+ 추정
Claude Sonnet 4.686.5점$0.110/쿼리64 tok/s비공개
Gemini 3.5 Flash85.6점$0.016/쿼리98 tok/s비공개
GPT-5.4 Mini80.0점$0.030/쿼리138 tok/s비공개
DeepSeek V4 Pro79.6점$0.0050/쿼리40 tok/s≈671B 추정
Qwen 3.7 Max79.6점$0.035/쿼리61 tok/s1T+ 추정
MiniMax M378.9점$0.0026/쿼리26 tok/s≈456B 추정
Gemma 4 31B78.8점$0.0009/쿼리14 tok/s31B
GLM 5.278.7점$0.017/쿼리48 tok/s≈744B 추정
Gemma 4 26B A4B78.5점$0.0009/쿼리81 tok/s26B
Gemini 3.1 Flash Lite77.9점$0.0017/쿼리114 tok/s비공개
Qwen 3.7 Plus75.6점$0.0062/쿼리53 tok/s비공개
Tencent Hy3 Preview75.0점$0.0006/쿼리76 tok/s비공개
Mimo V2.5 Pro74.9점$0.0085/쿼리44 tok/s비공개
Grok 4.374.5점$0.0059/쿼리109 tok/s1T+ 추정
DeepSeek V4 Flash73.4점$0.0010/쿼리77 tok/s비공개
GLM 5.172.3점$0.021/쿼리42 tok/s≈355B 추정
Nemotron 3 Ultra 550B72.2점$0.0098/쿼리16 tok/s550B
Step 3.7 Flash71.8점$0.0028/쿼리120 tok/s비공개
Kimi K2.671.3점$0.030/쿼리40 tok/s1T+ 추정
Qwen 3.6 27B67.8점$074 tok/s27B
EXAONE 4.5 33B61.7점$049 tok/s33B
Solar Pro 361.4점$0.0022/쿼리79 tok/s≈31B 추정
Qwen 3.6 35B A3B58.7점$0.0052/쿼리86 tok/s35B
HyperCLOVAX SEED Think 32B58.6점$024 tok/s32B
Mistral Small 450.5점$0.0030/쿼리130 tok/s≈24B 추정
Kanana 2 30B-A3B Thinking46.2점$044 tok/s30B
Gemma 4 E2B44.9점$024 tok/s2B
HyperCLOVAX SEED 1.5B32.2점$022 tok/s1.5B
LFM2.5 8B-A1B31.0점$059 tok/s8B
By Category

카테고리별 모델 순위

카드 클릭 → 카테고리별 전체 모델 상세 점수