REAL WORK · RELATIVE PRODUCTIVITY

벤치마크는 안 합니다.
일을 시킵니다.

게임 개발자가 실제 프로젝트 태스크를 서로 다른 AI 모델에 맡기고, 정답을 만든 모델만 완료에 필요한 사람의 시간으로 비교합니다.

THE BASELINE
GLM1.00
GLM Index

GLM이 같은 작업에 사용한 사람의 시간을 1.00으로 둡니다.

GLM time ÷ Model time
GLM MAP

비용과 생산성을 한 화면에

GLM이 사분면의 중심입니다. 왼쪽일수록 저렴하고, 위쪽일수록 같은 일을 더 적은 사람 시간으로 끝냅니다.

Baseline Evaluated Demo data
Cost ratio × GLM Index GLM = (1.00, 1.00)
좌상단이 가장 매력적인 영역입니다. 비용은 GLM Index 점수에 합산하지 않습니다.
MODEL TABLE

GLM Index

높을수록 좋습니다. 결과가 틀리면 점수를 주지 않고 FAIL로 분리합니다.

ModelProviderGLM IndexCost RatioHuman TimeTasksStatus
REAL GAME DEV TASKS

시험문제가 아니라 실제 작업

코딩·버그 수정·리팩터링·에이전트 수행 등 실제 게임 제작 과정에서 나온 일을 평가 세트로 사용합니다.

METHODOLOGY

정답 아니면 탈락.
정답이면 시간만 봅니다.

01

동일한 실제 태스크

같은 요구사항과 같은 프로젝트 컨텍스트를 각 모델에 제공합니다.

02

Pass / Fail gate

실제로 사용할 수 있는 결과를 만들지 못하면 생산성 점수를 계산하지 않습니다.

03

사람의 시간을 측정

지시, 검토, 오류 확인, 재지시, 수정 확인 등 개발자가 직접 소비한 시간을 기록합니다.

04

GLM Index 계산

Σ GLM human time ÷ Σ model human time. GLM은 항상 1.00입니다.

NO BENCH MANIFESTO
“모델이 문제를 얼마나 잘 푸는지는 다른 곳에서 보세요.
여기서는 일을 얼마나 빨리 끝내는지만 봅니다.”

NoBench Analysis는 절대적인 AI 지능 순위를 주장하지 않습니다. 한 게임 개발자의 실제 작업 환경에서 발생하는 상대적 생산성을 기록합니다.