동일한 실제 태스크
같은 요구사항과 같은 프로젝트 컨텍스트를 각 모델에 제공합니다.
게임 개발자가 실제 프로젝트 태스크를 서로 다른 AI 모델에 맡기고, 정답을 만든 모델만 완료에 필요한 사람의 시간으로 비교합니다.
GLM이 같은 작업에 사용한 사람의 시간을 1.00으로 둡니다.
GLM이 사분면의 중심입니다. 왼쪽일수록 저렴하고, 위쪽일수록 같은 일을 더 적은 사람 시간으로 끝냅니다.
높을수록 좋습니다. 결과가 틀리면 점수를 주지 않고 FAIL로 분리합니다.
| Model | Provider | GLM Index | Cost Ratio | Human Time | Tasks | Status |
|---|
코딩·버그 수정·리팩터링·에이전트 수행 등 실제 게임 제작 과정에서 나온 일을 평가 세트로 사용합니다.
같은 요구사항과 같은 프로젝트 컨텍스트를 각 모델에 제공합니다.
실제로 사용할 수 있는 결과를 만들지 못하면 생산성 점수를 계산하지 않습니다.
지시, 검토, 오류 확인, 재지시, 수정 확인 등 개발자가 직접 소비한 시간을 기록합니다.
Σ GLM human time ÷ Σ model human time. GLM은 항상 1.00입니다.
“모델이 문제를 얼마나 잘 푸는지는 다른 곳에서 보세요.
여기서는 일을 얼마나 빨리 끝내는지만 봅니다.”
NoBench Analysis는 절대적인 AI 지능 순위를 주장하지 않습니다. 한 게임 개발자의 실제 작업 환경에서 발생하는 상대적 생산성을 기록합니다.