오픈AI의 AI 모델 평가는 단일 벤치마크 점수만으로 평가하는 데 한계가 있다는 지적이 나왔습니다. 최신 AI 모델 성능은 토큰 수, 비용, 시간에 따라 달라지므로 추론 자원을 평가 기준에 반영해야 한다는 주장입니다. 이는 각국 정부와 기업이 AI 평가 시 이러한 자원 요소를 고려해야 함을 시사합니다.