관련링크
본문

※ 본 정보는 외부 공개 자료를 바탕으로 작성되었습니다. 기관 사정 등에 따라 변경 내용이 존재할 수 있습니다.
(서울=호수뉴스) Terminal-Bench 4.0 이 출시되며 AI 모델 성능 평가에 새로운 기준을 제시했고, 이는 최신 AI 모델 들의 경쟁 구도를 변화시키고 다. 이번 업데이트는 시간, CPU, 메모리 파라미터 재조정과 더불어 19개의 태스크를 수정하고 8개의 문제 태스크를 제거하면서 AI 성능 을 더욱 정교하게 측정할 수 있게 되었으며, 모든 태스크의 최대 실행 시간을 8시간으로 통일하여 환경적 요인으로 인한 점수 왜곡을 줄였다.
최신 순위에서 GLM-5.3 모델이 Claude Code 와의 조합으로 41.8%의 점수를 기록하며 3위를 차지했고, 이는 이전 버전에서 4위였던 순위에서 한 단계 상승한 결과이며, 특히 Anthropic이 개발하지 않은 모델로는 유일하게 상위권에 진입했다. GLM-5.3 은 이전 Terminal-Bench 3.0 에서 GPT-5.6 Sol 모델보다.
낮은 순위를 기록했으나, 이번 4.0 버전에서는 4.5%p 앞서며 역전에 성공했고, 이러한 변화는 AI 모델 들의 기술 발전 속도와 경쟁 양상을 보여준다. Terminal-Bench 4.0 버전은 AI 모델의 에이전트 작업 수행 능력을 평가하기 위해 시간, CPU, 메모리 관련 파라미터들을 세밀하게 조정했고, 이 과정에서 19개의 태스크를 성공적으로 수정하며 8개의 문제가 있었던 태스크들을 목록에서 제외했다.
◆GLM-5.3, GPT-5.6 넘어 3위 등극… AI 모델 성능 경쟁 격화 (+Terminal-Bench 4.0, GLM-5.3, GPT-5.6, AI모델)
|
|
|
|
|
|
댓글목록
등록된 댓글이 없습니다.





