관련링크
본문

※ 본 정보는 외부 공개 자료를 바탕으로 작성되었습니다. 기관 사정 등에 따라 변경 내용이 존재할 수 있습니다.
Artificial Analysis가 Intelligence Index 를 4.2 버전으로 업데이트하며, AI 모델 순위 산정 방식을 일부 변경했다. 특징은 개인 테스트 항목의 비중을 기존 20%에서 40%로 늘린 점이며, 이는 모델 개발자들이 사전에 테스트 세트에 접근하여 최적화하는 것을 방지하고 평가의 객관성을 높이기 위한 조치로 풀이된다.
새로운 버전에서는 AA-Briefcase 와 GDP.pdf 라는 두 가지 테스트 모듈이 추가되었는데, AA-Briefcase는 실제 업무와 유사하게 장기간에 걸쳐 관련 작업과 수많은 문서를 처리하는 능력을 평가하고, GDP.pdf는 100개의 전문 PDF 문서(총 4,592페이지)에서 정보를 찾아 질문에 답하는 능력을 측정한다. 기존의 GPQA Diamond 벤치마크는 제거되었는데, 이는 최상위 모델 간의 성능 차이가 거의 없어 변별력이 떨어졌기 때문으로 분석되며, 재산정 결과 Claude Fable 5.1이 1위를 유지했고 GPT-6 Astra가 그 뒤를 이었다.
이번 Artificial Analysis 의 Intelligence Index 업데이트는 AI 모델들의 실제 활용 능력에 초점을 맞추고 있다는 점이 눈에 띈다. 기존에 모델 개발자들이 특정 테스트에 맞춰 성능을 과도하게 최적화하는 경우를 줄이기 위해, 이번 업데이트에서는 개인 테스트의 비중을 2배로 늘렸으며, 이는 더욱 공정하고 현실적인 평가를 가능하게 할 것으로 기대된다.
◆Artificial Analysis, AI 모델 평가 방식 40% 개인 테스트 비중으로 개편… 투명성 강화 (+AI평가, 인공지능, 벤치마크, 모델성능)
|
|
|
|
|
|
|
댓글목록
등록된 댓글이 없습니다.


