관련링크
본문

※ 본 정보는 외부 공개 자료를 바탕으로 작성되었습니다. 기관 사정 등에 따라 변경 내용이 존재할 수 있습니다.
룩온체인에 따르면, Y Combinator(YC)의 투자를 받은 Specific Labs가 Real-SWE라는 새로운 코딩 평가 벤치마크를 선보였고, 이는 실제 기업의 비공개 코드를 대상으로 AI 코딩 에이전트의 능력을 측정하는 도구로서 그 의미를 가진다. 이 벤치마크에 사용된 작업들은 실제 생산 환경에서 도출된 것으로, 세금 계산, 청구서 마이그레이션, API 요금 책정, 고객 데이터 이전 등 다양한 실제 업무를 포함하고 있다.
코드와 정답이 모두 비공개 상태에서 진행되기에 AI 에이전트는 해당 기업의 비즈니스 규칙과 코드 구조를 스스로 파악해야만 하는데, 이러한 테스트는 AI의 실제 현업 적용 가능성을 가늠하는 데 중요한 지표로 작용한다. 이번 테스트 결과, Fable 5.1 모델이 38.8%의 합격률로 가장 높은 성과를 기록했으며, GPT-6 Astra가 33.8%, Gemini 3.8 Flash가 31.2%로 뒤를 이었다는 점은 주목할 만하다.
가장 높은 성과를 보인 Fable 5.1 모델조차 40%를 넘지 못하는 합격률을 기록했다는 사실은, 현재 AI 에이전트가 실제 기업 환경의 복잡하고 다양한 코딩 업무를 완전히 대체하기에는 아직 상당한 격차가 있음을 시사한다. 특히 공개된 10개의 작업 중 6개는 15% 미만의 낮은 합격률을 보였으며, 한 작업에서는 모든 AI 모델이 실패하는 결과를 나타내기도 하여 AI 코딩 에이전트의 전반적인 성능 개선이 시급함을 보여준다.
◆AI 코딩 요원, 기업 비공개 코드 접근… 최대 합격률 40% 달해 (+AI 에이전트, 코딩 평가, 기업 코드, 성능 분석)
|
|
|
|
|
|
댓글목록
등록된 댓글이 없습니다.





