벤치마크

코딩 에이전트 벤치마크 코퍼스 설계

8개 워크로드 클래스로 층화된 e2e 태스크 코퍼스와 SWE-bench Verified 부분집합(50 인스턴스), 컨텍스트 유지 A/B 하네스의 설계 문서. anti-guess 설계와 채점기 검증 규율을 포함합니다.

핵심 수치

018 classes

e2e 태스크 코퍼스 워크로드 클래스

사내 벤치마크 스위트 기준 분류

0250 instances

SWE-bench Verified 부분집합

전체 집합이 아닌 선별 부분집합 — 전체 리더보다 좁은 커버리지

리포트 본문

공개 벤치마크는 두 가지로 불충분합니다. 오염(학습 데이터 유출)과 대표성 부족입니다. 코딩 에이전트의 실제 실패는 "알고리즘을 못 짜서"가 아니라 컨텍스트 관리 실패, 도구 오용, 부분 완료 처리에서 일어나는데, 기존 벤치마크는 이를 거의 잡아내지 못합니다.

우리의 코퍼스는 8개 워크로드 클래스로 층화되어 있습니다: 신규 기능 구현, 버그 수정, 리팩토링, 테스트 작성, 마이그레이션, 문서 동기화, 디버깅, 코드 리뷰 반영. 각 클래스별로 난이도 분포를 유지해, 한 클래스의 개선이 전체 점수를 왜곡하지 않게 합니다.

anti-guess 설계가 원칙입니다. 정답이 문맥 추측만으로 맞히지 못하도록 문항을 설계하고, 채점기는 seed 입력에서 반드시 실패하고 reference 입력에서 반드시 성공해야 검증됩니다(fail-on-seed / pass-on-reference).

컨텍스트 유지 A/B 하네스는 세션 길이에 따른 성능 저하 곡선을 측정합니다. 장기 세션에서 컨텍스트를 유지하는 능력이 에이전트 품질의 결정적 차이이기 때문입니다.

한계: SWE-bench Verified는 50개 인스턴스의 선별 부분집합만 사용하며, 이는 전체 리더보드와 직접 비교 가능한 숫자가 아닙니다. 코퍼스 전체의 문항 수와 클래스별 분포는 후속 리포트에서 공개할 예정입니다.

04

측정 조건과 한계

  • e2e 태스크 코퍼스 워크로드 클래스

    사내 벤치마크 스위트 기준 분류

  • SWE-bench Verified 부분집합

    전체 집합이 아닌 선별 부분집합 — 전체 리더보다 좁은 커버리지

코딩 에이전트 벤치마크 코퍼스 설계 | Patty