벤치마크

코딩 에이전트 벤치마크 코퍼스 설계

8개 워크로드 클래스로 층화된 e2e 태스크 코퍼스와 SWE-bench Verified 부분집합(50 인스턴스), 컨텍스트 유지 A/B 하네스의 설계 문서. anti-guess 설계와 채점기 검증 규율을 포함합니다.

핵심 수치

018 classes

e2e 태스크 코퍼스 워크로드 클래스

사내 벤치마크 스위트 기준 분류

0250 instances

SWE-bench Verified 부분집합

전체 집합이 아닌 선별 부분집합 — 전체 리더보다 좁은 커버리지

02

왜 중요한가

코딩 에이전트의 실제 품질은 짧은 영어 문제 하나를 맞히는 능력만으로 설명되지 않습니다. 긴 세션에서 문맥을 유지하고, 저장소 규칙을 따르며, 도구를 안전하게 사용하고, 부분 완료를 완료로 오인하지 않는 능력이 함께 측정돼야 합니다.

특히 한국어로 지시하고 한국의 문서·저장소 관행을 다루는 환경에서는 영어 공개 벤치마크의 점수를 그대로 제품 적합성으로 해석하기 어렵습니다. 이 리포트는 점수보다 먼저 평가 체계를 설계하는 방법을 다룹니다.

03

핵심 요점

  1. 01

    워크로드를 8개 클래스로 층화해 한 종류의 개선이 전체 점수를 지배하지 않게 합니다.

  2. 02

    채점기는 seed에서 실패하고 reference solution에서 성공해야만 유효합니다.

  3. 03

    SWE-bench Verified 50개는 전체 리더보드가 아니라 외부 기준점 역할의 선별 부분집합입니다.

  4. 04

    장기 세션의 문맥 유지와 한국어 지시 기반 업무는 별도의 A/B 하네스로 봐야 합니다.

리포트 본문

공개 벤치마크는 두 가지로 불충분합니다. 오염(학습 데이터 유출)과 대표성 부족입니다. 코딩 에이전트의 실제 실패는 "알고리즘을 못 짜서"가 아니라 컨텍스트 관리 실패, 도구 오용, 부분 완료 처리에서 일어나는데, 기존 벤치마크는 이를 거의 잡아내지 못합니다.

우리의 코퍼스는 8개 워크로드 클래스로 층화되어 있습니다: 신규 기능 구현, 버그 수정, 리팩토링, 테스트 작성, 마이그레이션, 문서 동기화, 디버깅, 코드 리뷰 반영. 각 클래스별로 난이도 분포를 유지해, 한 클래스의 개선이 전체 점수를 왜곡하지 않게 합니다.

anti-guess 설계가 원칙입니다. 정답이 문맥 추측만으로 맞히지 못하도록 문항을 설계하고, 채점기는 seed 입력에서 반드시 실패하고 reference 입력에서 반드시 성공해야 검증됩니다(fail-on-seed / pass-on-reference).

컨텍스트 유지 A/B 하네스는 세션 길이에 따른 성능 저하 곡선을 측정합니다. 장기 세션에서 컨텍스트를 유지하는 능력이 에이전트 품질의 결정적 차이이기 때문입니다.

한계: SWE-bench Verified는 50개 인스턴스의 선별 부분집합만 사용하며, 이는 전체 리더보드와 직접 비교 가능한 숫자가 아닙니다. 코퍼스 전체의 문항 수와 클래스별 분포는 후속 리포트에서 공개할 예정입니다.

06

의사결정에 주는 의미

기업이 코딩 에이전트를 선택할 때 단일 성공률 대신 자사 저장소와 언어, 세션 길이, 도구 권한을 반영한 평가 포트폴리오를 요구해야 합니다.

벤치마크 결과를 공개할 때는 과제 생성, 채점기 검증, 실패 정의와 제외 범위를 함께 제공해야 모델 교체나 프롬프트 변경의 효과를 비교할 수 있습니다.

07

검증 방법

실제 개발 흐름을 신규 기능, 버그 수정, 리팩터링, 테스트, 마이그레이션, 문서 동기화, 디버깅, 코드 리뷰 반영의 8개 클래스로 구분합니다. 과제마다 seed repository와 reference solution을 고정하고 채점기의 fail-on-seed/pass-on-reference를 확인합니다.

공개 외부 기준점으로 SWE-bench Verified의 선별 50개를 별도로 유지하고, 장기 세션은 같은 과제를 문맥 유지 조건과 cold-restart 조건에서 비교합니다. 내부 코퍼스와 공개 집합의 점수는 하나로 합치지 않습니다.

08

측정 조건

  • e2e 태스크 코퍼스 워크로드 클래스

    사내 벤치마크 스위트 기준 분류

  • SWE-bench Verified 부분집합

    전체 집합이 아닌 선별 부분집합 — 전체 리더보다 좁은 커버리지

09

한계

이 문서는 코퍼스 설계와 검증 규율을 설명하며 특정 모델의 한국어 성능 점수를 공개하지 않습니다. 50개 SWE-bench 부분집합은 전체 리더보드와 직접 비교할 수 없습니다.

내부 과제 분포는 실제 고객 저장소 전체를 대표하지 않으며, 데이터 오염 가능성을 완전히 증명하는 것도 아닙니다. 결과 공개 시점마다 과제 버전과 실행 조건을 함께 고정해야 합니다.

10

참고 자료

  1. SWE-bench

    실제 GitHub 이슈 기반 소프트웨어 엔지니어링 벤치마크.

  2. SWE-bench research paper

    벤치마크의 설계와 평가 배경을 설명하는 1차 논문.

  3. 벤치마크 설계 & 구축

    Patty의 평가 설계 원칙과 구현 절차.