한국어 모델 & 평가
한국어 지시, 긴 개발 세션, 국내 문서와 저장소 관행을 반영한 평가 설계.
Patty의 리포트는 결과만 보여 주지 않습니다. 왜 이 질문이 중요한지, 어떤 조건에서 측정했는지, 실무 의사결정이 어떻게 달라지는지와 결과가 말하지 못하는 범위를 함께 기록합니다.
모델의 점수보다 운영 가능한 전체 경로를 연구합니다.
한국어 지시, 긴 개발 세션, 국내 문서와 저장소 관행을 반영한 평가 설계.
분산 서빙, 스케줄링, KV 캐시와 자원 경계의 측정.
관찰, 계획, 승인, 도구 실행과 실패 복구를 연결한 finished-path 분석.
신원, 위임, 데이터 경계와 실행 영수증이 실제 통제로 작동하는지 검증.
수치의 크기보다 먼저 측정 단위와 제외 범위를 확인하세요.
이 리포트가 해결하려는 설계 또는 운영 질문
하드웨어, 빌드, 데이터, 참여자와 관찰 기간
확인된 사실과 의사결정에 미치는 의미
일반화할 수 없거나 아직 검증하지 않은 범위
브라우저 엔진 안에 AI 에이전트를 넣는 방식에서, 관찰→분류→파킹→승인→실행의 전체 경로(finished path)를 측정한 결과. 시맨틱 스냅숏은 페이지 크기와 무관하게 ~14–16ms로 flat했고, 통제 사이클 전체가 25ms 미만이었습니다.
8개 워크로드 클래스로 층화된 e2e 태스크 코퍼스와 SWE-bench Verified 부분집합(50 인스턴스), 컨텍스트 유지 A/B 하네스의 설계 문서. anti-guess 설계와 채점기 검증 규율을 포함합니다.
리포트는 제품 릴리스, 재측정, 환경 변화에 따라 갱신됩니다. 수정일과 측정 조건을 유지하고, 이전 결과의 범위를 조용히 넓혀 쓰지 않습니다.
공개 숫자를 그대로 적용하기보다 실제 하드웨어, 데이터, 네트워크와 승인 요구사항을 기준으로 평가 설계를 함께 만듭니다.