가게를 맡기면 AI는 버틸 수 있을까, StoreBench가 묻는 운영의 문제

중규모 의류 쇼핑몰을 한 달 넘게 직접 운영하게 만드는 라이브 벤치마크 StoreBench를 해설합니다. 29개 운영 도구와 시뮬레이션 시간, 사람과 모델의 점수 차이, 그리고 짧은 훈련으로 달라진 일반화 결과를 따라갑니다.

원문 논문 보기
'가게를 맡기면 AI는 버틸 수 있을까, StoreBench가 묻는 운영의 문제' 기사 커버 이미지

이번에 소개하는 작업은 StoreBench: A Live-Commerce Environment for Evaluating and Training Autonomous Operator Agents로, arXiv 식별자 2610.10942로 공개된 연구입니다. 이 연구는 에이전트에게 중규모 온라인 의류 상점을 실제 상용 수준의 커머스 백엔드 위에서 직접 운영하게 만들 때 장기간의 계획과 경제적 판단이 어떻게 무너지는지를 측정하자고 제안합니다. 원문 논문으로 이어지는 링크는 제목 아래에 걸려 있습니다.

제가 이 논문에서 가장 흥미롭게 본 부분은 문제를 숫자가 아니라 자리로 정의했다는 점입니다. 고객은 밤낮 없이 주문하고, 공급자는 가격을 바꾸다가 때로는 납품을 놓치며, 시장의 충격은 예고 없이 혹은 일부만 예고된 채로 도착하는데, 그런 상황에서 30일 넘게 가게를 지켜내는 일은 정답 맞히기와는 전혀 다른 종류의 일이기 때문입니다.

안녕하세요, 가게를 열어두는 일부터 생각해 보죠

안녕하세요, 패트릭입니다.

여러분도 온라인으로 무언가를 팔아본 적이 있으신지요. 주문이 들어오면 물건을 보내면 된다고 생각하기 쉽지만, 실제로 가게를 열어두는 일은 그보다 훨씬 지저분합니다. 오늘 팔린 옷이 내일도 팔린다는 보장이 없고, 잘 나가던 상품이 갑자기 멈추며, 반품은 예고 없이 쌓이고, 광고비는 쓰면 쓸수록 마음이 조급해지죠.

그렇다면 이런 가게를 AI에게 한 달 동안 맡기면 어떻게 될까요. 하루 이틀 반짝 잘하는 것과 한 달 내내 버티는 것은 같은 능력이 아닙니다. 저는 이 논문을 읽으면서 바로 그 차이가 궁금했습니다. 단답형 평가에서 높은 점수를 받는 모델이 왜 실제 운영에서는 쉽게 흔들리는지, 그 간격을 재는 도구가 필요했기 때문입니다.

이 글에서는 StoreBench라는 장치가 그 간격을 어떻게 재는지 차례로 따라가겠습니다. 어떤 상점을 차렸는지, 에이전트에게 어떤 도구를 주었는지, 시간을 어떻게 재었는지, 그리고 사람과 모델이 같은 자리에서 어떤 점수를 받았는지를 함께 보겠습니다.

왜 시험지를 더 늘리는 것만으로는 부족했을까

기존의 에이전트 평가는 대개 짧은 과제들의 모음으로 이루어져 있습니다. 질문이 주어지고, 도구를 몇 번 쓴 뒤, 답을 내면 끝나는 방식이죠. 이런 구조에서는 모델이 문제를 푸는 속도와 첫 시도의 정확도가 많은 것을 결정합니다.

그런데 상점 운영은 시험지와 다릅니다. 오늘 내린 결정의 결과가 2주 뒤에 재고로 돌아오고, 이번 주에 아낀 광고비가 다음 달 매출로 연결됩니다. 원인은 멀리 있고 결과는 늦게 오는데, 평가는 한 번의 답이 아니라 한 달 동안의 잔액으로 이루어집니다. 그래서 짧은 과제를 아무리 늘려도 운영 능력을 대신 측정하기 어렵습니다.

여기서 재미있는 질문이 생깁니다. 우리가 모델에게 묻고 싶은 것이 순간의 똑똑함일까요, 아니면 긴 시간을 버티는 판단력일까요. StoreBench를 만든 연구진은 후자라고 답합니다. 그래서 이들은 문제를 푸는 환경이 아니라 가게를 운영하는 환경을 만들었다고 설명합니다. 이 선택은 생각보다 중요합니다. 평가하려는 능력이 바뀌면 환경의 모양부터 다시 그려야 하기 때문입니다.

자리를 새로 짠다는 것은 무엇을 뜻할까

StoreBench의 무대는 중규모 온라인 의류 상점입니다. 품목 수는 감당할 수 있는 수준이지만, 운영할수록 경우의 수가 빠르게 늘어나는 크기죠. 상품을 올리고, 가격을 정하고, 재고를 채우고, 주문을 처리하고, 반품과 문의를 다뤄야 합니다.

제가 이 설정을 마음에 들어 한 이유는 규모가 현실적이기 때문입니다. 너무 크면 실험이 무거워지고, 너무 작으면 운영이라고 부르기 어렵습니다. 중규모라는 선택은 연구용 장난감과 실제 상점 사이에서 그나마 오래 버틸 수 있는 자리라고 봅니다. 옷이라는 품목도 잘 고른 편입니다. 유행에 민감하고 사이즈와 색상 조합이 많아서 수요 예측이 어렵고, 반품이 잦다는 특성이 운영자의 판단을 계속 시험하기 때문입니다.

이 환경은 상용 수준의 커머스 백엔드 위에서 돌아간다고 합니다. 다시 말하면 주문 처리나 재고 차감 같은 기본 동작이 실제 가게처럼 맞물려 돌아간다는 뜻인데, 그래서 에이전트의 실수가 바로 숫자로 드러납니다. 발주를 늦게 하면 품절이 나고, 가격을 잘못 건드리면 마진이 녹으며, 문의를 방치하면 평판과 재구매에 금이 갑니다. 이런 연결이 살아 있어야 운영을 평가했다고 말할 수 있겠죠.

밤낮으로 주문이 들어오는 소규모 의류 쇼핑몰 운영 상황을 보여주는 편집 삽화
밤낮으로 주문이 들어오는 소규모 의류 쇼핑몰 운영 상황을 보여주는 편집 삽화

쇼핑하는 AI와 가게를 지키는 AI는 다릅니다

이름만 보면 헷갈릴 수 있는데, StoreBench는 쇼핑 보조 에이전트를 재는 도구가 아닙니다. 최저가를 찾아주거나 상품을 추천하는 일과는 방향이 반대입니다. 여기에서 에이전트는 손님이 아니라 점주입니다.

손님 쪽 에이전트는 한 번의 요청을 잘 처리하면 됩니다. 조건에 맞는 상품을 찾고 결제까지 이어지면 일이 끝나죠. 반면 점주 쪽 에이전트는 끝이 없습니다. 오늘 주문을 잘 처리해도 내일 발주를 걱정해야 하고, 이번 주 매출이 좋아도 다음 주 재고가 비어 있으면 소용이 없습니다. 평가의 단위가 한 건의 성공이 아니라 한 달의 생존이라는 점에서 완전히 다른 과제입니다.

그렇다면 게임과 비교하면 어떨까요. 게임 환경도 길게 이어지고 보상이 늦게 오기는 합니다. 하지만 상점에는 게임과 다른 압박이 있습니다. 돈이라는 공통 단위가 모든 결정을 서로 묶어버리기 때문입니다. 가격, 재고, 광고, 인력처럼 보이는 선택들이 결국 하나의 통장으로 수렴하는데, 이 묶임이 운영을 어렵게 만듭니다. 저는 이 묶임을 이 논문이 다룬 여러 장치 중에서 가장 현실적인 부분이라고 봅니다.

29개 도구가 말해주는 운영의 결

StoreBench의 에이전트는 사람이 쓰는 것과 같은 29개 상점 운영 도구를 통해 행동합니다. 상품 등록과 가격 변경, 재고 조회와 발주, 주문 처리와 반품 대응, 할인 설정과 간단한 마케팅 집행 같은 일들이 도구 호출로 이루어진다고 이해하면 됩니다.

숫자 29가 많아 보일 수도 있지만, 실제 상점을 떠올리면 오히려 절제된 편입니다. 진짜 점주의 하루에는 전화와 문자, 거래처 사정과 창고 사정이 뒤섞이는데, 여기에서는 그 복잡함을 도구라는 형태로 가지런히 정리한 셈입니다. 대신 도구가 적다는 뜻은 매 선택이 더 무겁다는 뜻이기도 합니다. 쓸 수 있는 수가 정해져 있으니 어디에 손을 댈지 고르는 판단 자체가 실력이 되기 때문입니다.

여기에는 또 하나의 장치가 걸려 있습니다. 윈도우 단위의 운영 예산이라는 제한인데요. 한 번에 쓸 수 있는 행동의 양이 정해져 있어서 에이전트는 매 순간 우선순위를 정해야 합니다. 급한 불을 끌지, 다음 주를 준비할지, 아니면 잠시 기다리며 정보를 모을지를 골라야 하죠. 생각해보면 사람도 비슷하게 일합니다. 하루에 처리할 수 있는 일은 정해져 있고, 그 안에서 무엇을 먼저 할지가 점주의 실력이니까요. 이 예산 제한이 없었다면 에이전트는 모든 것을 다 건드리면서 운으로 버틸 수 있었을 겁니다.

정적인 질의응답 평가와 살아 움직이는 상점 운영을 나란히 비교한 다이어그램
정적인 질의응답 평가와 살아 움직이는 상점 운영을 나란히 비교한 다이어그램

시간이 행동을 따라간다는 말의 뜻은 무엇일까

이 환경에서 시뮬레이션 시간은 에이전트가 취한 행동의 함수로 흐릅니다. 문장을 그대로 옮기면 딱딱하게 들리지만, 뜻은 단순합니다. 모델이 빨리 답한다고 해서 가게의 시간이 빨리 가지 않고, 느리게 생각한다고 해서 손님이 기다려주지 않는다는 것입니다.

이 설계가 왜 필요했을까요. 모델마다 응답 속도가 다른데, 그 속도 차이까지 성적에 섞이면 무엇을 잰 것인지 알 수 없게 되기 때문입니다. 연구진은 지연 시간의 영향을 시뮬레이션 시간에서 떼어냈다고 설명합니다. 그래서 남는 것은 순수하게 판단의 기록입니다. 어떤 상황에서 무슨 도구를 썼고, 그 선택이 며칠 뒤에 어떤 결과로 돌아왔는지만 남죠.

저는 이 결정을 꽤 신중하다고 봅니다. 속도를 빼면 모델이 불리해진다고 느낄 수도 있지만, 반대로 보면 변명을 없앤 셈이기 때문입니다. 느려서 졌다는 말이 통하지 않으니 남는 질문은 하나입니다. 같은 시간이 주어졌을 때 누구의 운영이 더 단단했는가. 평가로서는 오히려 더 엄격해졌다고 할 수 있죠.

같은 행동이면 같은 결과가 돌아오는 장치

StoreBench의 또 다른 축은 재현 가능성입니다. 행동 순서가 주어지면 매 에피소드는 똑같이 재생된다고 합니다. 무작위 손님과 공급자, 시장 충격이 있더라도 일단 같은 행동을 하면 같은 전개가 펼쳐진다는 뜻입니다.

이것은 운영 벤치마크에서 생각보다 어려운 약속입니다. 살아 있는 시장처럼 보이게 하려면 무작위성이 필요하고, 공정한 비교를 하려면 무작위성을 통제해야 하기 때문입니다. 연구진은 이 긴장을 시드와 고정된 재생 규칙으로 풀었다고 설명합니다. 같은 조건에서 다시 돌리면 같은 일이 벌어지니 모델끼리 견줄 수 있고, 다른 시드에서는 다른 시장을 만날 수 있으니 운 좋은 한 판이 실력처럼 포장되지 않습니다.

통과 기준을 정하는 방식도 비슷합니다. 연구진은 스크립트로 짠 기준 정책들을 앵커로 삼아 통과선을 맞추었다고 합니다. 감으로 선을 긋는 대신, 단순하지만 합리적인 운영 규칙을 먼저 돌려보고 그 성적을 기준으로 삼는 것이죠. 저는 이 대목에서 고개를 끄덕였습니다. 기준이 없으면 모두가 잘한 것처럼 보이고, 기준이 너무 높으면 모두가 포기하게 되는데, 앵커 정책은 그 사이에서 잣대를 고정해주는 역할을 하기 때문입니다.

29개 상점 운영 도구를 쓰는 에이전트 콘솔의 작업 흐름도
29개 상점 운영 도구를 쓰는 에이전트 콘솔의 작업 흐름도

일 년짜리 가게를 맡기는 시험은 어떻게 생겼을까

평가 구성은 작지 않습니다. 일곱 개의 프론티어 언어모델이 30일에서 45일 길이의 시나리오 11개와 통짜로 된 1년 시뮬레이션을 치렀고, 세 개의 월드 시드에 걸쳐 같은 추론 노력 예산에서 비교되었다고 합니다.

여기서 숫자를 조금 풀어보겠습니다. 11개 시나리오라는 말은 열한 가지 다른 위기를 겪는다는 뜻입니다. 수요가 갑자기 뛰는 구간도 있고, 공급이 끊기는 구간도 있으며, 반품이 몰리거나 가격이 흔들리는 구간도 있겠죠. 30일에서 45일이라는 길이는 초반 실수가 복구되는지를 볼 수 있는 길이입니다. 첫 주에 재고를 잘못 채워도 정신을 차리면 만회할 수 있고, 반대로 초반이 좋아도 방심하면 후반에 무너집니다.

그리고 1년 시뮬레이션이 따로 있다는 점이 눈에 띕니다. 한 달 버티기와 일 년 버티기는 다른 게임이기 때문입니다. 계절이 바뀌고 유행이 돌며 재고가 누적되는 동안 작은 습관이 큰 차이로 벌어집니다. 세 개의 시드에서 반복한다는 것도 같은 맥락입니다. 한 시장에서 잘했다고 해서 운영을 잘한다고 말할 수 없으니 서로 다른 시장에서 다시 묻는 것이죠. 추론 노력 예산을 맞추었다는 대목도 빼놓을 수 없습니다. 생각할 시간을 똑같이 주고 비교해야 판단의 질만 남기 때문입니다.

같은 행동 순서가 같은 결과를 재현하는 결정적 시뮬레이션 타임라인
같은 행동 순서가 같은 결과를 재현하는 결정적 시뮬레이션 타임라인

49퍼센트와 97퍼센트 사이에 놓인 간격

결과는 꽤 선명합니다. 어떤 모델도 평균적으로 스크립트로 짠 스마트 트리아지 정책을 넘지 못했고, 가장 성적이 좋은 DeepSeek-V4-Pro도 과제와 시드 칸 기준으로 49퍼센트를 통과한 반면, 휴리스틱 정책은 97퍼센트를 통과했다고 합니다.

이 숫자는 그대로 믿기 전에 조건을 봐야 합니다. 49퍼센트라는 말이 모델이 절반만 맞혔다는 뜻이 아니라 정해진 통과선을 넘은 칸이 절반 정도라는 뜻이기 때문입니다. 그리고 상대인 97퍼센트는 단순한 무작위 기준이 아니라 운영의 요령을 규칙으로 옮겨 적은 정책입니다. 급한 일부터 처리하고 재고를 다 떨어뜨리지 않으며 현금 흐름을 지키는 식의 상식을 코드로 박아 넣은 것이죠.

그렇다면 이 간격을 어떻게 읽어야 할까요. 저는 이 숫자보다 그 뒤의 구조가 더 중요하다고 봅니다. 모델이 똑똑하지 않아서가 아니라, 급한 일과 중요한 일을 가르는 감각이 규칙보다 못했다는 뜻이기 때문입니다. 사람은 바쁠 때 자연스럽게 눈앞의 손님부터 봅니다. 그런데 그 자연스러움이 코드가 되면 의외로 강합니다. 모델은 넓게 보고 싶어 하지만, 넓게 보다 보니 정작 오늘 막아야 할 구멍을 놓친다는 것입니다. 49와 97의 차이는 지식의 차이가 아니라 우선순위의 차이에 가깝다고 할 수 있죠.

사람은 같은 자리에서 무엇을 보여주었을까

같은 도구와 같은 예산으로 일한 사람 전문가들은 모든 모델을 앞섰고, 평균 종합 점수로 0.708 대 0.700을 기록했다고 합니다.

겉으로 보면 차이가 작아 보입니다. 0.008이면 오차처럼 느껴지기도 하죠. 하지만 평가 구조를 떠올리면 느낌이 달라집니다. 열한 개 시나리오와 세 개 시드, 그리고 1년짜리 장기 운영을 묶은 평균에서 사람을 앞선 모델이 하나도 없었다는 뜻이기 때문입니다. 한두 판의 우연이 아니라 자리 전체에서의 우위라는 것이죠.

개인적으로 인상 깊었던 점은 사람이 이긴 방식입니다. 사람은 모델처럼 모든 정보를 한 번에 훑지 않습니다. 대신 장부를 보고, 창고를 떠올리고, 거래처 사정을 먼저 챙기는 식으로 손이 가는 순서가 있습니다. 이런 순서는 논리적으로 증명하기 어렵지만, 가게를 오래 해본 사람의 몸에 밴 것입니다. 모델이 0.700까지 따라온 것은 대단하지만, 마지막 0.008을 못 넘은 것은 그 몸에 밴 순서가 아직 언어로 다 옮겨지지 않았다는 뜻인지도 모릅니다. 실제 시스템 관점에서 보면 다음 질문이 바로 생깁니다. 이 차이를 메우는 데 더 큰 모델이 필요할까요, 아니면 운영의 순서를 배우는 다른 훈련이 필요할까요.

프론티어 모델과 스크립트 정책, 사람 전문가의 점수를 비교한 스코어보드 개념도
프론티어 모델과 스크립트 정책, 사람 전문가의 점수를 비교한 스코어보드 개념도

다섯 개 과목으로 공부하고 낯선 시험에서 통하다

이 논문이 평가에서 멈추지 않았다는 점도 봐야 합니다. 연구진은 Qwen3.5-27B를 상대로 GRPO라는 사후 훈련을 돌렸는데, 서로 겹치지 않는 다섯 개의 과제에서만 훈련했음에도 훈련에 쓰지 않은 평가 과제에서의 평균 종합 점수가 0.136에서 0.373으로 올랐다고 합니다.

여기서 숫자를 다시 prose 안에 넣어보겠습니다. 훈련 전 0.136은 거의 헤매는 수준이었고, 훈련 뒤 0.373은 여전히 사람과 휴리스틱에는 못 미치지만 혼자 버틸 수 있는 수준에 가까워졌다는 뜻입니다. 더 눈여겨볼 대목은 훈련에 쓰지 않은 과제에서 올랐다는 점입니다. 외운 답이 아니라 옮겨 쓸 수 있는 습관이 생겼다는 뜻이기 때문입니다.

저는 이 결과를 보고 작은 가게의 수습 기간을 떠올렸습니다. 신입 점원을 모든 상황에 대비시켜서 내보낼 수는 없습니다. 대신 몇 가지 바쁜 날을 함께 겪게 하면 낯선 날에도 손이 먼저 움직이기 시작하죠. GRPO 훈련이 한 일이 바로 그것에 가깝다고 봅니다. 다섯 개의 서로 다른 바쁜 날을 겪으면서 언제 발주하고, 언제 가격을 만지며, 언제 기다릴지를 몸으로 익힌 것입니다. 물론 0.373이 완성을 뜻하지는 않습니다. 다만 운영 능력이 훈련으로 옮겨간다는 증거로는 꽤 분명한 방향이라고 할 수 있죠.

짧은 강화학습 뒤에 낯선 과제에서 성적이 오르는 학습 곡선 삽화
짧은 강화학습 뒤에 낯선 과제에서 성적이 오르는 학습 곡선 삽화

저희가 숫자보다 구조를 먼저 보는 이유

저희가 새로운 AI 평가를 볼 때도 점수표만 보지는 않습니다. 실제로 무엇이 바뀌었고, 그 변화가 시스템에서 어떤 비용 구조를 만드는지를 함께 봅니다. StoreBench도 같은 눈으로 읽을 필요가 있습니다.

이 환경이 남긴 구조적인 메시지는 세 가지로 정리할 수 있습니다. 첫째로, 에이전트 평가는 시간의 길이를 다뤄야 합니다. 하루짜리 과제와 한 달짜리 운영은 다른 근육을 요구하기 때문입니다. 둘째로, 도구의 모양이 능력을 규정합니다. 29개라는 수는 장식이 아니라 운영자가 매일 마주치는 선택지의 모양이고, 예산 제한은 그 선택을 강제하는 압력입니다. 셋째로, 재현 가능성과 공정성의 장치가 있어야 점수가 의미를 가집니다. 행동이 시간을 밀고 나가고, 같은 행동이 같은 전개를 낳으며, 통과선이 앵커 정책에 묶여 있으니 비교가 가능해집니다.

여기서는 조금 조심해서 읽을 필요가 있습니다. StoreBench가 현실 상점의 전부는 아니기 때문입니다. 의류라는 품목에 맞추어져 있고, 시뮬레이션이라는 틀 안에 있으며, 실제 단골의 마음이나 거래처와의 신뢰 같은 것은 숫자로 다 담기 어렵습니다. 그래서 이 점수를 그대로 현실 매출로 번역해서는 안 됩니다. 그럼에도 운영이라는 말을 벤치마크의 언어로 옮겼다는 점에서는 분명히 한 걸음 나아갔다고 봅니다.

그렇다면 다음에 물을 질문은 무엇일까요

앞으로 보고 싶은 것은 크게 두 가지입니다. 하나는 실패의 모양입니다. 모델들이 어느 지점에서 무너지는지를 더 잘게 보면 다음 설계가 보이기 때문입니다. 재고에서 무너졌는지, 가격에서 무너졌는지, 문의 대응에서 무너졌는지에 따라 고쳐야 할 도구가 달라집니다. 통과 여부보다 통과하지 못한 날의 기록이 더 많은 것을 말해줄 때가 많죠.

다른 하나는 훈련의 범위입니다. 다섯 개 과제에서 낯선 과제로 옮겨간 일반화가 어디까지 이어지는지, 그리고 그 일반화가 1년짜리 운영에서도 유지되는지를 보고 싶습니다. 짧은 위기에서 배운 습관이 긴 계절에서도 통하는지는 다른 문제이기 때문입니다. 만약 그 습관이 계절을 넘는다면 운영 에이전트에 대한 이야기는 평가를 넘어 훈련의 이야기로 더 기울겠죠.

그렇다면 사람의 역할은 무엇일까요. 이 논문을 덮으면서 저는 그 질문으로 돌아갔습니다. 모델이 가게를 맡는 날이 와도 점주의 눈은 여전히 필요할 겁니다. 무엇을 먼저 볼지, 언제 기다릴지, 그리고 숫자에 나오지 않는 불안을 언제 믿을지를 아는 감각은 쉽게 코드가 되지 않기 때문입니다. StoreBench는 그 감각을 잴 수 있는 자를 하나 내놓았습니다. 이제 남은 일은 그 자 위에서 모델을 한 뼘씩 앞으로 옮기는 것입니다.

참고 자료

  1. StoreBench: A Live-Commerce Environment for Evaluating and Training Autonomous Operator Agents · arxiv.org

    리뷰 원문