AI 에이전트끼리 흥정시켰더니: 시장의 병목은 협상이 아니라 “내 취향 이해”였다

Anthropic이 직원 201명의 책 교환 시장에서 Claude 에이전트를 거래시킨 결과, 성과 저하의 대부분은 협상보다 사용자 선호 추정에서 발생했다.

201명의 책을 에이전트가 대신 교환했다

Anthropic은 9월 24일 Project Swap 결과를 공개했습니다. 여섯 사무소의 직원 201명이 내놓은 책을 대상으로, 각 사람이 짧게 취향을 설명하면 Claude 에이전트가 다른 에이전트와 거래해 새 책을 구했습니다. 이후 참가자가 직접 매긴 10권 순위와 에이전트의 추정을 비교했습니다.

짧은 대화로 만든 선호 순위는 두 책의 순서를 사람과 61% 일치시켰습니다. 실제 거래 결과는 참가자 기준 평균 0.55로, 이상적 배정 0.89보다 낮았습니다. 연구진의 분해에서는 전체 격차의 85%가 협상 방식보다 부정확한 선호 표현에서 나왔습니다. 에이전트 지시보다 사용한 모델의 차이가 시장 효율에 더 큰 영향을 보였지만 단조롭게 좋아지지는 않았습니다.

책 교환은 금융·의료 시장의 축소판일 뿐이다

참가자는 Anthropic 직원이고 물건은 저위험 책이었습니다. 가격, 사기, 법적 책임, 취소와 개인정보가 있는 실제 시장으로 결과를 일반화할 수 없습니다. 61% 일치도 역시 나머지 선호 오류가 중요한 구매에서 큰 손실을 낼 수 있음을 보여줍니다.

에이전트 거래 서비스는 거래 전에 사용자가 선호·예산·금지 조건을 검토하고, 금액과 위험에 따른 승인 한도, 취소·분쟁 절차와 전체 거래 기록을 제공해야 합니다.

공식 출처