AI가 회계사를 대신할까? 실제 업무 160개에서 완전 성공은 2.6%

APEX-Accounting은 회계 시스템·스프레드시트·PDF를 함께 다루는 실제형 업무를 평가했고, 평균 기준 점수와 완전 성공률 사이에 큰 격차를 확인했다.

실제 회계 업무를 옮긴 벤치마크

7월 29일 공개된 APEX-Accounting은 프런티어 모델이 회계사의 실제 업무를 수행할 수 있는지 평가합니다. Mercor와 Ramp가 회계·부기 전문가와 함께 계정 조정, 비용 발생 처리, 거래 입력, 보고서 작성 등 160개 비공개 과제를 10개 업무 환경으로 구성했습니다. 각 환경에는 회계 시스템과 스프레드시트, PDF 등 여러 파일이 포함됩니다.

평균 점수와 완전 성공은 달랐다

저자 보고에서 9개 모델 가운데 Claude Fable 5 Max가 Mean Criteria@3 56.4%로 가장 높았고 Muse Spark 1.1 xHigh가 52.6%로 뒤를 이었습니다. 그러나 모든 평가 기준을 반복 실행에서 통과하는 Pass^8 최고치는 GPT-5.6 Sol Max+Pro의 2.6%, 여덟 번 중 한 번 이상 완전히 성공하는 Pass@8 최고치는 Muse Spark 1.1 xHigh의 21.5%였습니다.

이는 부분 점수를 얻는 것과 장부 전체를 오류 없이 완성하는 것이 다르다는 뜻입니다. 예산을 1달러에서 50달러로 늘리면 전체 점수는 올랐지만, 같은 실행 조건 안에서는 더 많은 토큰을 쓴 어려운 과제의 점수가 낮아지는 Simpson의 역설도 관찰됐습니다.

실무에서의 의미와 한계

회계 자동화는 단일 평균 점수보다 거래 단위 검증, 잔액 대조, 승인 기록과 실패 복구를 봐야 합니다. AI는 자료 정리와 초안을 맡고, 결산·세무 판단과 최종 전기는 자격 있는 사람이 검토하는 구조가 현실적입니다.

이 연구는 동료평가 전 프리프린트이며 비공개 평가 세트라 외부 재현에 제약이 있습니다. 저자·파트너가 설계한 특정 도구 환경의 결과이고, 모델 이름과 성능도 빠르게 바뀔 수 있습니다.

원문