AI의 변화, 근거와 맥락까지.AI NEWS & CONTEXT
기타 AI

Sakana AI, 논문 오류 찾는 AI 심사 시스템 공개…핵심 주장 오류 73% 탐지

Sakana AI가 AI 동료 심사를 사람 리뷰 모방이 아닌 오류 탐지로 평가한 연구를 발표했다. 자체 개발한 MLR은 핵심 주장 오류의 73.43%를 찾았고, 리뷰 한 건당 비용은 약 0.47달러다.

Sakana AI가 대규모 언어 모델(LLM) 기반 동료 심사 연구 논문 'Beyond Imitation'을 TMLR에 발표했다. 기존 AI 심사 도구가 사람이 쓴 리뷰와 얼마나 비슷한지로 평가받던 것과 달리, 논문에 심어 둔 오류를 실제로 찾아내는지를 기준으로 삼았다. 연구진은 이를 위해 모순 벤치마크(Contradiction Benchmark)와 다층 심사 시스템 Multi-Layered Review(MLR)를 함께 내놨다.[1]

밝은 녹색 트랙수트를 입은 젊은 여성이 카메라 쪽으로 몸을 살짝 돌리고 미소 짓고 있다. 황금빛 갈색 콘로우 머리를 했다.
밝은 녹색 트랙수트를 입고 미소 짓는 여성 일러스트
Jazmin Morris & AI4Media / Better Images of AI · CC BY 4.0 · 원본 · 크기 조정

MLR은 리뷰 4건을 합쳤을 때 핵심 주장(거리 0) 오류의 73.43%를 탐지했다. 같은 조건에서 가장 나은 비교 시스템 AgentReview는 14.81%였다. 시스템은 별도 GPU나 미세 조정 없이 기성 API 모델인 Claude Sonnet 4와 Claude Haiku 3.5로 돌아가며, 리뷰 한 건당 비용은 약 0.47달러다. MLR은 본문을 최대 10쪽까지 읽는다.[1]

MLR의 구조

MLR은 논문을 비평하기 전에 먼저 이해하도록 설계된 에이전트형 시스템으로, 세 에이전트로 이뤄진다. Appendix Agent(Claude Haiku 3.5)는 부록의 실험과 구현 세부를 요약한다. Literature Review Agent(Claude Sonnet 4)는 웹 검색으로 논문을 선행 연구 속에 위치시키며 선택 사항이다. Review Agent(Claude Sonnet 4)는 Keshav의 3단계 읽기 방식에서 착안한 3단계 프롬프트 체인을 실행한다.[1]

1단계에서 개요를 쓰고, 2단계에서 세부를 읽으며 약점·가정·빈틈을 표시한다. 3단계에서 모든 에이전트의 결과를 합쳐 강점, 약점, 질문, 추천, 점수, 할 일 목록으로 정리한다. PDF를 그대로 넘겨 그림과 수식이 보존된다.[1]

벤치마크 설계

벤치마크는 실제 논문에 오류를 심고 심사자가 잡아내는지 확인한다. 연구진은 ACL, AISTATS, CVPR, ICML 2025와 NeurIPS 2024에서 크리에이티브 커먼즈 라이선스 논문 257편을 모았다. Gemini 2.5 Pro가 논문의 주장·근거·방법을 지식 그래프로 만들고, '핵심 주장'에서 노드까지의 거리로 오류의 심각도를 정했다. 거리 0은 핵심 주장, 멀수록 세부 사항이다. 이어 GPT-4.1이 거리마다 노드 하나를 모순으로 고쳐 써 모두 1,164개 데이터를 만들었다.[1]

채점은 o3 판정 모델이 리뷰마다 10회 수행했다. 오류가 없는 논문에서는 정확도 99.9%였고, 사람이 직접 확인한 탐지 사례에서는 민감도가 86.8%였다. 판정 모델이 일부 탐지를 놓칠 수 있어 보고된 점수가 보수적일 수 있다.[1]

성능과 한계

모순 벤치마크(Contradiction Benchmark)에서 MLR은 모든 기준 시스템을 앞섰다. 리뷰 4건 기준 전체 탐지율은 40.95%였고, 리뷰 1건만으로도 핵심 주장 오류의 60.79%를 잡았다. 모델과 설계의 효과도 분리했다. LLM-Review에서 GPT-4.1을 Claude Sonnet 4로 바꾸자 거리 0 탐지율이 14.56%에서 35.40%로 올랐고, MLR의 설계가 리뷰 1건 기준 약 25%포인트를 더했다. 노드 거리가 멀어질수록 탐지율은 떨어졌다.[1]

철회된 실제 arXiv 논문 211편으로 만든 WithdrarXiv-Check에서는 격차가 줄었다. MLR은 유사 일치 26.07%, 정확 일치 16.11%를 기록했다. 비교 시스템 가운데 유사 일치 최고는 AgentReview의 18.48%, 정확 일치 최고는 AI Reviewer의 9.00%였다. 또 MLR을 포함해 시험한 모든 AI 심사자가 숨겨진 프롬프트 인젝션의 영향을 받았다.[1]

AI 심사 시스템 비교
항목MLRLLM-ReviewAI ReviewerAgentReview
사용 모델Claude Sonnet 4 + Haiku 3.5GPT-4.1o4-miniGPT-4o
벤치마크 전체 탐지율40.95%(리뷰 4건)6.39%6.50%5.95%
핵심 주장 오류(거리 0)73.43%14.56%11.17%14.81%
WithdrarXiv-Check 유사/정확26.07% / 16.11%5.21% / 2.37%13.74% / 9.00%18.48% / 5.69%
ICLR 2025 사람 점수와 Pearson 상관0.586-0.0130.5380.195
리뷰당 입력 토큰189,0626,517403,654310,964
리뷰당 비용약 0.47달러약 0.01달러약 0.49달러약 0.81달러
코드 공개요청 시공개공개공개
[1]

사람 심사와의 일치도와 비용

ICLR 2025 투고작에서 MLR의 예측 점수는 사람 점수와 피어슨 상관 0.586을 보였다. 사람끼리의 기준값은 0.742다. ICML 2025에서는 AI Reviewer가 0.439로 사람 간 0.429를 근소하게 넘었다. 다만 MLR은 타당성과 실험을 강조하고, 사람은 명확성과 참신성을 더 따졌다. 저자들은 MLR을 대체재가 아닌 보완적 관점으로 설명한다.[1]

비용 약 0.47달러에는 선택 사항인 문헌 에이전트가 빠져 있다. 입력 토큰은 리뷰당 189,062개로 AI Reviewer의 403,654개 약 절반이다. 단일 프롬프트 변형은 비용을 약 3분의 2 줄였지만, 벤치마크 일부에서 탐지율이 약 3.5%포인트 떨어졌다. 벤치마크, 상관, 토큰, 비용 수치는 Beyond Imitation 논문에서 나온 것이다.[1]

탐지율 향상에는 모델 교체와 시스템 설계가 모두 기여했다. LLM-Review에서 모델만 바꿨을 때 거리 0 탐지율이 14.56%에서 35.40%로 올랐고, MLR의 설계는 리뷰 1건 기준 약 25%포인트를 더했다. 반면 실제 철회 논문에서 정확 일치는 16.11%에 그쳤다.[1]

각주·출처 1개
  1. ↩1 ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 Sakana AI’s LLM Peer Review System Catches 73% of Core-Claim Errors · 확인 2026-10-11
조회 —

독자의 생각

직접 써 본 경험과 다른 관점을 나눠 주세요. 주장에는 근거를, 서로에게는 존중을 부탁드립니다.

독자 의견을 불러오고 있습니다.