SEOUL NATIONAL UNIVERSITY · CENTER FOR LAW & ECONOMICS
서울대학교 법과경제연구센터CENTER FOR LAW & ECONOMICS
RESEARCH BRIEFING · 국제 학술지

대형 언어모델과 인간 판단의 경제학 논문 동료심사 비교 연구

Large language models and human judgement in scientific peer review: evidence from over 1000 published economics papers

ABSTRACT-BASED BRIEFING

GPT 초록 요약

경제학 분야에서 동료심사는 심사자 부족과 긴 심사 기간이라는 문제를 겪는다. 본 연구는 네 가지 대형 언어모델(LLM)을 활용해 1220편의 익명화된 논문 2만9000건 이상의 평가를 분석, LLM이 논문 품질 판단에서 학술지 순위 및 인용 영향과 긍정적으로 연관됨을 확인했다. GPT와 Gemma는 평가 효과가 우수했으나 LLaMA는 대부분 논문에 최대 점수를 부여해 차별화가 어려웠다. 또한 GPT는 인공지능 생성 논문 탐지에 뛰어났고 Claude 생성 논문은 최고 품질로 평가돼 탐지가 어려웠다. 그러나 저자 정체성을 바꾸는 실험에서 유명 경제학자 혹은 서구 명문 기관 소속 논문에 높은 점수를, 비서구권 논문엔 낮은 점수를 주어 인간 심사의 명성 편향이 모형에서도 나타남을 확인했다. 따라서 LLM 활용 시 저자 정보 차단이 중요함을 시사한다.

핵심 내용

  1. 네 개 LLM을 통해 경제학 논문 1220편, 2만9000건 이상의 평가를 분석해 품질 판단 능력을 검증했다.
  2. LLM은 저명 저자 및 서구 명문 기관 소속 논문에 대해 인간과 유사한 편향을 보였으며, 저자 비식별 조치가 필요하다.
  3. GPT는 AI 생성 논문 탐지에 강점을 보였으며, LLaMA는 평가 다양성이 부족해 품질 구분에 한계가 있었다.

요약의 범위와 한계

원문 초록에 담긴 내용을 바탕으로 생성한 한국어 요약입니다. 논문 전문을 검토한 결과가 아니며, 세부 방법·수치·결론의 적용 범위는 원문에서 확인해야 합니다.

본 요약은 논문의 초록 내용만을 바탕으로 작성되었으며, 구체적인 실험 설계, 통계적 분석 방법, 한계점 및 후속 연구 제언 등은 포함하지 않았다. 따라서 연구 전반에 대한 충분한 이해를 위해서는 전체 본문 검토가 필요하다.

이 요약은 고학수 교수 또는 서울대학교 법과경제연구센터의 공식 견해가 아닙니다.

요약 근거: 원문 초록 · 모델: gpt-4.1-mini · 생성: 2026. 10. 10. 15:24 (한국시간)

← 브리핑 전체 목록