283개 LLM 벤치마크 데이터셋 총정리 > 정보공유

본문 바로가기

사이트 내 전체검색

뒤로가기 정보공유

283개 LLM 벤치마크 데이터셋 총정리

페이지 정보

작성자 방장 작성일 25-08-30 11:05 조회 674 댓글 0

본문

페이스북 전종홍 님 작성글

283개 LLM 벤치마크 데이터셋들에 대한 총정리. 참고문헌만 320개. 이걸 누가 안해주나 했는데 역시 사람 많은 중국에서 했네요.

283개 대표적 LLM 벤치마크를 3가지 범주로 체계적 분류하고, 각 벤치마크의 데이터 소스, 데이터 형식, 데이터 크기, 평가 방법, 지표 등을 다차원적으로 검토하여 벤치마크 설계 패러다임을 제시하며, 동시에 특히 동적 벤치마크(living benchmark), LLM-as-a-Judge 접근, 다언어·다문화 기반 평가, 에이전트 능력 평가와 같은 새로운 흐름을 체계화
① 일반 능력 벤치마크: 언어학적 능력, 지식, 추론
② 도메인 특화 벤치마크: 자연과학, 인문·사회, 공학·기술
③ 타깃 특화 벤치마크: 안전성, 신뢰성, 에이전트, 데이터 누출 등

벤치마크 데이터셋들을 정리하며 발견한 동향 특징들은

1) 벤치마크의 진화
 - 초기: GLUE, SuperGLUE → 단일 언어·단순 정확도 중심
 - 현재: MMLU, HELM, BIG-Bench, LiveBench → 다언어, 다분야, 동적 시나리오, LLM-as-a-Judge 평가

2) 도메인 특화 확산
 - 수학(MATH, GSM8K, Omni-MATH), 물리학(UGPhysics, PhysicsArena), 화학(ChemBench, ChemSafetyBench), 생물학(PubMedQA, BioMaze) 등으로 확대
 - 사회과학·법률(LawBench, LegalBench), 교육(E-Eval, EduBench), 심리학(CPsyCoun), 금융(FinEval) 등 적용 확대

3) 위험 및 신뢰성 평가 강화
 - Safety (JailbreakBench, HarmBench, ToxiGen)
 - Hallucination (TruthfulQA, HaluEval, MedHallu)
 - Robustness (AdvGLUE, PromptRobust, CIF-Bench)
 - Data Leak (KoLA, C2LEVA)

4) 주요 한계 지적
 - 데이터 누출로 인한 신뢰도 저하
 - 언어·문화적 편향 지속
 - 정적 평가의 한계: 실세계 동적 환경을 반영하지 못함
 - 지표 단순화 문제: 복합적 능력을 정량화하기 어려움

결론적으로 앞으로 동적·실시간 평가(LiveBench, RealTimeQA와 같은 시도 확장 필요)가 필요하며, 프로세스 중심 평가(단순 정답이 아니라 reasoning chain(추론 과정)의 일관성과 신뢰성 평가)로 바뀔 필요가 있으며, 다문화·다언어 확장(영어 중심 벤치마크를 넘어 다양한 언어와 문화적 맥락 반영)이 필요하고, 에이전트 능력 평가(계획·도구 사용·협업 등 실제 행동 기반의 평가 필요)가 필요하며, 위험·안전성 통합 프레임워크(안전성, 편향, 데이터 누출 등을 통합적으로 평가할 수 있는 종합 지표 개발) 개발이 필요하다는 점.

LLM 벤치마크는 단순 성능 평가를 넘어 AI 개발 방향을 이끄는 나침반 역할을 하는데, 현재의 벤치마크는 과대평가, 편향, 정적 성격, 단일 지표 한계 등 심각한 문제를 안고 있으므로, 향후 벤치마크는 동적(dynamism), 인과성(causality), 포용성(inclusion), 강건성(robustness)의 4대 원칙에 기반해야 한다는 지적

제목: A Survey on Large Language Model Benchmarks

요약:
최근 몇 년 동안 대규모 언어 모델 역량의 깊이와 폭이 급속도로 발전함에 따라, 이에 상응하는 다양한 평가 벤치마크가 점점 더 많이 등장하고 있습니다. 모델 성능을 정량적으로 평가하는 도구로서 벤치마크는 모델 역량을 측정하는 핵심 수단일 뿐만 아니라, 모델 개발 방향을 제시하고 기술 혁신을 촉진하는 핵심 요소이기도 합니다. 본 연구에서는 대규모 언어 모델 벤치마크의 현황과 발전 과정을 체계적으로 검토하여, 283개의 대표적인 벤치마크를 일반 역량, 도메인 특화, 목표 특화의 세 가지 범주로 분류했습니다. 일반 역량 벤치마크는 핵심 언어학, 지식, 추론과 같은 측면을 포괄하고, 도메인 특화 벤치마크는 자연과학, 인문학 및 사회과학, 공학 기술 분야에 중점을 둡니다. 목표 특화 벤치마크는 위험, 신뢰성, 행위자 등에 주목합니다. 본 연구에서는 현재 벤치마크가 데이터 오염으로 인한 부풀려진 점수, 문화적·언어적 편향으로 인한 불공정한 평가, 프로세스 신뢰성 및 역동적인 환경에 대한 평가 부족과 같은 문제점을 가지고 있음을 지적하고, 향후 벤치마크 혁신을 위한 참고 가능한 설계 패러다임을 제시합니다.

링크 - https://arxiv.org/abs/2508.15361

HTML - https://arxiv.org/html/2508.15361v1

댓글목록 0

등록된 댓글이 없습니다.

Copyright © GPTsquare.kr All rights reserved.

사이트 정보

커뮤니티명 : 지피티스퀘어(GPTsquare)
주소 : 서울시 구로구 디지털로33길 28, 우림이비지센터1차 406호
개인정보관리책임자 : 이현종
방장 이메일 : zagia@naver.com

PC 버전으로 보기