AI 벤치마크 조작 논란, 모델 정체 검증법

한 줄 요약: Basalt Labs의 HLE 99.44% 주장보다 먼저 확인할 것은 Qwen2.5-7B-Instruct 기반 공개 모델과 DeepSeek로 의심받은 웹 서비스가 같은 평가 대상이었는지다. 모델 라우팅을 썼다면 사용자가 무엇을 평가하는지 밝혀야 벤치마크를 검증할 수 있다. 무슨 일이 있었나 2026년 7월 19일 기준, Reddit의 LocalLLaMA 커뮤니티에 Basalt Labs의 모델 공개와 벤치마크 주장을 문제 삼는 게시물이 올라왔다. 제목에는 Basalt Labs가 도구를 사용한 HLE(Humanity’s Last Exam)에서 99.44%를 기록했다고 주장했지만, 공개 모델은 Qwen2.5-7B-Instruct 기반이고 웹사이트에서 제공하는 모델은 DeepSeek라는 의혹이 담겼다. ...

2026년 7월 19일 · 988 단어 · gnosyslambda