일전에 쓴 글에서...
치명적인 문제가 드러나기 전에는 신뢰성의 의문을 갖기는 무리라고 했던 적이 있습니다.
그런데 아스트라의 점수가 이상하게 나오다 보니...
결국 찾아 내는 사람들이 생겼네요.
https://arxiv.org/pdf/2608.04975
이런 벤치 자체의 결함이 있는 것을 찾아 내거나
보다 객관성을 향상시킨 인덱스가 되기 위해 AAII 측은 지나치게 신중한 태도를 벗어나
과감한 결단과 벤치간의 점수 반영 비중의 변화 등이 필요한 것 같습니다.
특히 과거에 유용했었을지라도
현재 단계에 적합하지 않을 뿐더러 점수의 평균을 올리는 옛 벤치를 과감히 털어내는 것이 좋아 보입니다.
물론 현재도 그렇게 하고 있지만... 모델의 성능 향상이 더 빠른 상태이니 말입니다.
https://epoch.ai/e…
원문 보기 →