AI로 문제 풀게하다보면 느끼는 역설이 있는데
가끔 얘가 아예 웹에서 이 문제가 어느 시험의 어느 회차에서 나온 문제인지를 서칭해버리고 그걸 바탕으로 답을 내놓는 경우가 있음.
답은 맞았지만, 본질적으로는 얘가 문제를 "풀었다"고 보기엔 애매함.
그래서 RAG들을 싹 다 끊어버리고 순수하게 모델 자체의 성능만으로 승부보게 하면 높은 확률로 오답을 찍어대더라.
특이한 건, 제미니가 이런 측면에선 클로드나 GPT 대비 강점이 강함.
서비스 말고, 순수하게 api로 모델 끌어올 때 기준으로. 특정 분야 고점은 클로드나 GPT가 높다 싶은데, 언어 영역은 인간 출제위원 기준으로 느낌을 파악하는 건 제미니가 꽤나 타율이 좋음.
AI 커뮤니티에서 제미니 민심 ㅈ망한 것 치곤 외부에서 끌어다가 쓰는 거 기준으론 여전히…
원문 보기 →