거짓말 하는가?

환각이 반복해서 일어나는 이유는
현재의 평가방식에서 잘못된 인센티브가 설정 되었기 떄문이다.

평가 자체가 직접적으로 환각을 야기하지는 않지만, 대부분의 평가는 불확실성에 대한 솔직함보다 추측을 장려하는 방식으로 모델 성능을 측정한다.
평가 자체가 직접적으로 환각을 야기하지는 않지만, 대부분의 평가는 불확실성에 대한 솔직함보다 추측을 장려하는 방식으로 모델 성능을 측정한다.
<
1. 이를 객관식 시험이라고 생각해보자.
0점
2. 하지만...
하나의 정답만 있는 질문의 경우 ‘정확한 응답’, ‘오류’, ‘기권’(모델이 추측의 위험을 감수하지 않음) 의 세 범주로 응답을 고려할 수 있다.

기권은 겸손의 일환이며, 겸손은 OpenAi가 추구하는 핵심 가치 중 하나이다.
대부분의 평가에서 점수는 정확도를 기준으로 모델의 우선순위와 순위를 정하지만, 오류는 기권보다 더 나쁘다.
틀릴지도 모르는 정보를 자신 있게 제공하는 것보다 불확실성을 표명하거나 명확한 확인을 요청하는 것이 더 낫다.
그럼에도 불구하고, 정확도만을 기준으로 하는 점수가 리더보드 및 모델 카드의 중심이기 떄문에 개발자들은 기권하기보다는 답을 추측하는 모델을 구축하게 된다.
모델이 더 발전하더라도 여전히 환각을 일으키며
불확실성을 인정하는 대신
잘못된 답변을 자신 있게 제공하는 이유 중 하나가 이것이다.
LLM
거짓말
하는가
CCOPYRIGHT © 배준서. ALL RIGHTS RESERVED.
9LUCAGON@GAMIL.COM