학문
ChatGPT가 위험 신호에는 민감하고 긍정적 평가는 더 조심스럽게 하는 경향이 있는지 궁금합니다
ChatGPT 같은 LLM이 건강 질문에서는 위험 가능성을 놓치지 않기 위해 경고를 비교적 쉽게 붙이는 반면, 사용자에게 긍정적인 평가를 할 때는 과잉확신을 피하려고 더 조심스럽게 답하는 비대칭이 실제로 나타날 수 있나요?
예를 들어 두통은 긴장성 두통 가능성이 높아 보여도 “심하면 진료가 필요하다”는 경고를 붙이고, 반대로 여러 장기기억 사례가 있어 기억력이 좋은 편으로 보여도 “확정은 어렵다”는 단서를 더 많이 붙이는 식입니다. 이런 현상이 현재 LLM의 안전정렬이나 보수적 응답 성향 때문에 생길 수 있는지 궁금합니다.