ChatGPT가 위험 신호에는 민감하고 긍정적 평가는 더 조심스럽게 하는 경향이 있는지 궁금합니다

ChatGPT 같은 LLM이 건강 질문에서는 위험 가능성을 놓치지 않기 위해 경고를 비교적 쉽게 붙이는 반면, 사용자에게 긍정적인 평가를 할 때는 과잉확신을 피하려고 더 조심스럽게 답하는 비대칭이 실제로 나타날 수 있나요?

예를 들어 두통은 긴장성 두통 가능성이 높아 보여도 “심하면 진료가 필요하다”는 경고를 붙이고, 반대로 여러 장기기억 사례가 있어 기억력이 좋은 편으로 보여도 “확정은 어렵다”는 단서를 더 많이 붙이는 식입니다. 이런 현상이 현재 LLM의 안전정렬이나 보수적 응답 성향 때문에 생길 수 있는지 궁금합니다.

3개의 답변이 있어요!

  • 안녕하세요. 이수민 전문가입니다.

    네, 그런 비대칭은 실제로 나타날 수 있어요.

    LLM은 사람이 여러 답변 중 더 나은 쪽을 고르는 방식으로 다듬어지는데, 이 과정에서 두 종류의 실수가 다르게 평가돼요. 심각한 병의 가능성을 놓친 답은 크게 감점되지만, 괜한 경고를 하나 더 붙인 답은 거의 감점되지 않아요. 그래서 모델은 건강 질문에서 경고를 붙이는 쪽을 안전한 기본값으로 배워요.

    긍정적인 평가를 조심스럽게 하는 건 아첨을 줄이려는 조정에서 와요. 초기 모델이 사용자 말에 무조건 맞장구친다는 지적을 받으면서, 근거 없이 칭찬하거나 단정하지 않도록 따로 학습시켜 왔어요.

    두 사례는 논리적으로도 조금 달라요. 두통은 흔한 원인일 확률이 높아도 드물게 위험한 원인이 있고, 놓쳤을 때 대가가 커서 경고할 이유가 있어요. 기억력은 본인이 떠올린 사례만으로 판단한 거라 검사 결과보다 근거가 약해서 단서가 붙는 게 자연스러워요.

    "가능성을 퍼센트로 말해줘"처럼 물어보면, 두루뭉술한 단서 대신 모델이 판단한 정도를 숫자로 확인할 수 있어요 :)

  • 안녕하세요. 김재훈 전문가입니다.

    LLM은 안전 정렬 과정에서 의학적 위험 미고지 시 발생하는 손실에 극도로 큰 벌점을 받도록 학습되어 낮은 확률의 위험 신호에도 보수적인 주의 문구를 적극적으로 부과합니다. 반면 개인의 특성이나 능력을 확정하여 평가할 때 발생하는 과잉 확신 및 왜곡 역시 가이드라인상 주요 감점 요소이므로 긍정적 판단에는 제한적인 데이터와 불확실성을 들어 한계점을 명시합니다 결과적으로 위험 탐지에서는 감도를 극대화하고 긍정적 평가에서는 정밀도와 신중함을 기하는 응답의 구조적 비대칭성이 뚜렷하게 나타납니다

  • 안녕하세요. 강세훈 전문가입니다.

    그런 비대칭이 실제로 나타날 수 있습니다.

    LLM은 안전 정렬로 인해 위험 신호에는 민감하게 경고를 하지만

    긍정적 평가나 확정적 판단에는 과잉확산을 피하려고 조심스럽게 답한답니다.

    결론은 개발자들의 의지입니다.