← soulhn.github.io

Log

만들고 배운 것을 기록합니다.

· 학습 로그

환각 — 빈칸을 못 견디는 학생

모델이 근거 없는 내용을 사실처럼 자신 있게 생성하는 현상. 제거가 아니라 관리의 대상이다.

#용어#RAG

한 줄 정의

환각(hallucination)은 모델이 근거 없는 내용을 사실처럼 자신 있게 생성하는 현상이다. LLM은 “가장 그럴듯한 다음 토큰”을 뽑는 확률 기계라서, “모른다”가 기본으로 내장되어 있지 않다.

내 말로

빈칸을 못 견디는 학생. 암기 시험에서 모르는 문제를 만나면 백지 대신 그럴듯한 답을 지어낸다. 그럴듯함과 사실임은 다른 축인데, 모델은 그럴듯함만 배웠기 때문이다. RAG로 시험을 오픈북으로 바꾸는 이유가 이 학생 때문이지만, 오픈북에서도 발췌를 멋대로 요약하는 환각은 남는다.

오개념 주의

“환각은 버그라서 곧 완전히 고쳐진다” — 아니다. 확률 생성의 본질적 성질이라 제거가 아니라 관리의 대상이다. “RAG를 쓰면 환각이 사라진다”도 반만 맞다. 크게 줄지만, 근거를 왜곡하는 환각은 남는다.

어디서 만났나

Build 03 — ask-soulhn의 환각 가드는 두 겹이다. 검색 단계에서 최고 유사도가 0.35 미만이면 모델을 호출조차 하지 않고 “제 공개 기록에는 없는 내용입니다”로 답하고(구조적 가드), 그 위에 발췌 안에서만 답하라는 시스템 프롬프트 규칙을 얹었다(지시적 가드). 프롬프트는 부탁이고 구조는 보장이라는 걸 여기서 배웠다. Build 05의 검수 게이트도 같은 사상이고, 교육 콘텐츠에서 환각이 특히 위험한 이유도 그때 실감했다 — 일반 챗봇의 환각은 틀린 답 하나지만, 검수 없는 교육 콘텐츠의 환각은 오개념을 대량 복제한다.

더 파볼 것

  • 환각 측정 — 근거 충실도(faithfulness)를 어떻게 채점하나
  • 출처 표기를 강제하면 환각이 얼마나 줄어드나
  • AI 리터러시 교육에서 환각을 어떻게 가르칠 것인가 — 양성과정 교안 후보

퀴즈

읽은 내용, 세 문제로 확인해보세요.

1. 환각이 생기는 근본 이유는?

2. ask-soulhn의 '구조적' 환각 가드는 무엇인가?

3. RAG와 환각의 관계로 옳은 것은?