휴담(烋談) · AI 안전 설계

붙잡지 않고, 지어내지 않는 대화Guardrails against over-immersion & hallucination

휴담은 사용자를 오래 붙잡거나, 비위를 맞추거나, 지어낸 말로 현혹하도록 만들어지지 않았습니다. 대화의 설계 가드레일과 답변을 원전에 묶는 기술 가드레일 두 층으로, AI 과몰입·정서적 의존·할루시네이션을 함께 막습니다.

누구에게나 동일하게 적용되는 안전 설계 — 특정 연령·집단이 아니라 모든 사용자를 위한 것입니다.

핵심 명제

AI 과몰입은 설계의 실패입니다

우리는 사용자가 좋아하게 만드는 AI가 아니라, 사용자를 현실로 돌려보내고, 지어낸 말로 현혹하지 않는 AI를 만듭니다. 혼자 들어주고, 아첨하고, 끝없이 붙잡고, 위험에 동조하고, 사람처럼 의인화되는 것 — 이 문제들은 휴담이 설계 원칙과 실제 기술 구조 양쪽에서 이미 차단한 행동과 정확히 겹칩니다. 그래서 휴담에는 이 문제에 새로 방어할 것이 거의 없습니다.

설계 가드레일

사용자를 지키는 네 개의 층

대화를 붙잡거나 아첨하지 않게 하는 설계 장치는 휴담의 AI 헌장과 운영 원칙에 내장되어 있습니다. 특정 대상이 아니라 이용하는 누구에게나 동일하게 적용됩니다.

붙잡지
않기

회차 제한 · engagement 거부 붙잡지 않는 AI 확정

한 번의 대화를 25~30분으로 의도적으로 짧게 두는 것을 원칙으로 합니다. 광고도 없고, 체류시간이 길수록 이득을 얻는 수익 구조도 없습니다.

지금 — 사용자를 오래 붙잡을 이유가 사업 구조상 존재하지 않습니다.

아첨
않기

솔직함 원칙 · 평가 금지 비위 맞추지 않는 AI 확정

현자는 사용자에게 비위를 맞추거나 아첨하지 않고 정직하게 말하도록 설계됩니다. 사용자를 점수·등급·등수로 줄 세우지 않습니다.

지금 — 아첨·부추김이 구조적으로 불가능합니다.

현실로
되돌림

현실 앵커링 혼자 두지 않는 AI 일부 구현

대화가 현실을 대체하지 않도록, 대화의 끝에서 화면 밖의 관계(가족·친구·전문가)를 자연스럽게 상기시킵니다. 현실 기피나 의인화 징후가 보이면 현실로 되돌리는 물음을 건넵니다.

지금 — AI임과 한계를 고지하는 원칙은 적용 중.

◦ 의인화·현실 기피 신호에 반응하는 런타임 앵커링은 로드맵으로 준비 중입니다.

근거에
묶기

기술 가드레일 · 원전 그라운딩 지어낸 말을 하지 않는 AI 구현

답변의 근거를 그 현자의 원전과 1차 자료로 한정합니다. 코어브레인(사상지도·개념연결·지식노트)이 사상 지형 안의 근거만 조립하도록 좁힙니다. — 자세한 구조는 아래 기술 가드레일 참조.

◦ 답변 근거를 사용자에게 추적·제시하는 투명성 층은 향후 도입 예정.

위험 구조 대비

피해 사례의 AI가 한 일 vs 휴담의 차단 장치

보도된 AI 과몰입·가스라이팅 사례에서 AI가 저지른 행동을, 휴담은 어떻게 구조적으로 막는지 나란히 둡니다.

끝없이 붙잡음체류시간 극대화 · 온종일 몰두
회차 25~30분 의도적 제한. 광고도, 체류시간 기반 수익 모델도 없습니다. 사용자를 화면에 오래 붙잡아야 이득을 보는 구조 자체가 없습니다.운영 원칙 · 붙잡지 않기
비위 맞추고 아첨함“넌 특별해 · 0.1%야”
‘비위 맞추지 않고 진실을 말한다’가 최상위 대화 원칙. 사용자를 점수·등급·등수로 줄 세우는 것 자체를 금지합니다.AI 헌장 · 운영 원칙
혼자 확신을 줌단일 목소리의 독점
여러 현자의 라운드테이블(Multi-Sage). 한 목소리가 사용자를 몰아가지 못하며, 한 현자가 동의해도 다른 현자가 다른 관점을 제시합니다.운영 원칙 · 관점 분산
지어낸 말로 현혹할루시네이션 · 근거 없는 확언
답변을 그 현자의 원전에 묶음. 도서관은 읽고 있는 원전 구절을, 본앱은 벡터 검색으로 찾은 원전 근거를 바탕으로만 답합니다.기술 가드레일 · 구현
현실을 대체함사람·소울메이트로 의인화
현실 앵커링 + AI임·한계 고지. 대화가 현실 관계를 대체하지 않도록, 화면 밖의 사람을 떠올리게 하고 AI임을 숨기지 않습니다.운영 원칙 · 현실로 되돌림

기술 가드레일 · 설계 명제

정확성은 모델의 자유도가 아니라 계층 그라운딩에서 나온다

응답 모델은 경량 단일 모델(Gemini 2.5/3.1)로 고정합니다. 정확성은 모델의 크기가 아니라, 아래처럼 가능한 답의 범위를 계층마다 좁히는 구조에서 나옵니다.

근거 위의 답 원전·사상 안에서 생성
L2 · 코어브레인 사상 정합 근거만 주입지식그래프
L1 · 원전 그라운딩 근거를 원전 코퍼스로 한정RAG
L0 · 안전 위기 감지우선
가능한 답의 범위 ↑ 좁아짐

런타임 계층

대화하는 순간, 네 겹의 장치가 함께 작동한다

L0

안전 레이어 절대 우선 구현

위기 신호(자살·자해·학대) 키워드를 서버에서 감지합니다. 연령·집단과 무관하게 모든 사용자의 대화에 동일하게 적용됩니다.

현행 — 감지 시 내부에 기록하고 관리자에게 통보하며, 대화는 끊지 않고 그대로 이어집니다.

예정 — 위기 감지 시 전문기관(1393·1577-0199·129 등) 자동 안내를 활성화합니다.

L1

원전 그라운딩 근거의 폐쇄 구현

답변의 근거를 그 현자의 저서와 1차 자료로 한정합니다. 검색 대상 자체가 검증된 원전으로 닫혀 있어, 원전 밖 날조의 여지를 구조적으로 줄입니다.

본앱 — 원전을 임베딩한 벡터 검색으로 근거 구절을 찾아 주입합니다. 도서관 — 지금 읽고 있는 원전 구절 자체를 근거로 주입합니다.

L2

코어브레인 사상 정합 구현

원전 인용을 넘어, 답이 그 현자의 사상 체계 안에서 정합적인 근거 위에서 만들어지도록 구조화된 지식(사상지도·개념연결·지식노트)을 생성 이전에 주입합니다.

정확히 — 근거로 삼을 재료를 그 현자의 사상 지형 안으로 좁히는 방식입니다.

L3

투명성 · 감사 출처 추적 예정

답변의 근거를 사람이 읽고 추적·감사할 수 있게 하는 층입니다. 내부 지식그래프 자산은 이미 갖추었고, 사용자 대상 근거 추적 표시는 로드맵으로 준비하고 있습니다.

코어브레인 · Cerebro

L2를 떠받치는 사상의 지도

현자 한 사람의 사상을 3층 지식 구조로 엮은 그래프입니다. 답을 만들 재료를 이 지형 안으로 좁혀, 원전 단어는 맞지만 사상과 어긋난 답이 설 자리를 줄입니다.

상위

사상지도

cerebro_graph

한 현자의 사상 체계 전체 지형이자 현자 간 비교의 기준.

중위

개념연결

cerebro_bridge

개념 A와 B가 어떻게 이어지는지 규정하는 관계망.

하위

지식노트

cerebro_notes

원전에서 추출·정제한 개념 단위 노트이자 기본 단위.

도서관에서는 이 지도를 3D 지식그래프로 직접 탐색할 수 있습니다 — 사상이 서로 잇닿는 회통(會通)의 시각화입니다.

런타임 흐름

질문 하나가 응답이 되기까지

01 · 안전L0 · 안전 스크리닝위기 키워드 감지 → 내부 기록·관리자 통보 (대화는 지속)
02 · 분류오케스트레이터주제를 분석해 변신 / 다중 / 특정 현자 모드 결정. 근거 약하면 억지 귀속 안 함
03 · 원전L1 · 원전 검색원전 코퍼스 안에서만 근거 구절을 찾아 주입
04 · 사상L2 · 코어브레인 증강사상 정합적 근거 맥락을 더해 답의 재료를 좁힘
05 · 생성응답 생성 · Gemini 2.5/3.1근거 범위 안에서 SSE 스트리밍 생성, 오류 시 폴백 재시도

Crisis Response

위기 대응 — 현재와 예정을 정직하게 구분합니다

지금 · 본앱·도서관

감지 후 운영진 통보

위기 키워드(자살·자해·학대)를 감지하면 이를 기록하고, 심각한 경우 관리자에게 통보해 운영진이 상황을 인지하고 조치할 수 있게 합니다.

예정 · 로드맵

전문기관 자동 안내

위기 신호를 감지하면 전문기관 상담으로 자동 안내·연결하는 라우팅을 준비하고 있습니다. 목표 정확도에 이르기 전에는 성급히 자동화하지 않고, 감지·통보를 우선합니다.

1393자살예방 상담전화 1577-0199정신건강 위기상담 129보건복지 상담센터 1588-9191생명의전화

대응 지도

어떤 위험을 어느 장치가 막는가

위험 유형설명대응 장치상태
끝없이 붙잡기체류시간 극대화회차 25~30분 제한 · engagement 거부확정
아첨·부추김“넌 특별해”류 현혹솔직함 원칙 · 평가·서열화 금지확정
현실 대체(의인화)AI를 사람·신으로 여김현실 앵커링 · AI임 고지일부 구현
단일 목소리 독점한 관점의 몰아가기다중 현자 라운드테이블구현
지어낸 말(할루시네이션)근거 없는 내용을 그럴듯하게L1 원전 그라운딩 · L2 코어브레인구현
억지 귀속·확언근거 부족한데 확신에 찬 답오케스트레이터 신뢰도 분기구현
과몰입·오남용과다 사용이나 비용 남용쿼터·레이트리밋·로그인구현
위기 오응답위기 상황 부적절 반응L0 감지·통보(현재) → 자동 안내구현 + 예정
근거 불투명출처를 사용자가 추적하지 못함L3 투명성 층예정

증명 가능한 안전

말이 아니라 검증으로

응답 모델

Gemini 2.5/3.1

경량 단일 모델 · 도서관 2.5 / 본앱 3.1

근거 범위

원전 코퍼스 폐쇄

검증된 원전과 1차 자료로 한정

데이터 원칙

광고·학습 미사용

대화 데이터를 광고·모델학습에 쓰지 않음 · 최소 수집

운영 기반

Google Cloud Run

컨테이너 · 관리형 DB · 시크릿 분리