휴담(烋談) · AI 안전 설계
휴담은 사용자를 오래 붙잡거나, 비위를 맞추거나, 지어낸 말로 현혹하도록 만들어지지 않았습니다. 대화의 설계 가드레일과 답변을 원전에 묶는 기술 가드레일 두 층으로, AI 과몰입·정서적 의존·할루시네이션을 함께 막습니다.
烋 누구에게나 동일하게 적용되는 안전 설계 — 특정 연령·집단이 아니라 모든 사용자를 위한 것입니다.핵심 명제
우리는 사용자가 좋아하게 만드는 AI가 아니라, 사용자를 현실로 돌려보내고, 지어낸 말로 현혹하지 않는 AI를 만듭니다. 혼자 들어주고, 아첨하고, 끝없이 붙잡고, 위험에 동조하고, 사람처럼 의인화되는 것 — 이 문제들은 휴담이 설계 원칙과 실제 기술 구조 양쪽에서 이미 차단한 행동과 정확히 겹칩니다. 그래서 휴담에는 이 문제에 새로 방어할 것이 거의 없습니다.
설계 가드레일
대화를 붙잡거나 아첨하지 않게 하는 설계 장치는 휴담의 AI 헌장과 운영 원칙에 내장되어 있습니다. 특정 대상이 아니라 이용하는 누구에게나 동일하게 적용됩니다.
한 번의 대화를 25~30분으로 의도적으로 짧게 두는 것을 원칙으로 합니다. 광고도 없고, 체류시간이 길수록 이득을 얻는 수익 구조도 없습니다.
지금 — 사용자를 오래 붙잡을 이유가 사업 구조상 존재하지 않습니다.
현자는 사용자에게 비위를 맞추거나 아첨하지 않고 정직하게 말하도록 설계됩니다. 사용자를 점수·등급·등수로 줄 세우지 않습니다.
지금 — 아첨·부추김이 구조적으로 불가능합니다.
대화가 현실을 대체하지 않도록, 대화의 끝에서 화면 밖의 관계(가족·친구·전문가)를 자연스럽게 상기시킵니다. 현실 기피나 의인화 징후가 보이면 현실로 되돌리는 물음을 건넵니다.
지금 — AI임과 한계를 고지하는 원칙은 적용 중.
◦ 의인화·현실 기피 신호에 반응하는 런타임 앵커링은 로드맵으로 준비 중입니다.
답변의 근거를 그 현자의 원전과 1차 자료로 한정합니다. 코어브레인(사상지도·개념연결·지식노트)이 사상 지형 안의 근거만 조립하도록 좁힙니다. — 자세한 구조는 아래 기술 가드레일 참조.
◦ 답변 근거를 사용자에게 추적·제시하는 투명성 층은 향후 도입 예정.
위험 구조 대비
보도된 AI 과몰입·가스라이팅 사례에서 AI가 저지른 행동을, 휴담은 어떻게 구조적으로 막는지 나란히 둡니다.
기술 가드레일 · 설계 명제
응답 모델은 경량 단일 모델(Gemini 2.5/3.1)로 고정합니다. 정확성은 모델의 크기가 아니라, 아래처럼 가능한 답의 범위를 계층마다 좁히는 구조에서 나옵니다.
런타임 계층
위기 신호(자살·자해·학대) 키워드를 서버에서 감지합니다. 연령·집단과 무관하게 모든 사용자의 대화에 동일하게 적용됩니다.
현행 — 감지 시 내부에 기록하고 관리자에게 통보하며, 대화는 끊지 않고 그대로 이어집니다.
▸ 예정 — 위기 감지 시 전문기관(1393·1577-0199·129 등) 자동 안내를 활성화합니다.
답변의 근거를 그 현자의 저서와 1차 자료로 한정합니다. 검색 대상 자체가 검증된 원전으로 닫혀 있어, 원전 밖 날조의 여지를 구조적으로 줄입니다.
본앱 — 원전을 임베딩한 벡터 검색으로 근거 구절을 찾아 주입합니다. 도서관 — 지금 읽고 있는 원전 구절 자체를 근거로 주입합니다.
원전 인용을 넘어, 답이 그 현자의 사상 체계 안에서 정합적인 근거 위에서 만들어지도록 구조화된 지식(사상지도·개념연결·지식노트)을 생성 이전에 주입합니다.
정확히 — 근거로 삼을 재료를 그 현자의 사상 지형 안으로 좁히는 방식입니다.
답변의 근거를 사람이 읽고 추적·감사할 수 있게 하는 층입니다. 내부 지식그래프 자산은 이미 갖추었고, 사용자 대상 근거 추적 표시는 로드맵으로 준비하고 있습니다.
코어브레인 · Cerebro
현자 한 사람의 사상을 3층 지식 구조로 엮은 그래프입니다. 답을 만들 재료를 이 지형 안으로 좁혀, 원전 단어는 맞지만 사상과 어긋난 답이 설 자리를 줄입니다.
상위
cerebro_graph한 현자의 사상 체계 전체 지형이자 현자 간 비교의 기준.
중위
cerebro_bridge개념 A와 B가 어떻게 이어지는지 규정하는 관계망.
하위
cerebro_notes원전에서 추출·정제한 개념 단위 노트이자 기본 단위.
도서관에서는 이 지도를 3D 지식그래프로 직접 탐색할 수 있습니다 — 사상이 서로 잇닿는 회통(會通)의 시각화입니다.
런타임 흐름
Crisis Response
지금 · 본앱·도서관
위기 키워드(자살·자해·학대)를 감지하면 이를 기록하고, 심각한 경우 관리자에게 통보해 운영진이 상황을 인지하고 조치할 수 있게 합니다.
예정 · 로드맵
위기 신호를 감지하면 전문기관 상담으로 자동 안내·연결하는 라우팅을 준비하고 있습니다. 목표 정확도에 이르기 전에는 성급히 자동화하지 않고, 감지·통보를 우선합니다.
대응 지도
| 위험 유형 | 설명 | 대응 장치 | 상태 |
|---|---|---|---|
| 끝없이 붙잡기 | 체류시간 극대화 | 회차 25~30분 제한 · engagement 거부 | 확정 |
| 아첨·부추김 | “넌 특별해”류 현혹 | 솔직함 원칙 · 평가·서열화 금지 | 확정 |
| 현실 대체(의인화) | AI를 사람·신으로 여김 | 현실 앵커링 · AI임 고지 | 일부 구현 |
| 단일 목소리 독점 | 한 관점의 몰아가기 | 다중 현자 라운드테이블 | 구현 |
| 지어낸 말(할루시네이션) | 근거 없는 내용을 그럴듯하게 | L1 원전 그라운딩 · L2 코어브레인 | 구현 |
| 억지 귀속·확언 | 근거 부족한데 확신에 찬 답 | 오케스트레이터 신뢰도 분기 | 구현 |
| 과몰입·오남용 | 과다 사용이나 비용 남용 | 쿼터·레이트리밋·로그인 | 구현 |
| 위기 오응답 | 위기 상황 부적절 반응 | L0 감지·통보(현재) → 자동 안내 | 구현 + 예정 |
| 근거 불투명 | 출처를 사용자가 추적하지 못함 | L3 투명성 층 | 예정 |
증명 가능한 안전
응답 모델
Gemini 2.5/3.1
경량 단일 모델 · 도서관 2.5 / 본앱 3.1
근거 범위
원전 코퍼스 폐쇄
검증된 원전과 1차 자료로 한정
데이터 원칙
광고·학습 미사용
대화 데이터를 광고·모델학습에 쓰지 않음 · 최소 수집
운영 기반
Google Cloud Run
컨테이너 · 관리형 DB · 시크릿 분리