“모더레이션”은 한 가지처럼 들려요. 컴패니언 앱에서는 최소 네 가지이고, 서로 다른 속도로 작동하며 서로 다른 사람이 관여해요.
네 개의 층

층이 올라갈수록 보는 콘텐츠는 적어지지만, 더 자세히 봐요.
1. 실시간 필터. 내가 보내는 모든 메시지와 모델이 쓰는 모든 답은 화면에 나타나기 전에 자동 분류기의 검사를 받을 수 있어요. 금지된 범주, 즉 미성년자와 관련된 것, 특정 폭력적 콘텐츠, 자해 신호를 잡아서 메시지를 막거나, 답을 누그러뜨리거나, 경고를 보여 줘요. 거절 메시지와 위기 안내 카드가 여기서 나와요. 콘텐츠 필터에서 필터가 왜 장면 도중에 작동하는지 설명해요.
2. 대화 단위 표시. 이와 별개로 시스템이 대화 전체나 계정을 패턴으로 점수화할 수 있어요. 필터를 우회하려는 반복 시도, 괴롭힘, 미성년자가 성인용 앱을 쓰는 징후 같은 거예요. 표시는 처벌이 아니에요. 사람이 볼 수도 있다는 메모예요.
3. 사람 검토. 신뢰 및 안전 담당 직원, 종종 외주 업체 직원이 표시된 대화, 이용자 신고, 이의 제기의 일부를 검토해요. 일부 회사는 품질 확인이나 모델 학습을 위해 일반 대화도 표본 추출해요. “서비스 개선을 위해”나 “약관 집행을 위해” 같은 표현으로 개인정보 처리방침이 설명하는 층이에요.
4. 법적 요청. 법원, 경찰, 규제 당국은 법적 명령으로 데이터를 요청할 수 있어요. 회사는 자체 정책과 현지 법에 따라 대응해요.
사람이 보게 되는 보통의 계기
| 계기 | 이유 |
|---|---|
| 미성년자가 관련된 콘텐츠 | 대부분의 나라에서 법적 의무, 이후 당국에 신고되는 경우가 많음 |
| 자해나 자살 신호 | 미국 여러 주에서 이제 법으로 요구하는 위기 대응 프로토콜 |
| 실제 사람에 대한 위협 | 현실에서 해를 입힐 가능성 |
| 내가 직접 한 신고나 문의 | 내가 누군가에게 봐 달라고 요청한 것 |
| 필터 우회 반복 시도 | 이용약관 집행 |
| 무작위 품질 표본 추출 | 정책이 허용한다면 제품 개선 |
새 법이 더하는 것
2025년 뉴욕을 시작으로 2026년 캘리포니아까지, 미국의 컴패니언 챗봇 법은 앱이 자살 생각과 자해 표현을 감지해서 위기 지원 서비스로 안내하도록 요구해요. 캘리포니아는 회사가 프로토콜을 보고하도록도 요구해요. 실제로는 가장 민감한 대화에 대한 자동 모니터링이 줄지 않고 늘어난다는 뜻이에요. 자세한 내용은 미국의 AI 컴패니언 관련 법에 있어요.
이걸 정책에서 읽는 법
개인정보 처리방침과 약관에서 이런 말을 찾으세요.
- “검토”, “모더레이션”, “사람” - 사람이 대화를 읽는지, 이유가 무엇인지예요.
- “외주 업체”나 “서비스 제공업체” - 검토자가 다른 회사 소속인지예요.
- “개선”, “학습” - 일반 채팅도 표본 추출되는지예요.
- “수사 기관”, “법적 절차”, “법원 명령” - 데이터가 넘어가는 때가 언제인지, 법원 명령이 필요한지예요.
꼼꼼한 정책은 계기를 명시하고 검토자가 필요할 때만 대화를 본다고 말해요. 직원이 “모든 업무 목적을 위해 모든 콘텐츠”에 접근할 수 있게 하는 모호한 정책도 뭔가를 알려 줘요. 문서의 나머지는 네 가지 개인정보 점검에서 다뤄요.
실용적인 결론
- 검토자가 읽을 수도 있다고 생각하고 쓰세요. 드문 경우지만 읽는 사람이 있을 테니까요.
- 다른 사람의 신원을 알 수 있는 정보는 채팅에 넣지 마세요. 특히 노골적인 장면에서요. 표시된 대화를 읽는 검토자는 그것도 봐요.
- 허구 속에서 필터가 잘못 작동하면 캐릭터 밖에서 메모를 남기면 보통 해결돼요. 캐릭터로서 다투면 표시가 더 늘 수 있어요.
- 누가 내 채팅을 읽을 수 있는지가 무엇보다 중요하다면, 다른 누구도 읽을 수 없는 유일한 구성은 내 컴퓨터에서 돌아가는 컴패니언이에요. AI 컴패니언을 로컬에서 돌리기를 참고하세요.
모더레이션은 감시와 같지 않아요. 대부분의 대화는 자동 필터 너머를 보는 사람도, 무언가도 없어요. 하지만 예외를 정하는 건 앱의 다정함이 아니라 정책이에요. 필요해지기 전에 알아 둘 만해요.