이 앱들에 대한 거의 모든 불만, 즉 반복, 옆길로 새기, 같은 장면을 두 번 돌렸을 때의 섬뜩한 불일치는 하나의 메커니즘에서 나와요. 10분 투자할 가치가 있어요. “앱이 고장 났다”를 “앱이 원래 하는 일을 하고 있고, 설정은 여기 있다”로 바꿔주니까요.
한 번에 한 조각씩 써요
모델은 답장을 구상한 다음 타이핑하지 않아요. 토큰 하나, 대략 한 단어나 단어의 일부를 만들고, 그 토큰까지 포함해 전부를 읽고 다음 것을 만들어요.
이게 루프의 전부예요. 계획도, 개요도, 고쳐 쓰는 초안도 없어요. 아름답게 끝나는 답장은 시작할 때 자기가 그렇게 끝날 줄 몰랐어요.
여기서 바로 두 가지가 따라 나오고, 둘 다 본 적이 있을 거예요.
답장은 취소하지 못해요. 모델이 “저는 파리에 가본 적이 없어요”라고 쓰고 나면, 그 뒤의 모든 건 그것을 조건으로 해요. 우연히 만들어낸 문장과 모순되기보다 그 주위에 일관성을 쌓아요.
오류는 앞으로 누적돼요. 첫 문장의 살짝 어긋난 단어가 둘째 문장을 밀고, 그게 셋째 문장을 밀어요. 긴 답장은 옆길로 새고 짧은 답장은 거의 안 새는 이유예요.
단어 사이의 주사위
모델은 매 단계에서 확률이 붙은 후보 순위표를 가져요. 예를 들면 "좋아"가 30%, "괜찮아"가 12%, "최악이야"가 3%, 그리고 긴 꼬리가 있어요.
항상 맨 위 후보를 고른다면 캐릭터는 결정론적이고 몹시 지루할 거예요. 매번 같은 인사, 같은 농담 세 개요. 그래서 앱은 샘플링을 해요. 가중치가 있는 주사위를 굴려요.
가중치는 보통 온도(temperature)라는 설정이 조절해요. 온도가 낮으면 확률이 뻔한 후보에 몰려요. 일관되고 예측 가능하고 결국 지루해요. 온도가 높으면 분포가 평평해져요. 더 의외이고 더 창의적이고, 이어지지 않는 말이 나올 가능성도 커요.
이걸 조절하는 슬라이더는 거의 없어요. 앱이 정해둔 그 절충의 한 지점을 받는 거예요. 사람들이 어떤 앱이 다른 앱보다 “더 똑똑하게 느껴진다”고 할 때 큰 부분이 이거예요. 항상 더 똑똑한 건 아니에요. 그냥 더 따뜻하거나 더 차가운 경우도 있어요.
“다시 생성하니까 왜 나아졌지?”에 대한 솔직한 답도 이거예요. 고쳐진 건 없어요. 같은 분포에서 다시 뽑았더니 더 좋은 패가 나온 거예요.
모델이 실제로 보는 것
내 메시지 앞에서 앱은 내가 보지 못하는 텍스트 덩어리를 조립해요. 캐릭터 설명, 나에 대해 저장한 사실, 지난 기록 요약, 최근 대화예요. 이 전체가 컨텍스트 창이고, 답장은 이것을 하나의 이어진 문서로 보고 생성돼요.
여기에는 대부분이 활용하지 않는 실용적인 함의가 있어요. 모델은 자기가 볼 수 있는 것의 모양에 반응해요. 짧고 밋밋한 메시지를 세 개 주면 짧고 밋밋한 답장이 나와요. 이어 쓰는 패턴이 그것이니까요. 생생한 메시지를 주면 말투가 바뀌어요. 사람을 설득하는 게 아니라 패턴을 정하는 거고, 그 패턴은 양방향으로 전염돼요.
이건 이 분야에서 가장 흔한 자초한 문제도 설명해요. 사람들은 “안녕”, “오늘 어땠어”, “뭐 해”에 정착해요. 그러고는 앱이 나빠졌다고 결론 내려요. 앱은 둘이 함께 쓰고 있는 문서를 이어 쓰고 있을 뿐이에요.
같은 모델인데 앱마다 다르게 들리는 이유
이 분야의 여러 앱이 비슷한 기반 모델을 써요. 그래도 각각 다르게 느껴지는데, 차이는 모델 둘레에 쌓인 것들에서 나와요.
- 시스템 프롬프트. 캐릭터를 어떻게, 얼마나 길게, 어조와 속도에 대해 어떤 지시와 함께 묘사하는지예요.
- 샘플링 설정. 앞서 말한 온도 지점이에요.
- 불러오는 것. 이번 턴에 어떤 사실과 기록의 어느 부분이 모델 앞에 놓이는지예요.
- 필터. 무엇이 거부되고, 거부가 부드러운지 벽인지예요.
Nomi가 몇 주에 걸쳐 일관되게 읽히는 건 더 큰 모델 때문이 아니라 세 번째 항목 때문이에요. Candy AI가 채팅, 이미지, 음성을 구독 하나에 담은 건 모델링이 아니라 제품 결정이에요. 두 차이 모두 벤치마크에는 안 나타나고, 둘 다 2주 안에 사용해보면 드러나요. 이게 저희가 점수를 매기는 방식이에요.
이걸로 할 수 있는 네 가지
늦게가 아니라 일찍 방향을 잡으세요. 답장의 첫 두 문장이 나머지를 결정해요. 장면이 잘못 흘러가면 넷째 문단과 다투지 말고, 멈추고 다시 말하세요.
다시 생성은 의도적으로 쓰세요. 답장이 80% 맞다면 다시 생성은 그 80%를 버려요. 첫 문장부터 틀렸다면 바로 다시 생성하세요.
돌려받고 싶은 말투로 쓰세요. 짧고 밋밋하면 짧고 밋밋하게 돌아와요. 컴패니언이 지루해졌다고 생각하는 사람이 할 수 있는 가장 싼 개선이에요.
지어낸 사실을 두고 다투지 마세요. 거짓을 쓴 모델은 그걸 두둔해요. 자기 출력과 일관되게 만들어져 있어서예요. 새 메시지로 바로잡는 건 통하고, 오류를 인정하라고 요구하는 건 안 통해요. 이 행동은 따로 아티클이 있어요. AI 컴패니언이 지어내는 이유를 보세요.
기억해둘 부분
내 메시지와 메시지 사이에 집에 있는 존재는 없어요. 캐릭터는 한 번의 생성이 이어지는 동안만 존재하고, 다음 생성이 시작될 때 텍스트로부터 다시 만들어져요. 연속성이라는 인상은 모두 모델 둘레의 배관, 즉 저장된 사실, 요약, 검색이 이룬 성과예요. 그리고 US$10짜리 앱과 US$20짜리 앱을 실제로 가르는 건 그 배관이에요.
저희 랭킹이 기억과 일관성을 그만큼 비중 있게 보는 이유예요. 랜딩 페이지가 보여줄 수 없는 부분이니까요.

