한 사람이 이렇게 쓴다.
“괜찮습니다. 그냥 조금 힘드네요.”
몇 줄 뒤에 대화는 끝난다.
다른 사람은 같은 관계의 일을 수천 자에 걸쳐 설명한다. 언제 처음 이상하다고 느꼈는지, 상대가 어떤 말을 했는지, 자신은 왜 그 말을 잊지 못하는지까지 적는다.
둘 가운데 누가 더 힘든가.
문장의 길이만으로는 알 수 없다.
그렇다면 단어, 문장 구조, 감정 표현, 이야기의 복잡성을 모두 분석하는 인공지능이라면 알 수 있을까.
이 질문은 이제 학술적인 호기심에 머물지 않는다.
고객센터는 대화에서 불만과 감정 상태를 추정하고, 디지털 헬스 서비스는 언어에서 위험 신호를 찾으려 한다. 상담과 정신건강 영역에서도 사람의 말은 점점 더 분석 가능한 데이터가 되고 있다.
AI가 인간의 감정을 더 잘 읽는다는 말은 이제 꽤 자연스럽게 들린다.
그러나 내가 35만1734개의 관계 서사를 분석하면서 발견한 것은 그 표현을 조금 더 조심해서 사용해야 할 이유였다.

■ 감정의 크기와 이야기의 크기는 거의 함께 움직이지 않았다
올해 PLOS ONE에 발표한 연구에서 나는 온라인 지원 커뮤니티에 남겨진 영어 관계 서사 351,734개를 분석했다.
각 이야기에서 두 가지를 측정했다.
하나는 서사가 얼마나 구조적으로 복잡한가였다.
다른 하나는 언어에 드러난 정서적 강도가 얼마나 큰가였다.
직관적으로 생각하면 감정이 강할수록 이야기도 복잡하고 길어질 것 같다.
실제 데이터는 달랐다.
두 변수의 상관은 r=0.009였다.
사실상 거의 독립적이었다.
사람들은 강한 감정을 짧게 표현하기도 했다.
반대로 비교적 낮은 정서 강도를 매우 복잡한 이야기로 조직하기도 했다.
대부분의 서사는 두 요소가 극단적으로 어긋나지 않는 영역에 있었지만, 그렇지 않은 패턴 역시 반복해서 나타났다.
20,223개의 서사에서는 높은 정서 강도가 상대적으로 제한된 서사 구조와 함께 나타났다. 연구에서는 이를 strategic understatement라고 명명했다.
2,223개의 서사에서는 그 반대 방향의 패턴이 관찰됐다.
8,040개의 서사에서는 높은 정서 강도에 비해 이를 조직하는 서사적 구조가 제한된 ‘collapse’ 형태가 나타났다.
여기서 ‘strategic’이라는 단어를 의식적인 전략으로 읽어서는 안 된다.
이 연구는 개인이 일부러 자신의 감정을 숨겼다고 주장하지 않는다.
오히려 중요한 것은 집단 수준에서 이런 불일치가 우연한 잡음처럼 흩어져 있지 않았다는 점이다.
인간은 감정을 일정한 비율로 번역해 말하지 않았다.
그 어긋남 자체가 인간 표현의 한 부분이었다.
■ AI가 보는 것은 감정이 아니라 감정이 남긴 흔적이다
이 결과를 감정 AI에 적용하면 중요한 구분 하나가 생긴다.
AI가 직접 관찰할 수 있는 것은 사람의 감정 그 자체가 아니다.
문장이다.
목소리다.
표정이다.
행동 기록이다.
그리고 그 흔적들 사이의 통계적 패턴이다.
물론 이것은 매우 유용할 수 있다.
문제는 관측 가능한 신호와 실제 경험을 같은 것으로 취급하는 순간 시작된다.
사람은 고통스러울 때 반드시 고통스럽게 말하지 않는다.
분노했다고 항상 분노의 언어를 쓰지도 않는다.
오랫동안 설명한다고 반드시 더 많이 아픈 것도 아니다.
누군가는 감정이 강할수록 말을 줄인다.
누군가는 설명을 늘려 거리를 만든다.
누군가는 자신이 무엇을 느끼는지 아직 알지 못한 채 말을 시작한다.
이것들은 감정 측정의 오류가 아니다.
인간이 감정을 표현하는 방식 자체일 수 있다.
따라서 “이 AI는 감정을 얼마나 정확하게 읽는가”라는 질문에는 이미 하나의 전제가 들어 있다.
읽어야 할 정답이 어딘가에 안정적으로 존재한다는 전제다.
내 연구가 보여준 데이터는 그 전제를 훨씬 복잡하게 만든다.
■ 인간보다 더 정돈된 AI
더 흥미로운 결과는 인간과 언어모델을 같은 표현 공간에 놓았을 때 나타났다.
연구에서는 RLHF*로 정렬된 하나의 대규모 언어모델에 인간과 대응되는 프롬프트를 제시하고, 동일한 방법으로 서사 복잡성과 정서 강도를 측정했다.
결과는 선명했다.
- * RLHF(Reinforcement Learning from Human Feedback, 인간 피드백을 이용한 강화학습): AI 모델이 사람의 의도와 가치관에 맞게 행동하도록 미세조정(Fine-tuning)하는 기법
모델이 차지한 표현 영역의 면적은 인간보다 약 1.70배 작았다.
부트스트랩 95% 신뢰구간은 1.68~1.70이었고, 모델은 특히 극단적인 understatement와 overstatement 영역을 드물게 사용했다.
이 결과를 “AI는 인간보다 감정 표현 능력이 1.7배 부족하다”고 해석해서는 안 된다.
그 연구는 한 종류의 정렬된 모델을 비교용 탐침으로 사용했을 뿐이며, 모든 AI 시스템을 대표하지 않는다.
하지만 한 가지는 생각해볼 만하다.
인간의 표현 공간은 넓고 불균질했다.
정렬된 모델의 표현은 그보다 좁고, 상대적으로 일관된 영역에 집중됐다.
쉽게 말하면 인간보다 더 가지런했다.
여기서 산업적으로 중요한 문제가 시작된다.

■ 인간을 AI가 이해하기 쉬운 형태로 바꾸고 있는 것은 아닐까
지금까지 감정 AI의 발전 방향은 대체로 분명했다.
더 많은 데이터를 모은다.
더 정확한 특징을 찾는다.
분류 정확도를 높인다.
오탐과 미탐을 줄인다.
필요한 일이다.
하지만 인간 표현 자체가 넓은 불일치 공간을 가진다면 정확도만으로 충분하지 않다.
모델이 잘 이해하는 표현만 반복해서 정상적인 신호로 취급될 위험이 있기 때문이다.
예를 들어 상담 시스템이 강한 고통을 명확하게 표현하는 사람을 잘 찾아낸다고 하자.
그 성능은 높을 수 있다.
그러나 고통이 클수록 오히려 설명을 줄이는 사람에게도 같은 성능을 보이는지는 별개의 문제다.
고객 경험도 마찬가지다.
길고 격렬한 항의는 쉽게 탐지된다.
짧고 건조한 문장 속에서 이미 관계를 포기한 고객은 훨씬 어려울 수 있다.
AI가 틀렸다는 이야기가 아니다.
측정 대상이 생각보다 복잡하다는 이야기다.
■ 감정 AI의 다음 KPI
그래서 감정 AI 산업에는 정확도 외에 하나의 평가축이 더 필요하다고 생각한다.
나는 이를 ‘표현 다양성의 커버리지’라는 질문으로 보고 싶다.
이 시스템은 평균적인 표현을 얼마나 잘 분류하는가.
그리고 동시에,
인간이 평균과 다르게 표현할 수 있는 공간을 얼마나 포착하고 있는가.
강한 감정을 약하게 말하는 사람.
낮은 감정을 길게 설명하는 사람.
상충하는 감정을 동시에 표현하는 사람.
아직 자신의 상태를 명명하지 못한 사람.
이들을 오류나 잡음으로 제거할 것인지, 인간 표현의 일부로 남겨둘 것인지가 중요하다.
이 질문을 실제 시스템 설계로 옮기면 네 가지 원칙이 나온다.
첫째, 감정 추론 결과는 사실이 아니라 추론으로 표시돼야 한다.
둘째, 불확실성을 함께 보여줘야 한다.
셋째, 하나의 감정 라벨이 곧바로 중요한 의사결정으로 이어지지 않도록 해야 한다.
넷째, 당사자가 그 해석을 수정하거나 거부하거나 다른 설명을 제시할 수 있어야 한다.
정확도를 포기하자는 이야기가 아니다.
정확도의 의미를 더 엄격하게 만들자는 것이다.
■ 가장 조용한 사람이 가장 괜찮은 사람은 아니다
이 연구에는 분명한 한계가 있다.
온라인 지원 커뮤니티의 영어 관계 서사를 분석한 연구이며, 이 결과를 인간 전체의 보편적 감정 구조로 일반화할 수는 없다.
모델 비교 역시 하나의 RLHF 정렬 모델을 이용한 비교 탐침이었다.
하지만 35만 건이 넘는 실제 서사에서 한 가지 사실은 꽤 일관되게 나타났다.
인간의 감정과 인간의 표현은 같은 속도로 움직이지 않는다.
나는 이것이 감정 AI 시대에 중요한 출발점이라고 생각한다.
우리는 지금 AI에게 인간의 마음을 더 많이 읽게 하려 한다.
그 과정에서 놓치기 쉬운 질문이 있다.
AI가 읽기 어려운 방식으로 말하는 인간도 여전히 정상적인가.
대답은 그래야 한다.
인간은 기계가 이해하기 좋은 형식으로 감정을 느끼지 않는다.
때로는 너무 적게 말하고,
때로는 지나치게 오래 설명하며,
때로는 자신과 모순된다.
그 불일치는 제거해야 할 노이즈가 아니라 인간이 자신의 감정을 견디고, 드러내고, 숨기고, 이해해가는 공간일 수 있다.
좋은 감정 AI는 사람의 마음에 가장 빨리 이름을 붙이는 시스템이 아닐 것이다.
자신이 붙인 이름이 틀릴 수 있다는 자리를 끝까지 남겨두는 시스템에 더 가까울 것이다.
AI가 인간의 감정을 더 잘 읽게 될수록,
인간에게는 다르게 말할 자유가 더 중요해진다.
때로는 읽히지 않을 자유까지도.
연구
Kim RS. Narrative–affect discrepancy as a regulated degree of freedom in 351,734 relationship narratives. PLOS ONE. 2026;21(5):e0348715. DOI 10.1371/journal.pone.0348715.

광운대학교 연구교수 · Ryan Research Institute, Paris 설립자 겸 책임연구자
Human-AI Governance, 감정 AI, 인간-AI 관계를 연구한다.]





