회의록을 펼쳤다.
내 이름 옆에 이런 문장이 있었다.
‘변화에 소극적이며 협업 의지가 낮음.’
그날 나는 새로운 사업을 반대하지 않았다. 출시를 한 달 늦추자고 했을 뿐이다. 고객의 불만을 충분히 검토하지 않고 서비스를 시작하면 더 큰 비용을 치를 수 있다고 생각했다.
회의가 끝난 뒤 팀장은 AI에게 회의 내용을 정리하고 직원별 평가 초안을 작성해 달라고 요청했다.
일정을 늦추자는 의견은 ‘변화에 소극적’이라는 평가가 됐다. 위험을 확인하자는 요청은 ‘협업 의지 부족’으로 정리됐다.
몇 달 뒤 다른 관리자가 그 문서를 읽는다. 새로운 프로젝트에 참여할 직원을 고르면서 내 이름 옆의 문장을 다시 본다.
나는 그 관리자를 만난 적도, 그 평가에 관해 설명할 기회도 없었다.
이 장면은 특정 기업에서 확인된 사건이 아니라, AI가 작성한 업무 기록이 인사평가 자료로 사용될 때 생길 수 있는 상황을 구성한 것이다.
그러나 질문은 현실적이다.
내가 실제로 한 말보다 AI가 나에 관해 쓴 문장이 더 오래 남는다면, 사람들은 무엇을 근거로 나를 판단하게 될까.
회의록이 사람에 대한 평가가 되는 순간
AI는 회의를 요약하고, 업무 기록을 정리하고, 인사평가 문장의 초안을 작성할 수 있다.
관리자에게는 반가운 도구다. 지난 몇 달의 업무를 돌아보며 흩어진 기록을 모으고, 직원에게 전달할 내용을 정리하는 데 드는 시간을 줄일 수 있다.
월스트리트저널도 관리자의 AI 활용이 성과평가 문서 작성으로 확대되는 현상을 다뤘다. AI가 평가 내용을 명확하게 전달하도록 도울 수 있는 반면, 사실관계 오류나 과장된 표현이 직원에 대한 평가에 들어갈 위험도 지적했다.
중요한 것은 문장을 누가 입력했는지만이 아니다. 그 문장이 무엇을 말하고 있는가이다.
‘회의에서 출시 일정 연기를 제안했다.’
‘변화에 소극적이다.’
두 문장은 같은 회의를 가리킬 수 있다. 그러나 첫 문장은 확인 가능한 행동을 기록하고, 두 번째 문장은 그 사람의 성향을 판단한다.
일정 연기를 제안한 이유가 고객 보호였는지, 업무 회피였는지, 다른 대안이 있었는지는 그 한 문장에 들어 있지 않다.
그런데 평가서의 형식으로 정리된 문장은 원래 발언을 확인하지 않은 사람에게도 그럴듯하게 읽힌다.
회의에 참석하지 않았던 사람은 당시의 표정도, 질문도, 반론도 보지 못한다. 그에게 남은 것은 문서에 적힌 결론뿐이다.
사건을 기록한 문장이 어느 순간 사람을 규정하는 문장으로 바뀐다.
한 번 붙은 평가는 다음 사람에게 넘어간다
문제는 최초의 평가가 부정확했을 가능성에서 끝나지 않는다.
‘협업 의지가 낮음’이라는 문장을 읽은 관리자는 그 직원을 다음 회의에서 유심히 볼 수 있다. 직원이 다시 신중한 의견을 내면, 관리자는 이전 평가를 떠올릴 수 있다.
이것은 막연한 우려만은 아니다.
2025년 국제학술지 International Journal of Information Management에는 관리자 775명을 대상으로 한 두 차례의 인사평가 실험이 발표됐다. 연구진은 관리자에게 제시된 평가 권고의 출처가 사람인지 AI인지, 먼저 주어진 평가 기준이 높은지 낮은지에 따라 최종 평가가 어떻게 달라지는지 살폈다.
그 결과 관리자의 평가는 AI 권고의 존재와 최초 평가 기준의 영향을 받았으며, 권고의 출처와 기준점이 상호작용하는 양상도 관찰됐다.
직원이 실제로 한 행동만이 평가를 결정하는 것은 아니라는 뜻이다. 평가자가 먼저 접한 정보도 이후의 판단에 영향을 미칠 수 있다.
AI가 작성한 문장을 읽은 뒤 관리자가 최종 결정을 내렸다고 해서, 그 판단이 처음 제시된 평가로부터 독립적이었다고 가정할 수는 없다.
AI의 평가가 인사 결정의 마지막 문장이 아니더라도, 다음 판단의 첫 문장이 될 수 있다.
나는 이 문제를 이번 글에서 ‘해석의 이월’이라고 부르고 싶다.
한 상황에서 내려진 해석이 원래의 맥락을 떠나 다음 문서와 다음 사람에게 넘어가는 과정이다.
회의록에서 인사평가서로, 인사평가서에서 승진 검토 자료로, 다시 다음 관리자의 판단으로 이어질 수 있다.
기록을 옮기는 일 자체가 문제는 아니다. 조직은 과거의 업무를 기억해야 한다.
다만 옮겨지는 것이 확인 가능한 사실인지, 특정 시점에 누군가 내린 해석인지 구별하지 않는 순간 문제가 생긴다.
‘방어적이다.’
‘조직문화에 맞지 않는다.’
‘리더십이 부족하다.’
이런 표현은 짧고 편리하다. 그래서 처음 그 평가가 만들어진 상황은 빠르게 사라지고, 사람에 관한 결론만 남기 쉽다.
당사자가 나중에 기록을 바로잡더라도 이미 그 문장을 읽은 사람들의 판단까지 함께 수정되는 것은 아니다.
직원들이 조용해진 회사에서 AI는 무엇을 측정하는가
기록되고 있다는 사실만으로도 사람의 행동은 달라질 수 있다.
지난 6월 직장갑질119가 전국 만 19세 이상 직장인 1,000명을 대상으로 실시해 8월 발표한 ‘전자 노동 감시와 정신건강’ 조사에서, 48.1%는 감시 때문에 동료와의 대화나 의사표현을 조심한 경험이 있다고 답했다. 압박·스트레스·피로감을 느꼈다는 응답은 42.8%, 불안감이나 우울감을 경험했다는 응답은 29.4%였다.
이 조사는 CCTV와 스마트폰 앱 등을 통한 전자 노동감시 전반에 관한 것으로, AI 인사평가의 영향만을 측정한 것은 아니다.
그럼에도 한 가지 질문을 남긴다.
직원들이 자신의 발언이 기록되고 평가될 것을 의식해 말을 줄이는 조직에서, AI가 회의의 ‘의견 충돌 감소’를 보고한다면 그 결과를 어떻게 읽어야 할까.
서로를 더 잘 이해하게 되었을 수 있다.
반대 의견을 내지 않게 되었을 수도 있다.
회의록에 남은 발언만 분석해서는 두 상황을 구별하기 어려울 수 있다.
어떤 직원은 위험을 발견해도 말을 아낀다. 어떤 직원은 자신이 소극적으로 평가받을까 봐 질문을 접는다.
그런데 조직이 조용해졌다는 이유로 소통이 개선됐다고 판단한다면, 중요한 신호를 놓치게 된다.
직원들이 조용해진 회사에서, AI는 무엇을 측정하고 있는가.
이것은 기술의 정확도만으로 답할 수 있는 질문이 아니다. 조직이 무엇을 기록하도록 허용하고, 그 기록을 어떤 의미로 읽으며, 직원이 자신의 경험을 어떻게 설명할 수 있는지까지 살펴야 한다.
사람이 마지막에 서명하면 충분할까
한국에서도 노동 영역의 AI 활용에 관한 법적 논의가 진행 중이다.
2026년 6월 23일 발의된 근로기준법 개정안은 직무 배치, 성과평가, 보상, 승진, 징계, 근로자 모니터링 등에서 중대한 결정을 하거나 지원하는 AI를 ‘노동영역 인공지능시스템’으로 정의한다.
이 개정안에는 AI를 활용한 중대한 결정에 관한 사전 고지와 설명 요청, 불리한 처우를 받은 근로자의 재검토 요청, 해당 결정에 관여하지 않은 사람에 의한 독립적 재검토 등의 내용이 담겨 있다. AI의 결정만으로 해고·정직·감봉 등의 불리한 처우를 하지 못하도록 하는 조항도 포함됐다. 아직 시행 중인 법률은 아니다.
여기서 실제 조직 운영에 관한 질문이 생긴다.
AI가 평가 초안을 작성했다. 관리자가 그 문서를 읽고 승인했다.
그렇다면 사람의 판단이 이루어진 것일까.
2026년 Harvard Data Science Review에 발표된 연구는 이 질문에 생각할 거리를 제공한다.
연구진은 참가자 2,784명에게 AI가 기업의 온실가스 배출량 보고서에서 추출한 수치를 검토하도록 했다. 참가자들은 AI의 제안을 받아들이거나 오류를 지적할 수 있었다.
그런데 오류를 지적한 뒤 올바른 수치까지 직접 입력해야 하는 조건에서는 정정이 줄어들고, 잘못된 AI의 제안을 수용하는 경우가 늘었다.
AI를 검토할 권한이 있다는 사실만으로 오류가 충분히 수정되는 것은 아니었다. 정정하는 데 필요한 수고도 사람의 행동에 영향을 미쳤다.
이 실험은 인사평가가 아니라 데이터 검증에 관한 연구다. 그러나 관리자에게도 같은 질문을 던질 수 있다.
AI가 작성한 평가 문장을 그대로 승인하는 데는 클릭 한 번이면 충분하다. 반대로 문장을 고치려면 원래 회의록을 열고, 발언을 확인하고, 수정 이유를 기록해야 한다.
조직은 사람에게 검토권을 주면서, 실제로 검토하기는 어렵게 만들고 있지 않은가.
관리자가 원래 회의록을 확인하고 직원의 성과와 당시 상황을 살핀 뒤 평가를 수정했다면, AI는 판단을 지원한 도구였을 것이다.
반대로 원자료는 보지 않은 채 AI가 작성한 평가 문장을 그대로 승인했다면, 결재란에는 사람의 이름이 있어도 실질적인 검토가 얼마나 이루어졌는지 물어야 한다.
현행 개인정보 보호법 역시 일정한 요건을 갖춘 완전히 자동화된 결정에 대해 정보주체의 설명·검토 요구와 거부권 등을 규정한다. 개인정보보호위원회는 최종 결정에 사람이 실질적으로 관여했는지를 판단할 때 형식적인 승인 이상의 개입이 있었는지 살피도록 안내하고 있다. 다만 사람이 관여한 모든 AI 보조 평가가 동일한 법적 규율의 대상이 되는 것은 아니다.
법률이 적용되는 범위와 별개로, 관리자가 직원의 평가서를 작성할 때 스스로 확인할 수 있는 질문이 있다.
“이 문장은 그가 실제로 한 행동인가, 아니면 내가 그에 대해 내린 결론인가.”
행동을 기록했다면 근거를 확인할 수 있어야 한다.
성향을 평가했다면 그 판단에 이르게 된 상황과 다른 가능한 설명을 살펴야 한다.
AI가 작성했다는 이유로 평가를 불신할 필요도, 문장이 매끄럽다는 이유로 신뢰할 필요도 없다.
누군가의 승진과 배치, 평판에 사용될 문서라면 문장의 출처와 의미를 확인하는 일이 먼저다.
잘못된 문장 하나를 고치는 것으로 끝나지 않는다
직원은 회의록을 읽고 관리자에게 말한다.
“저는 출시를 반대한 것이 아닙니다. 고객 불만을 먼저 검토하자고 했습니다.”
관리자는 원래 회의 내용을 확인한 뒤 ‘변화에 소극적’이라는 표현을 삭제한다.
그렇다면 문제는 해결된 것일까.
이전 평가서가 이미 다른 팀으로 전달되었다면 어떻게 할까. 그 문장을 근거로 프로젝트 참여자를 정했다면 어떻게 할까. 직원의 반론을 듣기 전에 작성된 다음 평가서는 어떻게 처리할까.
여기서 해석의 이월이 다시 문제가 된다.
최초의 기록을 정정하는 일과 그 기록이 이후의 판단에 미친 영향을 확인하는 일은 구별된다.
따라서 인사평가에 AI를 활용하는 조직이라면 기록을 정정할 수 있는지만 확인할 것이 아니라, 그 기록이 어디에 사용됐는지도 살펴볼 필요가 있다.
원래 발언과 평가 문장을 연결해 두는 일, 사실 기록과 성향 판단을 구별하는 일, 평가가 확정되기 전에 당사자의 설명을 듣는 일도 생각해볼 수 있다.
AI가 정리한 문서를 없애자는 이야기가 아니다. 오히려 기술을 이용해 기록의 출처와 수정 이력을 더 명확하게 남길 수 있다.
그러나 가장 중요한 것은 시스템 안에 남은 수정 표시가 아니다.
그 사람을 평가하는 다음 사람에게 무엇이 전달되는가이다.
나는 그런 사람이라고 말한 적이 없다
나는 앞서 발표한 감정 AI 연구에서 한 가지 지표를 제안했다.
AI가 사람의 감정을 잘못 해석했을 때, 당사자가 이를 바로잡은 뒤에도 같은 오류가 반복되는지를 측정하는 ‘정정 후 불일치율’이다.
사람이 “그것은 내가 느끼는 감정이 아닙니다”라고 말했는데도 AI가 이후의 대화에서 같은 해석을 반복한다면, 처음의 정정은 충분히 반영되지 않은 것이다.
이 연구는 감정 AI를 대상으로 한 이론·설계 연구와 개념증명 시뮬레이션이다. 실제 기업의 인사평가를 실험한 결과는 아니다.
하지만 그 문제의식을 인사평가에 옮기면 새로운 질문이 생긴다.
직원이 잘못된 평가를 바로잡은 뒤에도, 다음 평가자가 수정 전의 문장을 근거로 그를 판단한다면 어떻게 할 것인가.
한 사람에 대한 해석이 다음 판단으로 넘어갈 수 있다면, 그 해석을 바로잡은 기록도 함께 넘어가야 한다.
『해석자들』에서 내가 추적해온 질문도 이 지점에 닿아 있다. 누가 인간의 경험에 이름을 붙이며, 그 이름이 다른 사람의 판단까지 움직일 때 당사자는 무엇을 할 수 있는가.
이번에는 그 질문이 회의록의 한 문장에 도착했다.
AI가 사람의 발언을 더 정확하게 요약하게 되더라도, 발언의 기록과 사람에 대한 해석은 여전히 구별해야 한다.
사람은 같은 회의에서 신중할 수도 있고, 다른 회의에서는 과감할 수도 있다. 한 번의 반대 의견이 그 사람 전체를 설명하지는 않는다.
몇 달 뒤, 그 직원은 자신에 관한 평가를 읽고 말한다.
“저는 그날 출시를 반대한 게 아닙니다.”
관리자는 수정된 회의록을 보여준다.
직원은 한동안 화면을 바라보다가 묻는다.
“그런데 이 기록을 읽은 사람들은 이미 저를 그렇게 알고 있겠군요.”
[연구·참고문헌]
1. Carter L, Liu D. How was my performance? Exploring the role of anchoring bias in AI-assisted decision making. International Journal of Information Management. 2025;82:102875.
https://doi.org/10.1016/j.ijinfomgt.2025.102875
2. Beck J, Eckman S, Kern C, Kreuter F. Bias in the Loop: How Humans Evaluate AI-Generated Suggestions. Harvard Data Science Review. 2026;8(2).
https://doi.org/10.1162/99608f92.0e98898d
3. Kim RS. Formal and computational foundations for implementing Affective Sovereignty in emotion AI systems. Discover Artificial Intelligence. 2026;6:235.
https://doi.org/10.1007/s44163-026-01000-0





