2026. 9. 7. 02:56ㆍAI 이야기
합성 사용자(Synthetic User)를 보는 세 가지 기준
1. Overview [바로가기]
2. Anchor [바로가기]
3. Align
4. Act [바로가기]
Align
합성 사용자가 실제 사용자 데이터에 잘 닿아 있다고 해서, 실제 사용자처럼 반응하는 것은 아닙니다. 실제 인터뷰, 설문, 고객 데이터, 행동 로그를 기반으로 만들어졌더라도 새로운 질문이나 새로운 제품 상황에서 전혀 다른 반응이 나오기 때문입니다. 그래서 두 번째로 이런 질문이 떠오릅니다.
이 합성 사용자는 얼마나 실제 사람같이 반응하는가?(How well does this synthetic user align with reality?)

예를 들어 여러 EV 배터리를 비교해 본 사용자는 "배터리에서 무엇이 가장 중요한가"에는 그 경험을 근거로 일관되게 답합니다. 하지만 "구독형 배터리 교체 서비스가 나오면 가입하겠는가"처럼 겪어보지 않은 새로운 상황에는, 그럴듯한 답을 자신 있게 내놓더라도 그것이 실제 사용자의 선택과 같으리란 보장이 없습니다.
그래서 그럴듯하게 응답하느냐(plausibility)를 넘어, 실제 사용자의 응답과 얼마나 일치하느냐(alignment)를 확인해야 합니다.
Align의 깊이
현실과 얼마나 일치하는지 확인하는 스펙트럼에 대해서 알아봅니다.

그럴듯함 (Plausible)
가장 기본적인 수준은 결과를 사람이 읽고 “그럴듯하다”라고 판단하는 것입니다. 아이데이션 단계에서는 그럴듯한 답변을 하는 것만으로도 어느 정도 유용한 결과를 얻을 수 있습니다. 하지만 아직은 실제 사람이 이렇게 이야기할지 아닌지는 모르는 상태입니다.
전문가 검토 (Expert-reviewed)
좀 더 나아가서는 합성 사용자의 응답을 UX 리서처나 도메인 전문가가 검토할 수 있습니다. 예를 들어, 기존 인터뷰에서 보던 패턴과 비슷한가? 지나치게 전형적인 답변은 아닌가? 너무 논리적인가? 기존 리서치 근거와 맞지 않는 점은 없는가? 등에 대한 검증을 할 수 있습니다. 한편, 전문가의 검토는 합성 사용자의 잘못된 답변을 가리는데 도움이 되지만 여전히 실제 사용자의 응답과 일치하고 있는지를 알기는 아직 어렵습니다.
응답 일치 (Human response-aligned)
합성 사용자와 실제 사람에게 동일한 질문을 하고 결과를 비교하는 방식입니다. 예를 들어 EV 브랜드 선호도를 묻는 질문을 합성 퍼소나와 동일한 특성을 가진 실 사용자에게 동시에 묻는 방식입니다. 두 결과가 얼마나 유사한지 비교하는 과정을 통해 합성 사용자 응답의 정합성을 맞춰 나가게 되고 이 단계부터 합성 사용자가 얼마나 현실을 반영하고 있는지 기준을 가지게 됩니다.

퀄트릭스는 자체 합성 패널과 실제 패널을 동일한 인구 통계 조건으로 매칭한 뒤 같은 질문에 대한 응답을 비교했습니다. 이렇게 합성 패널의 응답이 실제 패널과 얼마나 가까운지 측정함으로써 합성 응답의 정합성을 검증합니다.
행동 일치 (Behavior-aligned)
UX 리서치에서는 사용자의 행동이 중요합니다. 실제 사용자와 합성 사용자 모두 “이 기능은 쉽게 사용할 수 있을 것 같아요.”라고 말할 수 있지만, 이 기능을 실제로 사용해 보는 태스크를 수행할 때에는 다른 행동을 보여줄 수도 있기 때문입니다.

합성 사용자와 실제 사용자의 말은 일치할 수 있지만 행동은 일치하지 않을 수 있다는 말입니다. 그래서 합성 사용자를 평가하려면 태스크 성공 여부, 내비게이션 경로, 에러 여부, 백버튼(백트래킹), 포기, 소요 시간, 클릭/터치 횟수 등과 같은 항목을 비교 테스트 해야 합니다.
Userbrain은 합성 사용자와 실제 사용자에게 요금제 프로토타입에서 동일한 태스크를 수행하게 했습니다. ‘월 20명의 테스터를 이용할 때 가장 저렴한 옵션'을 찾으라는 태스크에서 실제 사용자는 5명 중 3명이 정답을 맞힌 반면, 합성 사용자는 모두 정답을 맞혔습니다. 실제 사용자가 겪은 실패를 재현하지 못하고 보다 이상적으로 성공한 것입니다.

닐슨노만그룹(NN/g)은 실제 사용자와 진행했던 연구에 합성 사용자를 붙여, 합성 사용자가 생성한 응답을 실제 인터뷰 결과와 비교했습니다. 그 결과, ‘업무 방식’과 같은 일반적인 질문에 대해서는 실제 사용자와 유사한 답변을 했지만, 실제 경험을 묻는 대목에서 크게 차이가 있음을 발견했습니다. 예를 들어, 온라인 학습에서 실제 사용자들은 강의가 좋았지만 코스를 끝까지 마치지는 않았는데, 합성 사용자는 언급한 코스를 모두 완료했다고 응답했습니다.
닐슨노만그룹은 합성 사용자가 '의견'은 그럴듯하게 만들어내도 '실제로 무엇을 했는지'에 대한 행동 데이터는 만들어내지 못한다고 합니다. 말은 사람처럼 들려도 실제 행동과 경험은 검증 없이 어긋날 수 있다는 것, 이것이 행동 일치를 따로 확인해야 하는 이유입니다.

변화 일치 (Continuous alignment)
사용자의 생각과 행동은 고정되어 있지 않습니다. 새로운 기능에 익숙해지거나, 제품을 반복해서 사용하거나, 시장 환경이 변하면서 응답과 행동도 달라질 수 있습니다. 따라서 합성 사용자도 특정 시점의 사용자 데이터를 그대로 유지하는 것이 아니라, 새롭게 관찰된 현실을 다시 반영해야 합니다.
예를 들어 새 EV 충전 예약 기능이 출시되기 전과 후의 사용자의 의견에 대해서 변화가 있을 수 있습니다. 새 기능이 출시되기 전에는 합성 사용자와 실제 사용자가 서로 같은 의견으로 시작하지만, 실제 사용자가 제품을 사용해 본 후 기대와 다른 방향으로 사용하게 된다면, 이후 합성 사용자도 의견을 업데이트할 수 있도록 해야 할 것입니다.

변화 일치는 단순히 최신 데이터를 추가하는 것이 아니라, 실제 사용자의 생각과 행동이 어떻게 변했는지를 다시 관찰하고 그 변화를 합성 사용자에 반영하면서 지속적으로 정합성을 맞춰가는 과정이라고 할 수 있습니다.
Sentia Labs는 합성 사용자로 제품을 시뮬레이션한 뒤, 출시 후에는 실제 고객 데이터를 바탕으로 모델을 다시 수정하는 닫힌 루프(closed loop)를 사용합니다. 이렇게 되면 합성 사용자는 특정 시점에 만들어진 퍼소나가 아니라 실제 사용자와 시장 변화에 따라 계속 갱신되는 사용자 모델에 가까워집니다.

Align 스펙트럼
지금까지 살펴본 다섯 가지 유형은 아래와 같이 정리해 볼 수 있습니다.

그런데, 어디까지 행동하는가?
Anchor는 합성 사용자가 어디에서 왔는가, Align은 합성 사용자의 응답과 행동이 실제로 현실과 맞는가에 대한 이야기였습니다.
이제 실제 사람과 같은 합성 사용자를 만들었다면, 그 합성 사용자는 어디까지 행동할 수 있을까요? 묻는 말에 잘 대답하면 그걸로 충분할까요? 합성 사용자가 어떤 역할까지 할 수 있는지 다음 글, Act에서 알아보겠습니다.
참고
Testing Synthetic Data Against Academic Benchmarks: A Replication Study, Greenbook, https://www.greenbook.org/insights/data-science/testing-synthetic-data-against-academic-benchmarks-a-replication-study
We Ran an Experiment with Synthetic Users: Here’s What We Found, User Brain, https://www.userbrain.com/blog/synthetic-users-experiment
Synthetic Users: If, When, and How to Use AI-Generated “Research”, NN/g, https://www.nngroup.com/articles/synthetic-users
Synthetic Users: AI “Participants,” NN/g, https://www.youtube.com/watch?v=q_fdcbwHJKQ&t=6s
Sentia Labs, https://www.sentialabs.ai/synthetic