12. 좋은 데이터 보다 사고 싶은 데이터
배달음식을 주문하고 문을 열었는데 복도에 담배 냄새가 진하게 남아 있던 적이 있다. 그때 엉뚱한 생각을 했다. 배달비를 조금 더 내더라도 신원이 확인되고 일정한 기준을 통과한 기사에게 음식을 받고 싶어 하는 사람도 있지 않을까.
물론 누군가 ‘안전한 기사’라는 도장을 찍어준다고 믿을 수 있는 것은 아니다. 누가 어떤 기준으로 인증했는지도 중요하다.
데이터를 설명하다 보면 고객이 자주 묻는 질문이 있다. 얼마나 최신값인가, 어떻게 만들어졌는가, 실제 관측값인가 추정값인가, 과거와 현재의 기준은 같은가. 이 질문에 대한 답을 누가 할 수 있을까?
가장 먼저 답하는 사람은 데이터를 만든 회사다. 누구보다 데이터를 잘 알지만 동시에 그 데이터를 공급하는 입장이다. 답변이 객관적이기 힘들다.
그렇다면 여러 회사의 데이터를 모아서 파는 영업 제휴사나 유통사는 어떨까. 여러 상품을 비교할 수 있다는 장점이 있지만 데이터가 어떻게 만들어졌는지 깊이 알기는 어렵다. 유통사 역시 판매자라는 한계도 있다. 유통사가 다루는 어떤 상품은 마진이 높을 수 있고, 어떤 상품은 전략적으로 판매를 늘려야 할 수도 있다. 고객에게 가장 적합한 데이터와 판매자가 가장 팔고 싶은 데이터는 다를 수 있다.
데이터는 구매 전에 품질을 확인하기 어렵다. 자동차는 사양을 비교할 수 있고 식당은 리뷰라도 찾아볼 수 있다. 데이터도 샘플을 받아볼 수 있지만 장기 시계열 데이터의 품질과 최신성, 안정성을 사전에 확인하기는 쉽지 않다.
그래서 든 생각은 데이터에도 일종의 신용등급을 만드는 것이었다. 데이터의 출처가 명확한지, 어떻게 만들어졌는지, 얼마나 자주 업데이트되는지, 오류가 발생했을 때 수정하는 체계가 있는지를 독립적인 누군가가 확인해 주는 것이다.
등급은 괜찮은 아이디어 같지만 구체화하려고 하면 할수록 뭔가 부족하다.
유기농 제품이 좋은 것은 누구나 알지만 항상 유기농 제품이 팔리는 건 아니다. 마트에서 유기농 인증마크가 붙은 채소를 보면 일정한 기준을 통과했다는 것을 알 수 있으니 안심이 된다. 안심이 구매로 이어지는가는 조금 다른 이슈다. 가격이 비싸면 일반 채소를 고르기도 하고, 먹어봤는데 맛이 없으면 다음에는 다른 것을 사기도 한다.
친환경 마크도 마찬가지다. 인증은 상품의 특정한 특성을 확인해 줄 뿐 구매까지 결정해주지는 않는다.
데이터 품질을 검증하는 데 많은 비용이 들어 그 비용이 가격에 붙는다면 고객은 인증받지 않은 데이터를 선택할 수도 있다. 더 큰 문제는 공급기업이 좋은 평가를 받기 위해 평가항목에 맞춰 데이터를 만들 것이라는 점이다. 결측치가 적고, 생성 과정이 명확하고, 업데이트가 규칙적이며, 오랜 시계열을 가진 데이터는 평가하기 좋다. ‘반듯한 데이터’다. 하지만 또 질문할 수 있다. 반듯한 데이터가 좋은 데이터냐? 그렇지는 않다.
표본은 작고 시계열도 짧지만 지금까지 아무도 보지 못했던 고객 행동을 보여주는 데이터가 있을 수 있다. 만들어진 지 얼마 되지 않아 활용 이력은 부족하지만 특정 기업이 꼭 알고 싶었던 것을 보여주는 데이터도 있다. 반대로 수년간 안정적으로 관리되고 오류도 거의 없는 데이터라도 고객의 질문에 답하지 못한다면 살 이유가 없다.
두 번째로 생각한 개념은 적합도다. 적합도는 절대점수가 될 수 없다. 같은 데이터라도 누가 무엇을 하려느냐에 따라 달라지기 때문이다.
전국의 소비 변화를 보려는 기업과 특정 지역에 매장을 내려는 기업은 다른 데이터가 필요하다. 어제의 변화를 알아야 하는 기업과 지난 10년의 흐름을 분석하는 연구자도 마찬가지다. AI를 학습시키기 위한 데이터와 경영진에게 시장 변화를 설명하기 위한 데이터의 조건도 다르다.
신뢰도는 데이터 자체에 붙지만, 적합도는 데이터와 사용자 사이에서 만들어진다.
이 차이는 데이터 활용에서 중요하다. 데이터를 잘 판다는 것은 가장 품질 좋은 데이터를 권하는 일이 아니다. 고객이 무엇을 하려는지 먼저 이해하고 그 목적에 맞는 데이터를 연결하는 일이다.
그런데 여기서도 끝이 아니다. 고객은 쓸모가 있어도 사지 않은 경우가 있다. 고객의 목적에 잘 맞는 데이터라고 반드시 사는 것도 아니다.
A데이터는 내가 하려는 분석에 아주 잘 맞지만 5천만 원이고, B데이터는 조금 부족하지만 500만 원이라면 B를 고를 수 있다. 반대로 가격은 비싸지만 다른 곳에서는 절대 구할 수 없는 데이터라면 이야기가 또 달라진다.
그래서 데이터 구매를 설명하려면 세 개의 질문이 필요하다. 첫 번째는 신뢰도, 믿을 만한 데이터인가, 두 번째는 적합도, 지금 우리 회사에 필요한 데이터인가, 이 두 가지로도 충분하지 않고 세 번째는 매력도, 그래서 이 가격에 지금 사고 싶은가 하는 질문이다.
매력도에는 품질만 들어가지 않는다. 고객의 목적에 얼마나 잘 맞는지, 다른 곳에서 구하기 어려운지, 얼마나 최신인지, 앞으로도 계속 받을 수 있는지, 그리고 이 모든 것을 감안했을 때 가격이 납득되는지가 함께 작용한다. 누가 공급하는 데이터인지도 중요하다.
결국 데이터사업에서 마지막으로 봐야 할 숫자는 품질점수가 아니라 구매 매력도인지도 모른다.
데이터 마켓은 검색보다 선택을 도와야 한다. 현재 많은 데이터 마켓은 데이터를 많이 모으는 데 집중한다. 상품이 많으면 고객에게 선택지가 많아지니 좋은 일처럼 보인다. 하지만 상품이 많아질수록 다른 문제가 생긴다. 그래서 나한테 필요한 데이터는 어디에 있어?
수백 개의 데이터 상품을 일일이 읽어보고 자신의 목적에 가장 적합한 것을 고르는 것은 어렵다. 결국 고객은 가장 유명한 회사의 데이터를 사거나 영업담당자가 추천하는 상품을 선택하기 쉽다.
앞으로의 데이터 마켓은 조금 달라질 수 있다.
예를 들어 고객이 “최근 3년간 서울을 방문한 외국인의 소비 변화를 분석하고 싶다”고 입력한다. 그러면 데이터 A는 시계열과 지역 범위는 적합하지만 가격이 높고, 데이터 B는 가격은 저렴하지만 외국인 구분이 제한적이며, 데이터 C는 가격이 조금 높지만 국적별 소비까지 볼 수 있다는 식으로 비교해 주는 것이다. 한 개의 질문에 복수개의 답을 주고 고객의 선택을 열어준다.
고객에게 필요한 것은 데이터의 순위가 아니라 선택의 근거다. AI가 데이터를 고르는 시대에는 약점을 드러내는 것도 전략이 될 수 있다.
이 변화는 AI 에이전트가 데이터를 찾기 시작하면 더 빨라질 수 있다. 사람이 수백 개의 데이터 상품을 읽고 자신의 목적에 얼마나 적합한지를 일일이 판단하기는 어렵다. AI라면 사용자의 목적을 이해하고 데이터의 생성 방식, 범위, 최신성, 가격, 시계열, 품질 이력 등을 비교할 수 있다.
그때 AI에게 필요한 것은 ‘최고의 데이터 순위표’가 아니다. 고객에게 지금 가장 매력적인 데이터가 무엇인지 판단할 수 있는 정보다.
그러려면 데이터 회사도 지금보다 훨씬 많은 것을 설명해야 한다. 어떻게 만들어졌는지, 어디까지 볼 수 있는지, 얼마나 자주 바뀌는지, 무엇을 잘 보여주고 무엇은 잘 보여주지 못하는지를 기계가 읽을 수 있는 형태로 제공해야 한다.
지금의 상품소개서는 대부분 장점을 설명한다. 데이터가 얼마나 많고 정확하며 차별화되어 있는지를 보여준다. 하지만 AI가 데이터를 비교하는 시장에서는 약점을 정확하게 설명하는 것이 오히려 경쟁력이 될 수도 있다.
특정 지역에서는 표본이 부족하다거나, 과거 데이터는 특정 시점까지만 제공된다거나, 이런 분석에는 적합하지 않다는 정보까지 정확하게 표시해야 AI가 다른 데이터를 선택하거나 함께 사용할 데이터를 찾을 수 있기 때문이다.
AI 모델을 고를 때도 어떤 업무에 사용할 것인지, 기존 시스템과 얼마나 쉽게 연결되는지, 속도는 어떤지, 보안과 비용은 감당할 수 있는지를 함께 본다. 성능이 가장 높은 모델과 우리 회사가 실제로 선택할 모델이 같지 않을 수 있다.
좋은 AI와 팔리는 AI가 다를 수 있는 것처럼, 좋은 데이터와 팔리는 데이터도 다르다. 데이터의 매력도를 높이는 것도 상품개발의 영역이다.
데이터 회사는 품질뿐 아니라 구매 매력도를 함께 설계해야 한다.
가격을 나눌 수도 있다. 필요한 부분만 잘라 작은 상품으로 만들 수도 있다. 다른 데이터와 결합할 수도 있고, 최신성을 높일 수도 있다. 데이터를 처음 사용하는 고객이라면 분석모델이나 리포트를 함께 제공할 수도 있다. 데이터를 바꾸지 않고도 데이터의 매력도는 달라질 수 있다.
좋은 데이터는 너도 나도 보유하고 있다. 우리가 보유한 데이터 중에 고객이 탐낼 만한, 사고 싶은 데이터는 얼마나 될까?
품질을 높이는 일은 여전히 중요하다. 하지만 유기농 인증마크가 붙었다고 모든 소비자가 그 상품을 선택하지 않는 것처럼, AI성능과 기업의 시장 점유율이 비례하지 않는 것처럼, 품질만으로 구매가 만들어지지는 않는다. 우리 데이터는 얼마나 좋은가가 아니라, 우리 데이터는 얼마나 사고 싶은 데이터인가에 중점을 둬야 한다.
좋은 데이터를 만드는 것과 팔리는 데이터를 만드는 것은 비슷해 보이지만, 사업을 하다 보면 꽤 다른 일이다. 그리고 이 포인트는 데이터사업에만 적용되는 기준이 아니다.
‘좋다’와 ‘선택받는다’ 사이에는 생각보다 많은 것이 있다.