grep

Engineering

딥러닝 추천 모델에 인과추론 접목시켜 전환율 예측 성능을 향상시키자!

데이블

2024년 5월 16일

원문에서 보기 ↗

1. 서론

안녕하세요. AI팀 안준형입니다. 이번 포스팅에서는 추천시스템에서 인과추론을 어떻게 적용하는지 알아보겠습니다. 현재 대부분의 머신러닝 기반의 추천시스템은 입, 출력 간의 상관관계 (correlation)을 모델링합니다. 하지만, 현실 세계는 상관관계가 아닌 인과관계로 구성되어 있으며 상관관계가 인과관계를 반드시 암시하지 않습니다.

예시) 어떤 유저는 휴대폰을 구매한 다음 배터리 충전기를 구매하는 경우, 전자는 후자의 원인이 되지만 그 반대 방향은 성립되지 않습니다. 유저가 충전기를 먼저 구매한 다음에 휴대폰을 구매할 확률은 매우 적다고 볼 수 있습니다. 만약 우리가 상관관계만 모델링한다면 이러한 인과관계성을 포착할 수 없고 모델 성능이 떨어질 수밖에 없습니다.

따라서, 상관관계를 기반으로 모델링을 했을 때 많은 문제점이 발생하며 구체적인 내용은 아래와 같습니다.

2. 상관관계 기반의 추천시스템의 문제점

1.png

1) 문제점들을 구체적으로 알아보자

3. 인과추론이 추천시스템에 필요한 이유

1) 데이터 문제가 발생하는 원인이 뭘까?

데이터 편향, 누락, 혹은 노이즈가 발생되는 원인은 backdoor path가 존재하기 때문입니다. Backdoor path를 다 설명하자면 매우 길기 때문에 간단하게만 설명하겠습니다. 우리는 보통 입력과 출력 사이의 진짜 인과적 상호작용 (causal association)만 관측하고 싶어합니다. 하지만,입출력 변수 사이에 backdoor path가 존재하게 되면 가짜 상호작용 (spurious association)이 발생하여 직접적인 인과 관계에 더해지고 그걸 우리가 관측하게 됩니다.

3.png

위 그림에서 (b)를 보면 Z가 X (입력)와 Y (출력)에 동시에 영향을 주고 있습니다. 이러한 backdoor path로 인해 가짜 상호작용이 발생하게 되고, 이로 인해 X와 Y 사이의 진짜 인과적 상호작용보다 더 overestimate된 X와 Y 사이의 관계를 우리는 관측하게 됩니다. 우리는 이러한 Z를 confounding bias, 혹은 confounder라고 부릅니다.

예를 들어, 아이템 인기도는 노출 확률에 영향을 주게 되는데 우리가 아이템 인기도를 고려하지 않으면 협업 필터링은 인기 있는 아이템에 지속적으로 높은 추천 점수를 부여하기 되고 양성 피드백으로 인해 over-recommendation 현상이 발생하게 됩니다. 이것이 위에서 언급한 인기 편향이며 여기서 아이템 인기도를 confounder라고 볼 수 있습니다.

인과추론 관점에서 보면 X를 treatment, Y를 outcome 변수라고 볼 수 있고, 우리가 실제로 원하는 것은 X가 Y에 다이렉트하게, 직접적으로 끼치는 영향만 보고 싶은 것입니다. 따라서, confounder로 인해 추가적으로 생성되는 영향을 제거해야 우리가 원하는 바를 관측할 수 있고 이러한 편향을 없앤 채로 데이터를 수집하고 추천 모델을 해당 데이터로 학습시키면 추천 모델도 편향을 안 갖게 됩니다. Confounder의 영향을 없애는 인과추론 방법은 여러가지가 존재합니다.

4.png

2) 이를 해결하는 인과추론 기법이 뭐가 있을까?

이 backdoor path를 없애는 인과추론 기법에는 대표적으로 Inverse Propensity Weighting (IPW)와 Doubly Robust (DR)이 있습니다.

4. 전환율 예측

1) 전환율 예측 (CVR prediction)이란?

이번에는 구체적으로 인과추론이 사용되는 추천시스템의 한 도메인에 대해서 설명드리겠습니다. 현재 많은 추천 관련 도메인에서 인과추론 기법이 사용되고 있습니다. 대표적으로는 sequential recommendation, social recommendation, CTR & CVR prediction 등이 있습니다. 그 중에서 여기서 다룰 추천 도메인은 CVR prediction, 전환율 예측입니다.

5.png

온라인 이커머스 시장에서의 전환율 예측은 소매업체나 이커머스 플랫폼이 온라인 사용자의 행동을 분석하여 해당 사용자가 제품을 구매할 가능성을 예측하는 것을 의미합니다. 전환율은 웹사이트 방문자가 실제로 제품을 구매하는 비율을 나타내며, 이는 온라인 판매와 마케팅 전략을 평가하고 최적화하는 데 중요한 지표입니다. 전환율 예측이 온라인 이커머스 시장에서 매우 중요한 이유는 아래와 같습니다.

일반적으로, 유저 액션은 다음의 순차적인 패턴을 따릅니다: 노출 (impression) → 클릭 (click) → 전환 (conversion). CVR은 “클릭 후 전환율”을 뜻하며, 아래와 같이 정의됩니다.

CVR = p(\text{conversion} | \text{click}).

2) 전환율 예측의 문제점

전환율을 정확히 예측하는 데에 있어 문제점이 크게 2가지가 존재합니다.

5. 인과추론 기법으로 전환율 예측 성능 향상시키기

1) Multi-Task Learning (MTL)

esmm.png

위에서 언급한 표본 선택 편향과 데이터 희소성을 해결하기 위해 2018년 Alibaba는 multi-task learning을 도입한 “Entire Space Multi-Task Model: An Effective Approach for Estimating Post-Click Conversion Rate” 논문을 SIGIR에 게재했습니다. 위 그림에서 알 수 있듯이 CTR 예측 타워와 CVR 예측 타워를 각각 빌드하고, 아래의 손실 함수로 모델을 학습합니다.

\mathcal{L}_{ESMM} = \mathcal{L}_{CTR} + \mathcal{L}_{CTCVR}.

여기서, CTCVR은 CTR x CVR을 뜻하며, \mathcal{L}_{CTR}은 클릭 레이블과 CTR 예측값 사이의 binary cross entropy입니다. 그렇다면, \mathcal{L}_{CTCVR}은 클릭x전환 레이블과 CTCVR 예측값과의 binary cross entropy가 되겠죠? 위 모델은 아주 간단한 방법으로 표본 선택 편향과 데이터 희소성 문제를 완화시켰습니다.

2) MTL에 인과추론을 접목시키기

하지만, 아직 추후 연구들을 통해 위의 모델도 표본 선택 편향을 완벽히 해결하지 못했다는 것이 밝혀졌습니다. 이 문제를 더욱 완화하기 위해 multi-task learning에 인과추론 기법을 적용한 논문들이 게재됐습니다.

대표적으로 Ant Group에서 SIGIR’22에 게재한 “ESCM2: Entire Space Counterfactual Multi-Task Model for Post-Click Conversion Rate Estimation” 논문이 있습니다.

escm2.png

❓ 어떻게 인과추론 기법을 적용했을까?

위에서 언급한 Inverse Propensity Weighting (IPW) 기법을 사용했습니다.

6.png

X (feature)가 O (click)에서 R (conversion)의 인과성 사이에 confounder로 작용한다고 보고있어서 X가 O에 미치는 인과성을 제거, 즉 backdoor path를 없앴습니다. 이때, backdoor path를 없애는 방법으로 Inverse Propensity Weighting (IPW), 혹은 Doubly Robust (DR) 기법을 사용했고 위에서 정의한 IPW, DR loss를 CVR loss로 정의한 것입니다.

\mathcal{L}_{CVR-IPS} = 
\frac{1}{|\mathcal{O}|}\sum_{(u,i) \in \mathcal{D}}
\frac{o_{u,i} l(y_{u,i}, \hat{y}_{u,i})}{\hat{o}_{u,i}}
\mathcal{L}_{CVR-DR} = 
\frac{1}{|\mathcal{D}|}
\sum_{(u,i) \in \mathcal{D}}
\left(
\hat{e}_{u,i} + \frac{o_{u,i}( l(y_{u,i}, \hat{y}_{u,i})  - \hat{e}_{u,i})}{\hat{o}_{u,i}}
\right)
+
\frac{1}{|\mathcal{O}|}
\sum_{(u,i) \in \mathcal{O}}
\frac{(l(y_{u,i}, \hat{y}_{u,i})  - \hat{e}_{u,i})^2}{\hat{o}_{u,i}}

위 모델 그림에서 imputation tower는 \mathcal{L}_{CVR-DR}로 학습할 때 사용되며 \mathcal{L}_{CVR-IPS}로 학습한다고 하면 이 모델은 사용되지 않습니다. 그리고 counterfactual risk minimizer가 CVR loss라고 보시면 됩니다. 그렇다면, 이 모델의 최종 손실 함수는 아래와 같습니다.

\mathcal{L}_{ESCM^2-IPS}=\mathcal{L}_{CTR}+\mathcal{L}_{CTCVR}+\alpha\mathcal{L}_{CVR-IPS}.
\mathcal{L}_{ESCM^2-DR}=\mathcal{L}_{CTR}+\mathcal{L}_{CTCVR}+\alpha\mathcal{L}_{CVR-DR}.

여기서, \alpha는 CVR loss의 크기를 조절하는 하이퍼파라미터입니다.

6. 결과

벤치마크 데이터셋에 적용한 결과는 아래와 같습니다. 각각의 표는 CVR과 CTCVR 예측 성능을 나타내고 있습니다.

7.png

8.png

또한, 저자들은 자체 플랫폼을 통해 온라인 A/B 테스트도 진행했고 주요 KPI 지표 모두 우수한 성능을 보였다고 합니다.

9.png

해당 모델을 데이블이 보유한 플랫폼에도 deploy를 해봤고 더욱 향상된 성능을 보여줬습니다.

7. 마무리

이번 글에서는 현재 대부분의 상관관계 기반 추천모델이 어떤 문제점을 가지고 있고, 인과추론이 어떻게 이러한 문제점들을 해결하고 있으며, 구체적으로 전환율 예측 도메인에서 어떻게 인과추론이 적용되고 있는지 알아봤습니다. 사실 복잡한 내용을 하이 레벨에서 설명했기 때문에 구체적인 내용을 파악하기 힘드셨을 수도 있을 것 같은데 그냥 대강 “아 이러한 문제점들이 있구나, 인과추론 기법에 대표적으로 뭐가 있구나” 정도로만 이해해주시길 바랍니다.

추가적으로 설명하자면, 데이블 AI팀은 위 5장에서 설명한 방법론에도 많은 한계점이 있다는 것을 발견했고, 이를 해결하여 새로운 방법론을 제시했습니다. 이 방법을 사용했을 때 기존의 방법보다 더욱 뛰어난 예측 성능을 보였습니다. 현재 논문 투고를 준비하고 있으며 투고 후 더욱 자세한 내용을 다루도록 하겠습니다.

참고 문헌

위의 그림들은 아래 링크 및 논문에서 가져왔습니다.

  1. Entire Space Multi-Task Model: An Effective Approach for Estimating Post-Click Conversion Rate
  2. ESCM2: Entire Space Counterfactual Multi-Task Model for Post-Click Conversion Rate Estimation
  3. Causal Inference in Recommender Systems: A Survey and Future Directions
  4. Recognize Strategic Opportunities with Long-Tail Data