RLCD: Reinforcement Learning from Contrastive Distillation for LM Alignment
RLCD는 대비되는 프롬프트로 선호쌍을 만들고 사후 채점 없이 정렬을 학습한다. 7B 시뮬레이션의 개선과 30B의 혼합 결과를 살펴보고, 출력 길이와 기준선 설정이 해석에 주는 제약을 짚는다.
Paper: Kevin Yang, Dan Klein, Asli Celikyilmaz, Nanyun Peng, & Yuandong Tian (2024). RLCD: Reinforcement Learning from Contrastive Distillation for LM Alignment. ICLR 2024. arXiv:2307.12950v3 (2024-03-16). 논문 PDF · 공식 코드. 이 글은 40쪽의 v3를 기준으로 한다.
Abstract: 언어 모델의 응답을 사람의 선호에 맞추려면, 어떤 응답이 더 나은지 알려 주는 학습 신호가 필요하다. RLCD는 그 신호를 만드는 단계에 주목한다. 같은 프롬프트에서 응답 두 개를 생성한 뒤 비교하는 대신, 원하는 속성을 유도하는 프롬프트와 그 반대 속성을 유도하는 프롬프트에서 하나씩 생성한다. 어느 프롬프트에서 나왔는지로 선호 라벨을 정하고, 이후에는 선호 모델 학습과 PPO를 수행한다. 무해성·도움성·이야기 개요 과제에서 7B 모델로 선호 데이터를 만들 때 큰 개선을 보였지만, 30B 모델을 사용하면 과제와 평가자에 따라 우열이 달라졌다. 이 글은 생성 분포를 바꾸는 설계가 왜 유효한지, 그리고 모델 규모·출력 길이·기준선 설정이 결과 해석에 어떤 제약을 주는지 살펴본다.
수식 없이 읽는 버전은 쉽게 읽는 RLCD에 있다.
Executive Summary
| 항목 | 설명 |
|---|---|
| 연구 질문 | 사람 라벨 없이 선호 데이터를 만들 때, 생성 단계에서 응답의 품질 차이를 유도하면 사후 채점보다 좋은 학습 신호를 얻을 수 있는가? |
| 핵심 방법 | 원래 프롬프트 p를 p⁺·p⁻로 바꾸고 각각 o⁺·o⁻를 생성한다. o⁺를 선호 응답으로 라벨한 뒤 선호 모델과 PPO 정책을 학습한다. |
| 설계 조건 | 두 프롬프트는 목표 속성에서 대비되되, 나머지 표현과 형식은 최대한 비슷해야 한다. o⁺가 항상 더 좋은 응답이라는 보장은 없다. |
| 모델 구분 | 정렬 대상은 모든 조건에서 LLaMA-7B다. RLCD7B·RLCD30B의 숫자는 선호 데이터를 만드는 모델의 크기를 가리킨다. |
| 7B 결과 | GPT-4 평가에서 RLAIF7B 대비 RLCD의 선호 비율은 무해성 84.8%, 도움성 85.4%, 개요 품질 78.5%다. |
| 30B 결과 | RLAIF30B와 비교하면 사람 평가의 차이는 작아지고, GPT-4는 도움성과 개요에서 RLAIF를 선호한다. 일관된 우위로 일반화하기 어렵다. |
| 주요 한계 | 주 비교의 RLAIF는 제로샷 재구현이며, 출력 길이를 맞춘 비교가 없다. 선호 모델의 사람 라벨 일치도와 최종 응답 평가는 구분해야 한다. |
목차
- 사람 라벨 없이 선호쌍을 만드는 두 갈래
- 같은 프롬프트에서 두 번 뽑지 않는다
- 프롬프트 두 개를 어떻게 만드는가
- 세 과제와 실험 설정
- 7B 시뮬레이션에서의 결과
- 30B 시뮬레이션에서는 우열이 달라진다
- 선호 모델과 재채점 변형
- 길이·다양성과 통제 실험
- 단순화된 모형으로 보는 라벨 잡음
- 한계와 적용 조건
1. 사람 라벨 없이 선호쌍을 만드는 두 갈래
RLHF의 병목은 선호 데이터다. 프롬프트 p 하나에서 출력 두 개 (o₁, o₂)를 뽑고 사람이 어느 쪽이 나은지 라벨하는데, 질 좋은 라벨을 대규모로 모으는 것이 비싸고 오래 걸린다. 사람이 직접 선호쌍을 라벨하는 부담을 줄이는 대안으로 RLAIF와 맥락 증류를 비교할 수 있다.
RLAIF는 사람 대신 LLM으로 선호를 평가한다(Bai et al., 2022b). 이 논문이 비교하는 설정에서는 같은 프롬프트에서 두 응답을 생성한 뒤 LLM으로 채점한다. 두 응답의 품질이 비슷하면 판정이 어려워지고, 채점 모델이 작은 경우 라벨 잡음의 영향이 커질 수 있다. 이것이 RLCD가 다루려는 문제다.
맥락 증류는 원하는 행동을 유도하는 문맥을 넣어 응답을 만든 뒤, 그 응답을 지도 미세조정의 목표로 사용한다(Sun et al., 2023). 모델이 추가 문맥 없이도 해당 행동을 하도록 학습하는 방식이다. 긍정적인 예시를 제공할 수 있지만, 어떤 응답보다 무엇이 나은지 알려 주는 쌍 비교 신호는 직접 사용하지 않는다.
논문의 제안은 두 장점을 합치는 것이다. 쌍 선호로 RL을 돌리되, 그 쌍을 방향성 있는 프롬프트에서 만든다. 논문 §1
Figure 1. RLCD는 대비되는 프롬프트에서 응답을 생성하고 라벨을 정한다. RLAIF는 생성 후 채점하며, 맥락 증류는 긍정 응답만으로 지도 학습한다. 논문 v3, 2쪽 Figure 1의 원도판을 추출해 인용했다.
2. 같은 프롬프트에서 두 번 뽑지 않는다
RLCD의 학습 과정은 생성·라벨링·최적화로 나뉜다. 각 프롬프트 p에 대해 p⁺와 p⁻를 만들고, 원래 LLM에 넣어 o⁺와 o⁻를 얻고, 사후 채점 없이 o⁺를 선호로 라벨한다. 그다음은 표준 RLHF 파이프라인이다. 시뮬레이션된 선호쌍으로 선호 모델을 학습하고, 거기서 보상 모델을 유도해 PPO로 원래 LLM을 정렬한다. 선호 모델도 출발점과 같은 무정렬 LLM을 미세조정해 만든다.
PPO(Schulman et al., 2017)는 학습된 보상으로 정책을 갱신한다. 선호 모델은 두 응답에 각각 점수를 매기고 그 차이가 선호 데이터와 맞도록 학습되므로, 그 점수를 그대로 보상으로 쓸 수 있다(Bai et al., 2022a). 원래 분포에서 너무 멀어지지 않도록 KL 정규화를 건다. 논문 §3.1
논문이 강조하는 교환은 이렇다. 판정하기 어려운 쌍의 비중을 낮추고 라벨의 신뢰도를 높이려 한다. 분류 모델은 보통 결정 경계 가까운 예제에서 이득을 보지만, RLAIF에서는 그런 예제가 사람이 라벨한 것이 아니라 극도로 잡음이 많을 수 있으므로 정확히 라벨할 수 없다면 차라리 피하는 편이 나을 수 있다는 것이다.
이를 절차로 재구성하면 다음과 같다. 아래는 논문 §3.1의 설명을 정리한 것이며 원문의 별도 알고리즘을 옮긴 것은 아니다.
각 원래 프롬프트 p에 대해:
p⁺ = 원하는 속성을 유도하는 프롬프트
p⁻ = 반대 속성을 유도하는 프롬프트
o⁺ ~ 생성 모델(p⁺), o⁻ ~ 생성 모델(p⁻)
선호 학습 데이터에 (p, o⁺ ≻ o⁻)를 추가
선호 모델을 학습하고, 그 보상으로 LLaMA-7B를 PPO 학습
여기서 자동으로 정해지는 것은 학습 라벨이다. 실제 응답 품질이 매번 그 순서를 따른다는 뜻은 아니다. 생성 모델이 대비 지시를 충분히 따르고, 두 분포 사이의 차이가 원하는 속성을 반영해야 유용한 신호가 된다.
3. 프롬프트 두 개를 어떻게 만드는가
기준은 둘이다.
- p⁺가 p⁻보다 원하는 속성을 드러내는 출력을 낼 가능성이 높을 것. 뒤집어 말하면 p⁻가 반대 속성을 명시적으로 부추겨도 된다.
- p⁺와 p⁻의 표면형, 즉 실제 문구와 형식이 최대한 비슷할 것.
두 조건을 함께 만족시키는 것이 중요하다. 두 프롬프트가 유도하는 분포는 원하는 속성에서는 차이를 보이고 그 외 속성에서는 비슷해야 의도하지 않은 편향을 줄일 수 있다. 논문은 실무에서 첫째보다 둘째에 집중하는 편이 나을 수 있다고 적고, 괄호 안에 짧은 서술을 넣는 방식을 권한다. 논문 §3.2
실제 구현이 그렇다. 무해성과 도움성에서는 "Assistant:"의 콜론 앞에 대비되는 서술을 괄호로 넣는다. 개요 과제에서는 모든 프롬프트를 "1."로 끝내 번호 매긴 개요의 시작임을 맞춘다. 프롬프트는 전부 제로샷이다.
무해성에는 16쌍을 쓰는데, Bai et al. (2022b)이 RLAIF에 쓴 16개 채점 프롬프트와 비슷하게 썼다. 도움성은 한 쌍, 개요는 세 쌍(흥미로움·형식·전제 관련성)이다.
4. 세 과제와 실험 설정
과제 셋. 무해성 프롬프트는 공격적이거나 사회적으로 받아들이기 어려운 대화가 자주 섞인 집합이고, 목표는 그런 맥락에서도 받아들일 만한 출력을 내되 부차적으로 여전히 도움이 되고 관련성이 있을 것이다. 논문은 "Thank you!"나 "Sorry" 같은 일반적 인사에 그치지 말 것을 부차 목표로 적는다. 도움성 프롬프트는 정보나 조언을 구하는 대화, 개요 프롬프트는 이야기 전제를 주고 개요를 요청하는 대화다.
무해성·도움성 프롬프트는 Bai et al. (2022a)에서 착안했고 그쪽 학습 집합을 쓴다. 각 학습 집합은 4만 건이 조금 넘는다. 개요는 인터넷에서 가져온 전제 4만 건을 쓰고, 어시스턴트 응답이 "Here is a possible outline:\n\n1."로 시작하도록 두어 기본 형식을 부추긴다("encourage"). 부록 A.3에 따르면 RLCD의 개요 프롬프트는 이 접두사를 대체한다.
모델. 정렬 대상은 모든 조건에서 LLaMA-7B다. 갈리는 것은 선호 데이터를 만드는 모델로, RLCD7B와 RLCD30B가 각각 LLaMA-7B와 LLaMA-30B를 쓴다. 30B로 시뮬레이션하고 7B를 정렬하는 것은 모델 증류로도 읽을 수 있다고 각주가 적는다. 구현은 AlpacaFarm(Dubois et al., 2023) 코드베이스를 쓴다.
기준선 셋. LLaMA(무정렬, 정합성 확인용), RLAIF(Constitutional AI 재구현 — 코드와 모델이 비공개라 AlpacaFarm으로 다시 구현했고, 무해성 채점에는 Bai et al. (2022b)과 똑같은 프롬프트 템플릿을 쓰되 RLCD에 맞추려고 제로샷으로 돌린다), Context-Dist(RLCD와 같은 p⁺의 o⁺로 지도 미세조정).
평가. 각 방법쌍과 평가 지표에 대해 사람 평가는 200개 예제, GPT-4 평가는 1000개 예제의 응답 쌍을 비교한다. 사람은 두 응답 중 어느 쪽이 얼마나 나은지 1–8 척도로 답한다. 표에서는 순서를 정규화해 두 방법의 점수 합이 9가 되도록 표시한다. 따라서 4.5 대 4.5는 평균 선호가 균형을 이룬다는 뜻이며, 승률 50%나 개별 응답의 절대 품질 점수로 바꾸어 읽을 수 없다. 출력 제시 순서는 무작위다. 무해성 과제에서는 Bai et al. (2022b)의 프롬프트가 도움성도 어느 정도 부추기므로 무해성(Harm)과 도움성(Help)을 둘 다 잰다. 논문 §4
Figure 2. 무해성 평가에 사용한 사람 주석 화면. 응답 A·B를 1–8 척도로 비교하며, 중앙의 4·5도 각각 한쪽에 약한 선호를 표시한다. 개별 문항에는 동점 선택지가 없지만 집계 평균은 같아질 수 있다. 논문 v3, 20쪽 Figure 2의 원도판을 추출해 인용했다.
GPT-4가 선호를 밝히지 못하거나 답변을 거부한 경우에는 두 방법에 0.5씩 배정한다. 아래의 GPT-4 비율은 이 처리가 포함된 비교 점수이며, 과제 정답률이 아니다. 논문 부록 F
5. 7B 시뮬레이션에서의 결과
7B로 선호 데이터를 시뮬레이션할 때 차이가 크다.
| 비교 (GPT-4, 1000예제, %) | 무해성 Harm | 무해성 Help | 도움성 Help | 개요 Qual |
|---|---|---|---|---|
| RLCD7B 대 LLaMA | 82.8 / 17.2 | 77.0 / 23.0 | 90.7 / 9.3 | 76.0 / 24.0 |
| RLCD7B 대 RLAIF7B | 84.8 / 15.2 | 71.0 / 29.0 | 85.4 / 14.6 | 78.5 / 21.5 |
| RLCD7B 대 Context-Dist7B | 69.7 / 30.3 | 67.7 / 32.3 | 89.5 / 10.5 | 71.8 / 28.2 |
각 셀은 RLCD / 비교 방법 순서다. Harm은 더 무해한 응답, Help는 더 도움이 되는 응답, Qual은 더 좋은 개요에 대한 선호를 뜻한다. 논문 Table 3
사람 평가(200예제, 정규화해 두 값의 합이 9.00)도 대체로 같은 방향이다. RLAIF7B 대비 5.62/3.38 · 4.64/4.36 · 5.88/3.12 · 5.97/3.03이다. 무해성 과제의 도움성 열에서 4.64/4.36으로 차이가 가장 작은데, 논문은 이를 "무해성 지표에서 낫되 도움성을 희생하지 않는다"로 읽는다. 다만 평균 차이가 작다는 사실과 통계적으로 동등하다는 주장은 구분해야 한다.
Context-Dist 대비 사람 평가의 무해성 점수는 4.51/4.49로 매우 가깝다. 7B에서 개선 방향이 대체로 일치해도 모든 지표에서 같은 크기의 차이가 나는 것은 아니다. 논문 Table 2
Table 4의 에디슨 관련 질문에서 RLCD7B는 다른 방법보다 상세한 응답을 생성한다. 이는 도움성 개선을 이해하는 예시이지만, 응답 길이도 함께 달라진다. 정성 예시 하나로 정확성이나 길이와 독립적인 품질 향상을 입증할 수는 없다. 길이 통계는 8절에서 함께 살펴본다.
6. 30B 시뮬레이션에서는 우열이 달라진다
선호 데이터를 만드는 모델을 30B로 키우면 RLAIF와의 격차가 줄고 평가자에 따라 결론도 달라진다. 이때도 최종 정책은 LLaMA-7B다.
| RLCD30B / RLAIF30B | 무해성 Harm | 무해성 Help | 도움성 Help | 개요 Qual |
|---|---|---|---|---|
| 사람 평균 점수 (합 9.00) | 4.71 / 4.29 | 4.50 / 4.50 | 4.51 / 4.49 | 4.76 / 4.24 |
| GPT-4 선호 비율 (%) | 60.3 / 39.7 | 55.3 / 44.7 | 47.8 / 52.2 | 35.9 / 64.1 |
사람 평가에서는 무해성 과제의 도움성이 같은 평균이고, 도움성 과제의 차이도 0.02점에 그친다. GPT-4는 무해성 과제의 두 지표에서 RLCD를 선호하지만, 도움성과 개요에서는 RLAIF를 선호한다. 특히 개요 품질은 35.9% 대 64.1%다. 따라서 30B 조건에서는 과제와 평가자를 나누어 결과를 읽어야 한다. 논문 Table 2, Table 3
본문 Results의 도입은 두 평가에서 기준선보다 우수하다고 넓게 서술하지만, 뒤에서는 GPT-4가 RLAIF30B를 선호하는 경우를 인정한다. 요약 문장만으로 모든 비교의 우위를 주장하기보다 표의 예외를 함께 전달하는 편이 정확하다. 사람 점수의 작은 차이를 근거로 통계적 우위나 동등성을 단정해서도 안 된다.
부록 G에서 RLCD와 RLAIF를 비교한 사람–GPT-4 일치율은 도움성에서 7B의 74.7%에서 30B의 62.8%로, 개요에서 77.5%에서 59.0%로 낮아진다. 다만 이 계산에서는 GPT-4가 판정을 내리지 못한 예제를 제외한다. 이 수치는 평가자 불일치를 보여 주며, 어느 평가자가 옳은지 판정하는 근거는 아니다. 논문 Table 23
저자들은 §5.2에서 모델이 커지면 어려운 쌍의 채점도 유용해질 수 있다고 설명한다. 부록 N은 더 큰 모델에서 대비 프롬프트의 강도를 조절하는 방향을 제안하면서, 실험에서는 7B와 30B에 같은 프롬프트를 썼다고 밝힌다. 이는 후속 실험의 가설이다. 프롬프트 강도를 바꾸는 통제 실험 없이 현재 30B 결과의 원인을 확정할 수는 없다.
7. 선호 모델과 재채점 변형
선호 모델. 무해성과 도움성에서 사람이 라벨한 2000개 예제로 RLCD와 RLAIF의 선호 모델을 잰다.
| 무해성 Acc. | 무해성 Prob. | 도움성 Acc. | 도움성 Prob. | |
|---|---|---|---|---|
| RLAIF7B | 35.6 | 0.492 | 60.6 | 0.508 |
| RLCD7B | 52.4 | 0.516 | 64.4 | 0.601 |
| RLAIF30B | 45.7 | 0.489 | 66.2 | 0.551 |
| RLCD30B | 55.9 | 0.542 | 66.7 | 0.628 |
Acc.는 사람이 선호한 응답을 더 높게 평가한 비율(%)이고, Prob.는 그 응답에 부여한 선호 확률의 평균이다. RLAIF의 무해성 정확도는 7B·30B 모두 50%보다 낮다. RLCD는 더 높지만 52.4%·55.9%여서 절대적인 일치도에는 여전히 한계가 있다. 이것은 선호 모델의 사람 라벨 일치도이며, 최종 정책의 무해성 점수와 같은 측정값이 아니다.
저자들은 기존 Constitutional AI가 few-shot 채점과 더 큰 모델을 사용했다는 차이를 논의한다. 부록 C의 Table 15에서 few-shot으로 채점한 RLAIF-Few7B는 무해성 정확도가 40.6으로 여전히 우연 이하이고, RLAIF-Few30B는 57.0으로 우연 위다. 캡션도 "Only with both (1) few-shot prompting and (2) 30B model scale … does RLAIF succeed in achieving higher-than-chance agreement"라 적는다. 곧 인용한 설명을 자기 설정에서 확인한 셈이고, 7B에서는 few-shot만으로 선호 모델이 고쳐지지 않는다. 논문 부록 C
Table 5에서 RLCD의 정확도와 선호 확률은 두 데이터셋 모두 RLAIF보다 높다. 그러나 사람 라벨과의 일치도 향상이 최종 정책 성능에 그대로 비례하는 것은 아니므로 두 평가를 함께 확인해야 한다. 논문 §5.1
재채점 변형. p⁺·p⁻로 (o⁺, o⁻)를 만들되 라벨은 RLAIF의 채점 프롬프트로 다시 매기는 RLCD-Rescore를 붙인다. GPT-4 평가의 7B 조건에서는 RLCD의 선호 비율이 높다(86.0/14.0 · 75.8/24.2 · 86.3/13.7 · 88.8/11.2). 30B에서는 54.6/45.4 · 53.2/46.8 · 47.3/52.7 · 36.4/63.6으로 도움성과 개요에서 재채점 변형이 앞선다.
30B에서 RLAIF와 재채점 변형은 모두 도움성과 개요에서 RLCD보다 높은 GPT-4 선호를 받는다. 반면 무해성의 두 지표에서는 RLCD가 앞선다. 사후 채점을 없애는 것이 모든 규모와 과제에서 유리하다는 결론보다, 채점 모델의 능력에 따라 생성으로 대비를 만드는 이점이 달라진다는 해석을 뒷받침한다. 논문 §5.2, Table 6
8. 길이·다양성과 통제 실험
부록은 선호 점수만으로 보이지 않는 응답 특성과 기준선 조건을 보여 준다.
8.1 출력 길이와 품질의 기여는 분리되지 않았다
생성 상한은 300토큰이고, 그 외에 응답 길이를 맞추는 제약은 두지 않았다. 방법별 평균 출력 길이와 표준편차는 다음과 같다.
| 7B 시뮬레이션 (토큰) | 무해성 | 도움성 | 개요 |
|---|---|---|---|
| LLaMA | 67.5 ± 89.1 | 79.1 ± 106.4 | 159.4 ± 88.4 |
| RLAIF7B | 42.1 ± 40.9 | 35.4 ± 29.3 | 54.8 ± 39.5 |
| Context-Dist7B | 26.5 ± 24.6 | 34.1 ± 39.3 | 80.7 ± 71.6 |
| RLCD7B | 66.5 ± 28.8 | 118.0 ± 48.9 | 115.9 ± 46.8 |
도움성에서 RLCD7B의 출력이 RLAIF7B의 3.33배, 개요에서 2.11배, 무해성에서 1.58배 길다.
길이 차이는 평가를 해석할 때 함께 볼 변수다. 상세한 응답이 실제로 더 유용할 수도 있고, 평가자가 장황함 자체를 선호할 수도 있다. 길이를 맞춘 비교가 없으므로 이 결과만으로 두 영향을 분리할 수 없다. 다만 평균 길이와 선호 점수가 일대일로 움직이는 것도 아니다. 7B 무해성에서 RLCD7B(66.5토큰)는 LLaMA(67.5토큰)보다 약간 짧으면서 GPT-4 비교에서는 82.8/17.2로 앞선다.
30B 쪽은 방향이 더 어긋난다. RLCD30B의 출력이 도움성 108.3 대 84.7(1.28배), 개요 138.7 대 88.6(1.57배)로 더 긴데 GPT-4 평가에서는 두 과제 모두 진다(47.8/52.2, 35.9/64.1). 30B 무해성은 반대로 RLCD가 더 짧다(73.3 대 78.1). 더 긴 응답이 항상 높은 선호를 받지는 않는다는 사례다. 그렇다고 길이 편향이 없다는 증거는 아니다.
저자들은 긴 응답이 평균적으로 도움성과 개요 작성의 목표를 더 잘 만족시킬 수 있다고 해석한다. 그러나 길이를 통제해 확인한 인과적 결론은 아니다. 후속 평가에서는 길이를 맞춘 비교와 원래 길이를 유지한 비교를 함께 제시할 필요가 있다. 논문 Table 34, Table 35
8.2 무해성 개선과 응답 다양성을 함께 본다
Dist-n은 전체 n-gram 출현 수에 대한 서로 다른 n-gram 종류 수의 비율이다. n-gram은 연속된 n개 단어 묶음을 뜻한다. 논문은 출력당 최대 20단어, 총 10,000단어 표본으로 계산한다. 대부분 조건에서 기준선과 비슷하지만 RLCD7B의 무해성 응답은 다양성이 낮다.
| 7B, 무해성 | Dist-1 | Dist-2 | Dist-3 |
|---|---|---|---|
| LLaMA | 22.9 | 74.0 | 94.7 |
| RLAIF7B | 25.9 | 77.2 | 96.7 |
| RLCD7B | 11.0 | 42.5 | 66.4 |
RLCD7B의 무해성 Dist-1이 11.0으로 LLaMA의 절반 아래, RLAIF7B의 절반 아래다. 저자들은 반복적인 답변 거부가 다양성을 낮춘다고 설명하며, 모든 응답이 같은 형태로 수렴하는 완전한 모드 붕괴와는 구분한다. 30B에서는 같은 정도의 감소가 나타나지 않는다. RLCD30B의 무해성은 21.3 / 68.8 / 91.2로 기준선 언저리다. 곧 이 현상은 7B 한 조건에 국한된다. 논문 부록 J.3
8.3 대비 생성과 라벨링 효과를 나누는 실험
부록 L은 RLAIF에서도 두 응답을 긍정 프롬프트 p⁺로 생성하게 한다. 이 변형과 비교해도 RLCD7B의 GPT-4 선호 비율은 무해성 Harm 81.2%, 같은 과제의 Help 70.7%, 도움성 Help 89.9%, 개요 Qual 81.0%다. 긍정 문구만 제공하는 것보다 p⁺와 p⁻의 대비가 중요하다는 해석을 뒷받침한다. 논문 Table 39
부록 M은 무해성·도움성 과제에서 사람 선호 데이터를 20% 섞은 설정에서도 RLCD가 RLAIF보다 높은 GPT-4 선호를 받되 격차는 줄어든다고 보고한다. 부록 B에서는 RLAIF의 확률 라벨을 이진화한 RLAIF-Binary7B와 비교해도 RLCD7B가 네 지표에서 앞선다. 따라서 관측된 차이를 긍정 프롬프트의 유무나 이진 라벨의 사용만으로 설명하기는 어렵다. 다만 이 통제 결과를 시험하지 않은 규모까지 확대할 수는 없다. 논문 부록 B, 부록 M
8.4 프롬프트와 기준선 설정에 따른 경계
도움성을 섞지 않고 무해성에만 집중한 프롬프트로 돌리면 GPT-4 평가에서 RLCD가 여전히 앞서지만, 대화와 무관한 응답을 자주 생성한다고 저자들은 보고한다. 독성 맥락 뒤에서 무의미한 출력을 내는 법을 배우기는 쉽다는 것이다. 이 설정의 비교는 7B에서만 돌렸다. 논문 부록 D
주 실험의 RLAIF는 제로샷인데, Bai et al. (2022b)의 원래 방법은 few-shot이다. few-shot RLAIF를 붙여 보면 30B 무해성에서 RLCD가 42.1 대 57.9로 진다(같은 무해성 과제의 도움성 지표에서는 56.9 대 43.1로 앞선다). 논문은 이 비교가 "somewhat unfair to RLCD"라고 적는데 RLCD가 제로샷이기 때문이다. 동시에 RLAIF-Few30B의 출력이 무해하지만 무의미한 응답으로 심한 모드 붕괴를 보인다고 적고 예시를 싣는다. 논문 부록 C 및 Table 16
8.5 보류 보상 모델은 보조 평가다
무해성과 도움성 과제에서는 사람 선호 데이터로 학습한 보류 보상 모델로도 평가한다. 개요 과제는 이 평가에 포함되지 않는다. 이 두 과제에서 RLCD의 최종 출력은 30B 도움성 한 칸을 빼고 모두 최고 보상을 받는다(그 칸은 RLAIF30B 0.91 대 RLCD30B 0.80). 생성된 선호쌍도 이 모델로 평가하면 RLCD의 라벨 일치도가 더 높다. 다만 이 값은 사람이 모든 쌍을 직접 검토한 정확도가 아니다. 사람 선호로 학습한 별도 모델을 대리 평가자로 사용한 결과이며, 그 모델의 오류 가능성이 남는다. 논문 Table 28, Table 29, 부록 K.1 및 Table 36
9. 단순화된 모형으로 보는 라벨 잡음
부록 N은 생성과 채점의 잡음을 분리한 모형으로 설계의 직관을 설명한다. 응답 o가 원하는 속성을 얼마나 갖는지를 A(o)라는 실수 값으로 표현하고, 프롬프트 p 아래의 생성 분포를 정규분포로 가정한다. 채점기는 실제 속성 값에 독립적인 잡음이 더해진 값을 비교한다. 논문의 가정을 수식으로 쓰면 다음과 같다.
A(o) \sim \mathcal{N}(\mu(p),\sigma_G), \qquad
D(o_1,o_2)=\operatorname{sign}\bigl(A(o_1)+e_1-A(o_2)-e_2\bigr),e_1,e_2 \overset{\mathrm{i.i.d.}}{\sim} \mathcal{N}(0,\sigma_D).여기서 μ(p)는 프롬프트가 유도하는 속성의 평균, σ_G와 σ_D는 각각 생성과 채점의 잡음 규모다. 정규분포의 두 번째 인자는 원문 표기를 따른다.
생성·채점 잡음의 표준편차를 모두 1로 놓으면, RLAIF가 올바른 순서를 라벨할 확률은 0.75다. 두 응답의 실제 속성 값이 0.2 이내로 가까운 어려운 쌍에 한정하면 이 확률은 약 0.528로 떨어진다. RLCD에서 두 생성 분포의 평균 차이를 3으로 두었을 때 같은 조건의 정확도는 약 0.574다. 뒤의 두 값은 10⁸회 시뮬레이션으로 계산했다. 논문 부록 N의 가정, 계산 결과
이는 판정하기 어려운 쌍에서는 채점 잡음이 실제 품질 차이를 가릴 수 있다는 설명이다. 생성 단계에서 목표 속성의 차이를 유도하면 사후 채점 없이도 유용한 라벨을 얻을 수 있다는 직관을 제공한다.
그러나 실제 언어 응답의 품질이 하나의 정규분포 축으로 표현된다는 보장은 없다. 프롬프트 변경이 도움성·무해성·길이·문체를 동시에 바꿀 수도 있다. 따라서 이 분석을 실제 RLCD의 정확도 보장이나 최종 정책의 성능 정리로 읽어서는 안 된다.
또한 이론의 0.75와 비교하는 부록 K.1의 실험값은 보류 보상 모델과의 일치도다. 사람과의 직접 일치율, 생성 라벨의 정확도, PPO 이후의 응답 선호는 서로 다른 측정 단계다. 이 구분을 유지해야 이론과 실험을 과도하게 연결하지 않을 수 있다.
10. 한계와 적용 조건
10.1 논문이 밝힌 한계
저자들은 더 큰 모델을 정렬할 때 결과가 유지되는지, DPO(Rafailov et al., 2023) 같은 다른 최적화 방법에도 이점이 이어지는지를 후속 과제로 남긴다. 실험은 영어에 한정되며, RLCD와 기준선 모두 프롬프트 설계에 의존한다. 논문 Limitations 및 Ethics
프롬프트 의존성은 추상적인 주의사항에 그치지 않는다. 부록 A.1에서는 RLCD가 응답 앞에 인사나 사과를 붙이는 간단한 방식으로 보상을 높일 수 있어 공손함 관련 표현을 줄였다고 설명한다. 부록 D에서는 무해성만 강조하면 대화와 무관한 응답이 나올 수 있었다. 원하는 속성을 명시하는 것과 그 속성을 유용하게 학습시키는 것은 구분해야 한다. 논문 부록 A.1, 부록 D
10.2 실험 설정에서 남는 해석의 한계
기준선의 조건. 주 비교는 RLCD와 맞춘 제로샷 RLAIF 재구현이다. few-shot RLAIF와 비교한 부록에서는 30B 무해성의 우열이 달라진다. 주 표의 차이를 RLAIF 계열 전체에 대한 우위로 확대할 수 없다. 동시에 few-shot 비교에서 관찰된 도움성 저하와 반복 응답도 함께 확인해야 한다.
길이의 기여. RLCD7B는 RLAIF7B보다 평균 출력이 길고, 길이를 맞춘 평가는 없다. 이 사실은 개선이 길이 때문이라는 증거도, 길이와 무관하다는 증거도 아니다. 품질과 길이의 기여가 분리되지 않았다는 것이 현재 증거의 범위다.
모델 선택 절차. 부록 E는 각 방법 자신의 보상 모델로 KL 계수와 PPO 스텝을 선택한다고 설명한다. 더 강한 외부 평가 모델을 가정하지 않으려는 선택이지만, 보상 모델의 품질은 학습과 설정 선택 양쪽에 영향을 줄 수 있다. 따라서 최종 성능 차이를 생성 데이터의 라벨 정확도 하나로 환원하기 어렵다. 이것이 관측된 격차의 원인이라는 결론까지 검증된 것은 아니다. 논문 부록 E
평가자 불일치. 사람과 GPT-4는 30B 조건에서 서로 다른 방향의 결과를 낸다. 평균 선호, 절대 품질, 안전성, 통계적 유의성은 같은 개념이 아니다. 특정 평가자의 승률만으로 다른 축의 성능까지 보장할 수 없다.
10.3 재현과 적용 시 확인할 조건
확인한 공식 저장소는 보관(archived) 상태이며, 데이터 생성·학습 코드와 무해성·도움성의 시뮬레이션 데이터가 공개돼 있다. README는 이야기 개요 프롬프트를 법적 이유로 포함하지 않았다고 밝힌다. 따라서 세 과제의 재현 자료가 모두 같은 범위로 공개된 것은 아니다. 공식 저장소 README
이 리뷰는 논문과 공개 자료를 대조한 해설이며, 모델 학습이나 벤치마크를 독립 재실행한 결과는 아니다.
| 확인할 조건 | 필요한 비교 |
|---|---|
| 생성 모델과 채점 모델의 능력 | 같은 크기의 제로샷 비교와 충분히 강한 few-shot 채점 기준선을 구분한다. |
| 대비 프롬프트의 효과 | 목표 속성의 차이와 길이·문체 등 함께 바뀌는 속성을 살핀다. |
| 목표 간 균형 | 무해성뿐 아니라 도움성·관련성·응답 다양성을 함께 평가한다. |
| 길이와 평가자 | 길이를 맞춘 비교, 사람 평가, 모델 평가를 나누어 보고한다. |
| 학습 설정과 비용 | 프롬프트·데이터 분할·KL 계수·PPO 스텝·생성 및 채점 비용을 기록한다. |
사후 채점을 생략하면 데이터 생성 파이프라인의 한 단계가 줄지만, 이 논문은 전체 비용 절감률을 정량적으로 제시하지 않는다. 보상 모델 학습과 PPO 비용까지 사라지는 것은 아니다.
10.4 결론
RLCD의 기여는 선호 데이터의 품질을 생성 분포의 설계 문제로 다룬 것이다. 작은 모델이 비슷한 두 응답의 우열을 정확히 판정하기 어렵다면, 처음부터 목표 속성이 대비되는 응답을 생성하는 방법이 더 나은 학습 신호를 줄 수 있다. 7B 시뮬레이션의 결과와 재채점·긍정 프롬프트 통제 실험은 이 아이디어를 뒷받침한다.
다만 30B 시뮬레이션에서는 과제와 평가자에 따라 우열이 달라지고, 프롬프트와 출력 길이의 영향도 남는다. RLCD는 사람의 선호를 완전히 대체하는 일반 해법보다, 생성 모델의 지시 수행 능력과 채점 능력 사이의 차이를 활용하는 데이터 구성 방법으로 읽는 편이 정확하다. 적용할 때는 대비 생성으로 얻는 라벨 신뢰도와 함께, 그 과정에서 놓치는 어려운 예제와 원치 않는 응답 특성도 확인해야 한다.
References
Bai, Y., Jones, A., Ndousse, K., Askell, A., Chen, A., DasSarma, N., et al. (2022a). Training a helpful and harmless assistant with reinforcement learning from human feedback. arXiv:2204.05862
Bai, Y., Kadavath, S., Kundu, S., Askell, A., Kernion, J., Jones, A., et al. (2022b). Constitutional AI: Harmlessness from AI feedback. arXiv:2212.08073
Dubois, Y., Li, X., Taori, R., Zhang, T., Gulrajani, I., Ba, J., Guestrin, C., Liang, P., & Hashimoto, T. B. (2023). AlpacaFarm: A simulation framework for methods that learn from human feedback. arXiv:2305.14387
Rafailov, R., Sharma, A., Mitchell, E., Ermon, S., Manning, C. D., & Finn, C. (2023). Direct preference optimization: Your language model is secretly a reward model. arXiv:2305.18290
Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). Proximal policy optimization algorithms. arXiv:1707.06347
Sun, Z., Shen, Y., Zhou, Q., Zhang, H., Chen, Z., Cox, D., Yang, Y., & Gan, C. (2023). Principle-driven self-alignment of language models from scratch with minimal human supervision. arXiv:2305.03047
Yang, K., Klein, D., Celikyilmaz, A., Peng, N., & Tian, Y. (2024). RLCD: Reinforcement learning from contrastive distillation for LM alignment. International Conference on Learning Representations. arXiv:2307.12950v3

