-
Interpreting Language Model Parameters논문 리뷰 2026. 5. 29. 17:22
https://www.goodfire.ai/research/interpreting-lm-parameters#
번역 및 정리Interpreting Language Model Parameters (VPD) — 한국어 정리 & 쉬운 설명
원문: Goodfire, Interpreting Language Model Parameters, 2026-05-05
https://www.goodfire.ai/research/interpreting-lm-parameters
코드: https://github.com/goodfire-ai/param-decomp
저자: Lucius Bushnaq, Dan Braun, Oliver Clive-Griffin, Bart Bussmann, Nathan Hu, Michael Ivanitskiy, Linda Linsefors, Lee Sharkey (Goodfire · MATS 등)
0. 한 줄 요약
언어모델의 가중치(파라미터) 자체를 해석 가능한 작은 부품(rank-1 subcomponent)들의 합으로 분해하는 방법 VPD(adVersarial Parameter Decomposition). 기존 SPD를 adversarial(적대적) 마스킹으로 개선했고, 67M 파라미터 LM 전체에 적용해 "파라미터 단위 circuit 분석"을 처음으로 가능케 했다.
쉽게 말하면: 지금까지 해석가능성 연구는 모델이 "생각하는 도중에 나오는 값(activation)"을 들여다봤다. 이 논문은 대신 "모델이 무엇을 아는지가 적혀 있는 설계도(weight)"를 직접 부품 단위로 뜯어본다.
1. 왜 activation이 아니라 parameter인가
기존 주류(SAE, transcoder)는 중간 활성값(activation)을 sparse한 feature로 분해한다. 저자들의 문제 제기:
"이 방법들이 쓰는 단순 함수는 원래 네트워크와 함수 형태가 다르다. 그래서 그들의 설명을 실제로 계산을 수행하는 대상 — 즉 네트워크의 파라미터와 비선형성 — 과 연결하기 어렵다."
파라미터 분해의 실질적 이점:
- 모델을 예측 가능하게 손으로 편집 가능 (capability를 직접 켜고 끄기)
- 분포(distribution)를 넘어 더 잘 일반화되는 설명
쉽게 말하면: activation 분석은 "이 사람이 지금 무슨 생각을 하나"를 보는 것이고, parameter 분석은 "이 사람의 뇌 회로가 어떻게 배선되어 있나"를 보는 것. 후자가 더 근본적이고, 배선을 직접 고칠 수 있다.
2. 핵심 방법 — VPD
2.1 목표 (분해가 만족해야 할 4가지)
가중치 행렬을 rank-1 벡터(subcomponent)들로 쪼개되:
- Parameter-faithful (파라미터 충실): 부품들을 다 더하면 원래 가중치가 됨
- Minimal (최소성): 입력 1개당 인과적으로 꼭 필요한 부품은 소수
- Mechanistically faithful (메커니즘 충실): 필요한 부품을 포함한 어떤 부분집합이라도 모델 출력을 재구성
- Simple (단순): 각 부품은 제한된 계산만 수행
2.2 Subcomponent 파라미터화 (rank-1 분해)
각 층의 가중치 행렬을 벡터들의 외적(outer product) 합으로 근사:
W^l ≈ Σ_c U^l_c · (V^l_c)^TU,V는 정규화 안 된 벡터 (각 c가 하나의 rank-1 부품)- 여러 head·뉴런에 걸친 superposition(중첩) 메커니즘도 표현 가능
쉽게 말하면: 큰 행렬 하나를, "방향 벡터 한 쌍"으로 된 얇은 조각 수천 개의 더미로 본다. 각 조각이 하나의 "기능 부품".
2.3 Delta component (잔차 부품)
부품 합만으로는 원래 가중치를 정확히 못 맞추므로, 차이를 잔차로 둔다:
Δ^l := W^l − Σ_c U^l_c (V^l_c)^T이 Δ는 부품이 놓친 부분을 담고, 작게 유지되도록 패널티를 받는다 (Delta-L2 loss). → 파라미터 충실성 보장.
2.4 Causal Importance(CI) 함수
별도의 작은 신경망
g가, 각 부품이 각 입력 토큰에서 얼마나 지워도 되는지(ablatable)를 예측:g^l_{b,t,c} ∈ [0, 1] (b=배치, t=위치, c=부품) 0 = 완전히 지워도 됨 (이 입력엔 불필요) 1 = 절대 못 지움 (이 입력에 인과적으로 필요)쉽게 말하면: "이 단어를 처리할 때, 이 부품이 꼭 필요해?"를 0~1로 매기는 게이트. 대부분 입력에서 대부분 부품은 0(불필요)이어야 sparse.
2.5 5개의 Loss — 특히 Adversarial이 핵심
Adversarial Reconstruction Loss ★ 이 논문의 핵심 혁신
ablation mask를 무작위로 뽑지 않고, PGD(투영 경사 하강)로 재구성 오차를 최대화하는 mask를 적대적으로 탐색한다 (CI 제약은 지키면서). 결과:"인과적으로 중요한 부품을 포함하는 모든 부분집합이 네트워크 출력을 계산하기에 충분하다."
쉽게 말하면: SPD는 "랜덤하게 부품 몇 개 꺼봤더니 그래도 잘 되네"였다. VPD는 "가장 나쁘게 꺼봐도(적이 골라서 꺼도) 필요한 부품만 살아있으면 잘 되네"를 강제한다. 훨씬 빡센 검증.
Stochastic Reconstruction Loss: 적대적 mask에만 과적합되지 않도록, 균등 무작위 mask도 함께 샘플링 (SPD 방식 보완)
Importance Minimality Loss (희소성):
L = (1/BT) Σ Σ |g^l_{b,t,c}|^pCI 값을 작게 → 입력당 활성 부품 수 최소화
Frequency Minimality Loss (feature splitting 방지):
L ∝ Σ |g_{b,t,c}|^p · log₂(1 + Σ |g_{b',t',c}|^p)너무 많은 고립된 예시에서 켜지는 부품을 패널티 → 하나의 기능이 여러 부품으로 쪼개지는 현상 방지
Delta-L2 Auxiliary Loss: 잔차 Δ를 작게 유지
2.6 SPD / APD 대비 개선점
항목 APD(2024) SPD(2025) VPD(2026) 마스킹 attribution 기반 stochastic(무작위) adversarial(PGD 적대적) feature splitting — 발생 frequency loss로 방지 부품 clustering 암묵적 암묵적 명시적 적용 규모 단일 층 단일 층 LM 전체(4층) 핵심: "SPD가 부분 ablation 공간에서 무작위 샘플을 쓰는 곳에서, VPD는 적대적으로 선택된 샘플을 쓴다."
3. 실험 셋업
대상 모델: 4층, 67M 파라미터 decoder-only transformer (The Pile 학습)
- residual stream 768차원, attention head 6개, context 512
- 임베딩 제외 가중치 행렬 24개
분해 결과 규모:
- 전체 rank-1 부품 38,912개
- "살아있는(alive, mean CI > 10⁻⁶)" 부품 약 10,000개
- 토큰당 평균 205개 부품 활성 → 2.1% sparsity
4. 주요 결과
4.1 재구성 품질
- Cross-entropy: 2.72–3.02 (target 2.71) — 거의 손실 없음
- 마스킹 없는 재구성이 "사전학습 compute의 82% 회복"
- adversarial 20 step 이하: KL 0.828 / 160 step 이상: KL > 25 (크게 무너짐)
- → 부분적 robustness가 오히려 바람직 (완전 robust면 너무 제약적)
4.2 transcoder(PLT/CLT) 대비 해석가능성
- 재구성-희소성 trade-off에서 VPD가 3개 지표 모두 우위
- feature splitting 없음: 총 용량(capacity)을 늘려도 alive 부품 수가 ~7,000으로 평평. (transcoder는 용량에 비례해 선형 증가 → 같은 기능이 자꾸 쪼개짐)
4.3 부품은 의미론적(semantic)이다 — 발견된 메커니즘 예시
- L1.Attn.q:308 — 존재/계사 동사("is", "was", "seems")에서 활성
- L1.Attn.k:485 — "there"/"it" 뒤 계사 동사 예측
- L1.Attn.k:218 — 대명사 "it"에서 발화
- L1.Attn.v:42 — 등위접속사("and", "or", "but")에서 활성
→ 각 부품이 "일관된 입력 범주"에 대응.
4.4 ★ Attention 계산은 여러 head에 걸쳐 분산됨
대부분의 QK 부품이 여러 attention head에 걸쳐 0이 아닌 norm을 가짐 (Fig 8). 즉 계산이 특정 head에 국소화되지 않고 분산.
분석된 3가지 attention 행동:
- 이전 토큰 이동: q:316 + k:329 (둘 다 96%+ 항상 활성, 가까운 offset에서 강하게 상호작용)
- 이전 구문 경계 이동: q:316 + k:119 (k:119는 구두점·괄호·줄바꿈에서 활성, head별로 다른 offset 담당)
- 존재구문 vs 가주어 탐지: q:308(계사) + k:218("it") / k:485("there") → "It is...", "There are..." 구문 탐지
4.5 Circuit 분석 — Attribution Graph
부품 간 정보 흐름을 추적하는 새 방법. stop-gradient로 직접 효과만 분리:
attr(c' → c) = (∂a_c / ∂a_{c'})* · a_{c'} · g_{c'} (* = source 외 노드의 gradient 정지)두 가지 pruning:
- Type 1: 특정 위치의 특정 토큰 예측에 관여하는 부품만
- Type 2: 특정 attention 행동에 관여하는 부품만
사례:
- 소유격 대명사 "her": 성별 정보가 임베딩→여러 층→대명사 예측으로 흐르는 전체 circuit
- 괄호 닫기: 괄호 종류를 인코딩한 부품이 층을 거쳐 짝 맞는 닫는 괄호 예측
5. 모델 편집 데모 (실용성 증명)
이모티콘 예측을 담당하는 부품을 손으로 다시 써서 모델 행동을 예측 가능하게 바꿈 (§6). → 해석을 넘어 실제 편집 가능성 입증.
6. 한계 (저자들이 인정한 것)
- Attribution graph ≠ computational graph: gradient는 국소·데이터 의존적이고 비선형 상호작용을 추상화함 → 국소 설명일 뿐 전역 계산 기술이 아님
- 부분적 adversarial robustness: 20 step엔 강하나 160+ step엔 무너짐 (메커니즘 중복 존재 추정)
- frequency minimality loss의 최적성 불확실: "계산 단순성을 위한 여러 방법 중 하나일 뿐"
- 작은 모델 규모: 67M은 현 기준 소형. 수십억 파라미터 확장은 미검증
- MLP 비선형 상호작용이 단순·가산적이라 보장 안 됨 (예비 분석은 비교적 단순)
- 완전한 메커니즘 충실성은 주장 안 함 — 이해를 향한 한 걸음
7. 기여 요약
- Scaling: 파라미터 분해를 (단일 층 아닌) LM 전체에 첫 적용
- Robustness: adversarial 마스킹으로 더 빡센 메커니즘 충실성 기준
- No feature splitting: "모든 조합에서 ablation" 요구로 병리적 쪼개짐 회피
- Cross-head: attention 계산이 여러 head에 걸쳐 자연 분해됨을 입증
- Attribution 방법론: 층 간 부품 정보 흐름 추적 프레임워크
- 재현성: 코드 공개
8. 결론 & 향후
파라미터 분해를 activation 기반 방법의 보완재로 위치. "네트워크 행동의 더 짧고 메커니즘적으로 충실한 설명을 제공하며, 이것이 더 전역적인 설명으로 적절히 합쳐져야 한다."
향후: 더 큰 모델로 확장 / 비선형 부품 상호작용 규명 / virtual attention head·층간 circuit 조사 / 전역적 상호작용 강도 지표 / 분포 일반화 예측 검증.
총평: 언어모델은 의외로 해석 가능한 모듈식 메커니즘을 파라미터에 학습하며, 그 계산은 개별 뉴런·head에 국소화되기보다 분산되어 있다.
9. (보너스) 내 NLCST scale-up merging 연구와의 연결
- CI 함수 = 원리적 magnitude 게이트: NLCST의 손튜닝 α(=0.2)를, 입력별·부품별 학습 게이트로 대체 가능
- adversarial faithfulness = SGDT SVD shrinkage의 정밀판: "노이즈=작은 특이값"이 아니라 "인과적으로 불필요한 부품"을 기준으로 δ를 게이팅
- feature-splitting 없는 분해 = multi-domain 합성 근거: Korean ⊥ Medical(cos 0.034)을 cosine 측정이 아니라 부품 집합 합집합으로 격상
- go/no-go 게이트: 1B Korean δ가 sparse하게 분해되는지가 모든 확장의 전제. 안 되면 "한국어 능력이 diffuse → NLCST gain이 bounded인 이유"의 음성 증명
단, 67M 언어전용 → 1B 멀티모달은 미검증 도약. 한 레이어 MLP smoke run으로 먼저 곡선을 봐야 함.
반응형'논문 리뷰' 카테고리의 다른 글